خدمات وب آمازون Amazon Bedrock AgentCore Evaluations را راه‌اندازی کرده است، قابلیت جدیدی که عوامل هوش مصنوعی ساخته شده با هر چارچوب اصلی - نه فقط ابزار خود AWS - را با در نظر گرفتن ردیابی OpenTelemetry به عنوان یک رابط جهانی برای ارزیابی امتیاز می‌دهد. این اعلامیه در یک پست وبلاگ یادگیری ماشین AWS منتشر شد که در 26 اوت توسط Swarnim Singhal، Bharathi Srinivasan و Renya Kujirada منتشر شد.

این طرح به آن چیزی می‌پردازد که AWS آن را عدم تقارن ناامیدکننده در کار هوش مصنوعی تولیدی می‌نامد: تنوع چارچوب‌های عامل همچنان در حال رشد است در حالی که ابزار ارزیابی همگام نبوده است. برای همگام شدن با [چرخه اخبار صنعت هوش مصنوعی] (https://aibuzzwire.news)، تیم‌ها اکنون به طور معمول ابزارها را با هم ترکیب و تطبیق می‌دهند - دقیقاً جایی که خطوط لوله ارزیابی سنتی از هم می‌پاشد.

مشکل تکه تکه شدن

همانطور که تیم AWS آن را چارچوب بندی می کند، اکثر سیستم های ارزیابی فرض می کنند که شما عامل خود را به روشی خاص ساخته اید: یک SDK خاص، یک کلاینت مدل زبان بزرگ خاص، یک الگوی ردیابی خاص. از آن منطقه سازگاری باریک خارج شوید و خط لوله ارزیابی شکسته می شود.

پشته های دنیای واقعی به ندرت در یک خط فروشنده باقی می مانند. در حساب پست وبلاگ، تیم‌ها بر روی LangGraph برای هماهنگی گردش کار، LlamaIndex برای ادغام خط لوله بازیابی دقیق، و زمانی که سازمانی مدل‌های GPT را استاندارد می‌کند، بر روی OpenAI Agents SDK ایجاد می‌کنند. آنها از Google ADK برای هماهنگی چند عاملی یا Claude Agent SDK برای قابلیت Anthropic بومی استفاده می‌کنند، و زمانی به Strands Agents دسترسی پیدا می‌کنند که حلقه مدل‌محور آن می‌تواند عاملی را به جای چند روز در Amazon Bedrock AgentCore اجرا کند.

هر یک از این چارچوب‌ها نمایش داخلی خود را از کاری که یک عامل انجام می‌دهد تولید می‌کند - فراخوانی ابزار، بازیابی، انتقال بین عوامل فرعی. از نظر تاریخی، ارزیابی آنها به معنای بازسازی ابزار دقیق برای هر یک یا پذیرش این بود که برخی از چارچوب ها به سادگی نمی توانند درجه بندی شوند.

چگونه کار می کند: تله متری روی کوپلینگ محکم

AgentCore Evaluations تلاش می‌کند تا با انتخاب رابطی که هر چهارچوب اصلی از قبل صحبت می‌کند، این جفت را از بین ببرد. تقریباً همه آنها از OpenTelemetry، به صورت بومی یا از طریق کتابخانه‌های ابزار دقیق جامعه پشتیبانی می‌کنند - استانداردی که ابزارهای مشاهده‌پذیری ابر و برنامه‌های کاربردی سال‌ها پیش با آن همگرا شدند.

منطق ساده است: تا زمانی که تله متری یک عامل از طریق OpenTelemetry جریان می یابد، سرویس ارزیابی می تواند آن را بدون توجه به SDK که در زیر آن قرار دارد، امتیاز دهد. پست وبلاگ در مورد اینکه سرویس چه تله متری را می خواند، چگونه تصمیم می گیرد که چگونه گستره ها را تفسیر کند، کدام ویژگی ها داده های ارزیابی را حمل می کنند و چگونه پوشش به چارچوب هایی فراتر از فهرست نامگذاری شده AWS گسترش می یابد - به طور موثر قالب را به جای چارچوب، قرارداد می سازد.

برای سازمان های مهندسی، این ارزیابی به جای ساخت هر پروژه، به تصمیم زیرساختی تبدیل می شود. یک نماینده که در روز ارسال آن درجه بندی می شود، می تواند با معیارهای مشابهی مقایسه شود، چه نویسندگان آن آن را در LangGraph نوشته باشند یا در Claude Agent SDK.

جایی که در AgentCore جا می شود

ارزیابی‌ها وارد پلتفرم گسترده‌تر Amazon Bedrock AgentCore می‌شوند، که زمان اجرای آن از قبل میزبانی، مقیاس‌بندی، حافظه و توسعه‌دهندگان زیرساخت مشاهده‌پذیری را در غیر این صورت برای هر پروژه بازسازی می‌کنند. با افزودن ارزیابی به همان سطح، AWS در حال جمع‌آوری چیزی است که یک چرخه عمر کامل برای عوامل است: آنها را در زمان اجرا مستقر کنید، آنها را از طریق قابلیت مشاهده داخلی تماشا کنید، و اکنون آنها را با معیارهای ثابت بدون خروج از پلت فرم اندازه‌گیری کنید.

زمان بندی اتفاقی نیست. در سرتاسر صنعت، پرسش‌هایی در مورد اینکه آیا نمایندگان واقعاً مطابق با هدف رفتار می‌کنند، از نگرانی‌های آکادمیک به ریسک سطح هیئت مدیره منتقل شده‌اند، به دنبال اپیزودهای برجسته‌ای مانند رفتار نادرست هماهنگ مستند شده در تحقیقات نقض صورت در آغوش گرفتن و شواهد روبه‌افزونی مبنی بر اینکه معیارها به تنهایی تصویری ناقص از قابلیت اطمینان نماینده ارائه می‌دهند. ابزاری که باعث می شود ارزیابی مستمر، ارزان و مستقل از چارچوب باشد، مستقیماً با این اضطراب صحبت می کند.

چرا مهم است

ارزیابی بی سر و صدا به گلوگاه پذیرش نماینده سازمانی تبدیل شده است. سرعت توسعه دیگر محدودیت نیست - محدودیت اعتماد است: دانستن اینکه عاملی که به مشتریان پاسخ می‌دهد، داده‌ها را جابجا می‌کند یا جریان‌های کاری را اجرا می‌کند، این کار را در شرایطی که هیچ‌کس به‌صورت جداگانه آزمایش نکرده است، به درستی انجام می‌دهد.

با تثبیت ارزیابی به OpenTelemetry به جای هر SDK واحد، AWS شرط می‌بندد که اجماع مشاهده‌پذیری صنعت می‌تواند به عنوان لایه تضمین کیفیت آن دو برابر شود. اینکه آیا رقبا با امتیازدهی مشابه چارچوب-اگنوستیک دنبال می‌کنند، می‌تواند در مورد اینکه هوش مصنوعی عاملی چقدر سریع از دموها به زیرساخت‌های قابل اعتماد تبدیل می‌شود، چیزهای زیادی می‌گوید.

برای تیم هایی که ناوگان ناهمگن را اداره می کنند، مفهوم عملی قابل مقایسه است. هنگامی که هر عاملی در قالب تله متری یکسان گزارش می دهد، کیفیت به چیزی تبدیل می شود که یک سازمان می تواند در طول زمان و در بین تیم ها به جای استخراج مجدد در هر پروژه - پیش شرطی برای هر چیزی شبیه بلوغ عملیاتی در سیستم های عامل باشد. برای شرکت‌هایی که عمیقاً در پشته‌های ترکیبی LangGraph-LlamaIndex هستند، یا صرفاً مراقب بازنویسی ابزار دقیق هر زمان که چارچوب بهتری ظاهر می‌شود، اکنون یک گزینه شخص اول از ارائه‌دهنده ابری آنها وجود دارد که از آنها نمی‌خواهد طرف‌هایی را انتخاب کنند.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →