خدمات وب آمازون Amazon Bedrock AgentCore Evaluations را راهاندازی کرده است، قابلیت جدیدی که عوامل هوش مصنوعی ساخته شده با هر چارچوب اصلی - نه فقط ابزار خود AWS - را با در نظر گرفتن ردیابی OpenTelemetry به عنوان یک رابط جهانی برای ارزیابی امتیاز میدهد. این اعلامیه در یک پست وبلاگ یادگیری ماشین AWS منتشر شد که در 26 اوت توسط Swarnim Singhal، Bharathi Srinivasan و Renya Kujirada منتشر شد.
این طرح به آن چیزی میپردازد که AWS آن را عدم تقارن ناامیدکننده در کار هوش مصنوعی تولیدی مینامد: تنوع چارچوبهای عامل همچنان در حال رشد است در حالی که ابزار ارزیابی همگام نبوده است. برای همگام شدن با [چرخه اخبار صنعت هوش مصنوعی] (https://aibuzzwire.news)، تیمها اکنون به طور معمول ابزارها را با هم ترکیب و تطبیق میدهند - دقیقاً جایی که خطوط لوله ارزیابی سنتی از هم میپاشد.
مشکل تکه تکه شدن
همانطور که تیم AWS آن را چارچوب بندی می کند، اکثر سیستم های ارزیابی فرض می کنند که شما عامل خود را به روشی خاص ساخته اید: یک SDK خاص، یک کلاینت مدل زبان بزرگ خاص، یک الگوی ردیابی خاص. از آن منطقه سازگاری باریک خارج شوید و خط لوله ارزیابی شکسته می شود.
پشته های دنیای واقعی به ندرت در یک خط فروشنده باقی می مانند. در حساب پست وبلاگ، تیمها بر روی LangGraph برای هماهنگی گردش کار، LlamaIndex برای ادغام خط لوله بازیابی دقیق، و زمانی که سازمانی مدلهای GPT را استاندارد میکند، بر روی OpenAI Agents SDK ایجاد میکنند. آنها از Google ADK برای هماهنگی چند عاملی یا Claude Agent SDK برای قابلیت Anthropic بومی استفاده میکنند، و زمانی به Strands Agents دسترسی پیدا میکنند که حلقه مدلمحور آن میتواند عاملی را به جای چند روز در Amazon Bedrock AgentCore اجرا کند.
هر یک از این چارچوبها نمایش داخلی خود را از کاری که یک عامل انجام میدهد تولید میکند - فراخوانی ابزار، بازیابی، انتقال بین عوامل فرعی. از نظر تاریخی، ارزیابی آنها به معنای بازسازی ابزار دقیق برای هر یک یا پذیرش این بود که برخی از چارچوب ها به سادگی نمی توانند درجه بندی شوند.
چگونه کار می کند: تله متری روی کوپلینگ محکم
AgentCore Evaluations تلاش میکند تا با انتخاب رابطی که هر چهارچوب اصلی از قبل صحبت میکند، این جفت را از بین ببرد. تقریباً همه آنها از OpenTelemetry، به صورت بومی یا از طریق کتابخانههای ابزار دقیق جامعه پشتیبانی میکنند - استانداردی که ابزارهای مشاهدهپذیری ابر و برنامههای کاربردی سالها پیش با آن همگرا شدند.
منطق ساده است: تا زمانی که تله متری یک عامل از طریق OpenTelemetry جریان می یابد، سرویس ارزیابی می تواند آن را بدون توجه به SDK که در زیر آن قرار دارد، امتیاز دهد. پست وبلاگ در مورد اینکه سرویس چه تله متری را می خواند، چگونه تصمیم می گیرد که چگونه گستره ها را تفسیر کند، کدام ویژگی ها داده های ارزیابی را حمل می کنند و چگونه پوشش به چارچوب هایی فراتر از فهرست نامگذاری شده AWS گسترش می یابد - به طور موثر قالب را به جای چارچوب، قرارداد می سازد.
برای سازمان های مهندسی، این ارزیابی به جای ساخت هر پروژه، به تصمیم زیرساختی تبدیل می شود. یک نماینده که در روز ارسال آن درجه بندی می شود، می تواند با معیارهای مشابهی مقایسه شود، چه نویسندگان آن آن را در LangGraph نوشته باشند یا در Claude Agent SDK.
جایی که در AgentCore جا می شود
ارزیابیها وارد پلتفرم گستردهتر Amazon Bedrock AgentCore میشوند، که زمان اجرای آن از قبل میزبانی، مقیاسبندی، حافظه و توسعهدهندگان زیرساخت مشاهدهپذیری را در غیر این صورت برای هر پروژه بازسازی میکنند. با افزودن ارزیابی به همان سطح، AWS در حال جمعآوری چیزی است که یک چرخه عمر کامل برای عوامل است: آنها را در زمان اجرا مستقر کنید، آنها را از طریق قابلیت مشاهده داخلی تماشا کنید، و اکنون آنها را با معیارهای ثابت بدون خروج از پلت فرم اندازهگیری کنید.
زمان بندی اتفاقی نیست. در سرتاسر صنعت، پرسشهایی در مورد اینکه آیا نمایندگان واقعاً مطابق با هدف رفتار میکنند، از نگرانیهای آکادمیک به ریسک سطح هیئت مدیره منتقل شدهاند، به دنبال اپیزودهای برجستهای مانند رفتار نادرست هماهنگ مستند شده در تحقیقات نقض صورت در آغوش گرفتن و شواهد روبهافزونی مبنی بر اینکه معیارها به تنهایی تصویری ناقص از قابلیت اطمینان نماینده ارائه میدهند. ابزاری که باعث می شود ارزیابی مستمر، ارزان و مستقل از چارچوب باشد، مستقیماً با این اضطراب صحبت می کند.
چرا مهم است
ارزیابی بی سر و صدا به گلوگاه پذیرش نماینده سازمانی تبدیل شده است. سرعت توسعه دیگر محدودیت نیست - محدودیت اعتماد است: دانستن اینکه عاملی که به مشتریان پاسخ میدهد، دادهها را جابجا میکند یا جریانهای کاری را اجرا میکند، این کار را در شرایطی که هیچکس بهصورت جداگانه آزمایش نکرده است، به درستی انجام میدهد.
با تثبیت ارزیابی به OpenTelemetry به جای هر SDK واحد، AWS شرط میبندد که اجماع مشاهدهپذیری صنعت میتواند به عنوان لایه تضمین کیفیت آن دو برابر شود. اینکه آیا رقبا با امتیازدهی مشابه چارچوب-اگنوستیک دنبال میکنند، میتواند در مورد اینکه هوش مصنوعی عاملی چقدر سریع از دموها به زیرساختهای قابل اعتماد تبدیل میشود، چیزهای زیادی میگوید.
برای تیم هایی که ناوگان ناهمگن را اداره می کنند، مفهوم عملی قابل مقایسه است. هنگامی که هر عاملی در قالب تله متری یکسان گزارش می دهد، کیفیت به چیزی تبدیل می شود که یک سازمان می تواند در طول زمان و در بین تیم ها به جای استخراج مجدد در هر پروژه - پیش شرطی برای هر چیزی شبیه بلوغ عملیاتی در سیستم های عامل باشد. برای شرکتهایی که عمیقاً در پشتههای ترکیبی LangGraph-LlamaIndex هستند، یا صرفاً مراقب بازنویسی ابزار دقیق هر زمان که چارچوب بهتری ظاهر میشود، اکنون یک گزینه شخص اول از ارائهدهنده ابری آنها وجود دارد که از آنها نمیخواهد طرفهایی را انتخاب کنند.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →