أطلقت Amazon Web Services تقييمات Amazon Bedrock AgentCore، وهي قدرة جديدة تسجل وكلاء الذكاء الاصطناعي المبنيين باستخدام أي إطار عمل رئيسي - وليس فقط أدوات AWS الخاصة - من خلال التعامل مع تتبعات OpenTelemetry كواجهة عالمية للتقييم. جاء هذا الإعلان في منشور على مدونة التعلم الآلي لـ AWS تم نشره في 26 أغسطس بواسطة Swarnim Singhal وBharathi Srinivasan وRenya Kujirada.
يتناول العرض التقديمي ما تسميه AWS عدم التماثل المحبط في عمل الذكاء الاصطناعي الإنتاجي: يستمر تنوع أطر عمل الوكلاء في النمو بينما لا تواكب أدوات التقييم الوتيرة. لمواكبة [دورة أخبار صناعة الذكاء الاصطناعي] الأوسع نطاقًا (https://aibuzzwire.news)، تقوم الفرق الآن بخلط الأدوات ومطابقتها بشكل روتيني - وهذا هو بالضبط المكان الذي تنهار فيه مسارات التقييم التقليدية.
مشكلة التجزئة
أثناء قيام فريق AWS بصياغة الأمر، تفترض معظم أنظمة التقييم أنك قمت ببناء وكيلك بطريقة محددة: SDK محدد، وعميل نموذج لغة كبير محدد، ونمط تتبع محدد. اخرج من منطقة التوافق الضيقة هذه وسينقطع مسار التقييم.
نادرًا ما تبقى الأكوام في العالم الحقيقي داخل حارة بائع واحد. في حساب منشور المدونة، تعتمد الفرق على LangGraph لتنسيق سير العمل، وعلى LlamaIndex لتكامل خطوط الاسترجاع الدقيقة، وعلى OpenAI Agents SDK عندما تقوم مؤسسة بتوحيد معايير نماذج GPT. يستخدمون Google ADK للتنسيق بين الوكلاء المتعددين أو Claude Agent SDK للقدرات البشرية الأصلية، ويصلون إلى Strands Agents عندما تتمكن الحلقة المستندة إلى النموذج من تشغيل وكيل عامل على Amazon Bedrock AgentCore في دقائق بدلاً من أيام.
يقوم كل إطار من هذه الأطر بإنشاء تمثيل داخلي خاص به لما فعله الوكيل - استدعاءات الأدوات، وعمليات الاسترجاع، وعمليات التسليم بين الوكلاء الفرعيين. تاريخيًا، كان تقييمها يعني إعادة بناء الأجهزة لكل واحدة منها، أو قبول حقيقة مفادها أن بعض الأطر لا يمكن تصنيفها على الإطلاق.
كيف يعمل: القياس عن بعد عبر أدوات التوصيل الضيقة
تحاول تقييمات AgentCore حل هذا الاقتران عن طريق اختيار واجهة يتحدث عنها كل إطار رئيسي بالفعل. تدعم جميعها تقريبًا OpenTelemetry، إما محليًا أو من خلال مكتبات أدوات المجتمع - وهو المعيار الفعلي الذي تقاربت عليه أدوات مراقبة السحابة والتطبيقات منذ سنوات.
المنطق واضح ومباشر: طالما أن القياس عن بعد الخاص بالوكيل يتدفق عبر OpenTelemetry، يمكن لخدمة التقييم تسجيله، بغض النظر عن SDK الموجود أسفله. تتناول مشاركة المدونة ما تقرأه الخدمة عن بعد، وكيف تقرر كيفية تفسير الامتدادات، والسمات التي تحمل بيانات التقييم، وكيف تمتد التغطية إلى أطر عمل تتجاوز قائمة AWS المسماة - مما يجعل التنسيق، وليس إطار العمل، هو العقد بشكل فعال.
بالنسبة للمؤسسات الهندسية، يؤدي هذا إلى تحويل التقييم إلى قرار يتعلق بالبنية التحتية بدلاً من البناء لكل مشروع. يمكن مقارنة الوكيل الذي تم تصنيفه في يوم شحنه بنفس المقاييس سواء كتبه مؤلفوه في LangGraph أو Claude Agent SDK.
المكان المناسب في AgentCore
يتم إدخال التقييمات في النظام الأساسي الأوسع لـ Amazon Bedrock AgentCore، والذي يتعامل وقت تشغيله بالفعل مع الاستضافة والقياس والذاكرة وقابلية المراقبة التي قد يقوم مطورو البنية التحتية بإعادة بنائها لكل مشروع. مع إضافة التقييم إلى نفس السطح، تقوم AWS بتجميع ما يرقى إلى دورة حياة كاملة للوكلاء: نشرهم في وقت التشغيل، ومراقبتهم من خلال إمكانية المراقبة المضمنة، وقياسهم الآن وفقًا لمعايير متسقة دون مغادرة النظام الأساسي.
التوقيت ليس عرضيا. في جميع أنحاء الصناعة، انتقلت الأسئلة حول ما إذا كان الوكلاء يتصرفون بالفعل على النحو المنشود من الاهتمام الأكاديمي إلى المخاطر على مستوى مجلس الإدارة، في أعقاب الأحداث البارزة مثل سوء السلوك المنسق الموثق في التحقيق في انتهاك Hugging Face والأدلة المتزايدة على أن المعايير وحدها ترسم صورة غير كاملة لموثوقية الوكيل. إن الأدوات التي تجعل التقييم مستمرًا ورخيصًا ومستقلًا عن إطار العمل تتحدث بشكل مباشر عن هذا القلق.
لماذا يهم
لقد أصبح التقييم بهدوء عنق الزجاجة في اعتماد وكيل المؤسسة. لم تعد سرعة التطوير هي القيد - بل القيد هو الثقة: معرفة أن الوكيل الذي يجيب على العملاء أو ينقل البيانات أو ينفذ سير العمل سوف يفعل ذلك بشكل صحيح في ظل ظروف لم يتم اختبارها بشكل فردي.
من خلال ربط التقييم بـ OpenTelemetry بدلاً من أي SDK واحد، تراهن AWS على أن إجماع إمكانية المراقبة في الصناعة يمكن أن يتضاعف كطبقة ضمان الجودة. إن ما إذا كان المنافسون يتبعون نظامًا مكافئًا للتقييم غير المرتبط بإطار العمل سيخبرنا كثيرًا عن مدى سرعة نضوج الذكاء الاصطناعي الوكيل من العروض التوضيحية إلى بنية تحتية يمكن الاعتماد عليها.
بالنسبة للفرق التي تدير أساطيل غير متجانسة، فإن المعنى العملي هو إمكانية المقارنة. عندما يقدم كل وكيل تقاريره بنفس تنسيق القياس عن بعد، تصبح الجودة شيئًا يمكن للمؤسسة تتبعه بمرور الوقت وعبر الفرق بدلاً من إعادة الاشتقاق لكل مشروع - وهو شرط مسبق لأي شيء يشبه النضج التشغيلي في الأنظمة الوكيلة. بالنسبة للمؤسسات العميقة في مجموعات LangGraph-LlamaIndex الهجينة، أو التي تشعر بالقلق ببساطة من إعادة كتابة الأجهزة كلما ظهر إطار عمل أفضل، يوجد الآن خيار الطرف الأول من مزود السحابة الخاص بهم والذي لا يطلب منهم اختيار جانب ما.
---
ابقَ في طليعة الذكاء الاصطناعياحصل على آخر الأخبار والتحليلات والإنجازات في مجال الذكاء الاصطناعي — كل ذلك في مكان واحد.
اقرأ المزيد من أخبار الذكاء الاصطناعي →