قام باحثو Nvidia ببناء نظام وكيل دفع Anthropic’s Claude Opus 5 إلى درجة مثالية بنسبة 100% على ARC-AGI-3، وهو أحد معايير الاستدلال التفاعلي الأكثر تطلبًا في الذكاء الاصطناعي - باستخدام نفس النموذج الذي يسجل 30% عندما يعمل بمفرده. النتيجة، التي نُشرت يوم الجمعة على مدونة Nvidia Technical Blog، هي أقوى دليل حتى الآن على أن البرنامج الملتف حول نموذج حدودي لا يقل أهمية عن النموذج نفسه. بالنسبة لأي شخص يتتبع [أحدث تطورات الذكاء الاصطناعي] (https://aibuzzwire.news)، فإنه يمثل تحولًا في المكان الذي توجد فيه الميزة التنافسية في الذكاء الاصطناعي الوكيل فعليًا.
يُطلق على النظام اسم AVO، وهو اختصار لمشغلي التباين Agentic Variation Operators، وهو عبارة عن بنية Nvidia للأغراض العامة للوكلاء المستقلين طويلي الأفق - الذكاء الاصطناعي الذي يمكنه البقاء في المهمة لساعات أو أيام بدلاً من الاستجابة لمطالبة واحدة. في المجموعة العامة ARC-AGI-3، سجلت AVO نتيجة 100.00 RHAE عبر جميع بيئات اللعبة الـ 25، وأكملت جميع المستويات الـ 183 في 6624 إجراءً بيئيًا باستخدام Claude Opus 5 كنموذج خلفي لها.
ما الذي تم اختباره فعليًا بواسطة ARC-AGI-3
ARC-AGI-3 هو معيار استدلالي تفاعلي أنشأته مؤسسة جائزة ARC. يتم إسقاط العميل في بيئات غير مألوفة تشبه الألعاب بدون تعليمات أو قواعد محددة أو هدف محدد. يجب أن يستكشف من خلال التجربة والخطأ، ويستنتج كيفية عمل البيئة، ويكتشف معنى "الفوز"، ثم يتصرف بكفاءة كافية للتقدم عبر المستويات الأصعب تدريجيًا.
يجمع مقياس تسجيل النقاط، كفاءة العمل البشري النسبية (RHAE)، بين إكمال المهام وعدد الإجراءات القليلة التي يهدرها العميل مقارنة باللاعبين البشريين لأول مرة. وهذا ما يجعله اختبارًا قاسيًا للاستقلالية المستدامة: يجب على الوكيل أن يتذكر ما تعلمه، وأن يتعافى من الأخطاء، وأن يضع ميزانية لأفعاله بعناية على مدار الجولة بأكملها.
يكتسب الرقم الرئيسي لـ Nvidia السياق من المقارنة. VISTA، وهو نظام سابق للتفاعل المباشر استخدم أيضًا Claude Opus 5، أكمل نفس المستويات العامة البالغ عددها 183 في 7,542 إجراءً بيئيًا. احتاج AVO إلى إجراءات أقل بنسبة 12% تقريبًا لإنهاء المهمة، وفقًا لمنشور مدونة Nvidia.
من نواة GPU إلى الألعاب غير المعروفة
لم يتم تصميم AVO للألغاز. أظهرت Nvidia لأول مرة بنية تحسين GPU-kernel، وهو مجال حيث يمكن لتغييرات التعليمات البرمجية الصغيرة أن تؤدي إلى انتهاك الصحة وسلوك الذاكرة والإنتاجية بطرق غير متوقعة. في إحدى دراسات نواة الاهتمام، تم تشغيل AVO بشكل مستمر لمدة سبعة أيام، واستكشف أكثر من 500 اتجاه تحسين، وخصص 40 إصدارًا للنواة. في أنظمة NVIDIA DGX B200، تفوقت نواة الانتباه متعددة الرؤوس الناتجة على cuDNN بنسبة تصل إلى 3.5% وFlashAttention-4 بنسبة تصل إلى 10.5%. قام الوكيل بعد ذلك بتكييف النواة المتطورة الخاصة به مع الاهتمام بالاستعلام المجمع في حوالي 30 دقيقة من العمل المستقل الإضافي.
تم بعد ذلك توجيه نفس الحلقة الأساسية - الفحص والتخطيط والتنفيذ والاختبار والتقييم - إلى ARC-AGI-3 مع تغيير واجهة المهمة فقط. تم ترحيل آليتين. الأول هو الذاكرة الدائمة، التي تخزن التطبيقات السابقة، ونتائج التقييم، ومخرجات المترجم ومعرف التعريف، والتفكير المتراكم، بحيث يمكن للوكيل الاستئناف من حالته الحالية بدلاً من إعادة بناء السياق من البداية. والثاني هو المشرف، وهو الوكيل الثاني الذي يراقب المسار العام ويتدخل عندما يتوقف التقدم.
المشرف هو الاختراق
وسلط موقع TechCrunch، الذي أجرى مقابلة مع عادل الحلاق، نائب رئيس المنتجات في وحدة الذكاء الاصطناعي بالشركة، الضوء على المشرف باعتباره العنصر الأكثر أهمية. وقال الحلاق للصحيفة: "إنه يتصرف تقريبًا مثل الرئيس التنفيذي لدفع العميل عندما يخرج عن الاتجاه أو يبدأ في استكشاف مسار قد يؤدي إلى طريق مسدود، أو إعادة استكشاف المسار الذي سلكه سابقًا".
فجوة الأداء صارخة. وجد اختبار Nvidia أن Claude Opus 5 بدون حزام متطور حقق نتيجة 30% على ARC-AGI-3 - وهي أفضل نتيجة بين النماذج المجردة التي تم اختبارها، ولكنها لم تقترب من التشغيل الكامل. سجلت نماذج OpenAI أقل من 10% في المعيار، ونشرت الشركة بحثها الخاص الشهر الماضي والذي أظهر أن التغيير والتبديل في إعدادين فقط من إعدادات الحزام أدى إلى مضاعفة نتائجها ثلاث مرات. لم يقترب أي تكوين للطراز فقط من نسبة 100% التي حققتها AVO.
ومن الجدير بالذكر أن تكوين AVO تم تشغيله بطريقة نصية فقط: تم توفير كل ملاحظة كشبكة نصية مقاس 64 × 64 بالضبط، مع عدم إرسال صور أو رموز صور إلى النموذج. جاءت قوة الاستدلال من الحلقة المحيطة بالنموذج، وليس من الإدراك متعدد الوسائط.
لماذا تراهن الصناعة على الأحزمة
يأتي هذا الاكتشاف وسط موجة من الأدلة التي تشير إلى أن البنية التحتية للوكيل، وليس القدرة النموذجية الأولية، هي عنق الزجاجة الحالي للذكاء الاصطناعي المستقل. نشرت شركة Databricks بحثًا مرجعيًا في يوليو يوضح أن الحزام يؤثر بشكل كبير على الأداء والتكلفة. وقال علي قدسي، الرئيس التنفيذي لشركة Databricks، لـ TechCrunch: "يمكنك اختيار نفس النموذج ولكن مع أدوات مختلفة، وستحصل على تكلفة أكبر بكثير إذا استخدمت أداة خاطئة". "وهذا في حد ذاته يمكن أن يضاعف تكلفتك."
قام الحلاق بصياغة حجة إنفيديا الأوسع فيما يتعلق بالانفتاح. وقال: "نحن نؤمن بأن وجود مكدس وكيل مفتوح - حيث يمكنك التحكم عبر الحزام، وعبر البنية التحتية، وعبر وقت التشغيل - هو ما هو مطلوب بالنسبة لنا لدفع النظام البيئي إلى الأمام وبشكل آمن". تمتلك Nvidia قطعًا مفتوحة الحجم من تكنولوجيا التسخير تحت علامتها التجارية NeMo، وقد تم توثيق بحث AVO في ورقة بحثية على arXiv.
معيار له تاريخ
أصبح ARC-AGI-3 نقطة اشتعال في التنافس بين المختبرات الحدودية. حصلت OpenAI سابقًا على نتائج قوية لنموذج GPT-5.6 Sol الخاص بها على المعيار، مما أدى إلى التدقيق في إعدادات التقييم المستخدمة. تتجنب نتيجة Nvidia هذا الجدل من ناحية - فهي لا تدعي نموذجًا أكثر ذكاءً، بل وكيلًا أفضل تصميمًا حول نموذج موجود.
إن الرسالة الموجهة إلى المطورين والشركات التي تبني منتجات وكيلة هي رسالة مباشرة: لا يزال اختيار النموذج مهمًا، ولكن تصميم النظام الآن هو الذي يقرر ما إذا كان النموذج الحدودي سيحقق نتائج حدودية. وكما تقول إنفيديا، فإن تقييم النموذج ليس مثل تقييم الوكيل - والجداول القياسية لعام 2026 تكافئ بشكل متزايد المهندسين الذين يقومون ببناء السقالات.
ابق في صدارة الذكاء الاصطناعي
تتحرك بنيات الوكلاء بشكل أسرع من أي وقت مضى، ويتم الآن قياس الفجوة بين الأدوات الجيدة والأدوات السيئة بالنقاط المعيارية وبالدولار الحقيقي. تابع AI Buzz Wire للحصول على تغطية يومية معتمدة من المصدر لأبحاث الذكاء الاصطناعي ومعاييره وإطلاق المنتجات.
اقرأ المزيد من أخبار أبحاث الذكاء الاصطناعي →