تتراجع OpenAI بعد أن سيطر Claude Opus 5 من Anthropic على معيار ARC-AGI-3، حيث تنشر النتائج التي تظهر أن نموذج GPT-5.6 Sol الخاص بها يصل إلى 38.3 بالمائة - بشرط استخدام إعدادات OpenAI المفضلة بدلاً من أداة الاختبار الرسمية.

النزاع، الذي اندلع في 30 يوليو 2026، يمس جوهر مشكلة متنامية في تقييم الذكاء الاصطناعي: لم تعد المعايير تقيس مجرد نموذج، بل تلتف حوله السقالة التقنية بأكملها. للحصول على تحليل أعمق لـ [أحدث تطورات الذكاء الاصطناعي] (https://aibuzzwire.news) وإصدارات النماذج، تتتبع AI Buzz Wire القصة.

الأرقام والصيد

ذكرت OpenAI أن GPT-5.6 Sol يصل إلى 38.3 بالمائة على ARC-AGI-3، متجاوزًا Anthropic's Claude Opus 5، الذي سجل 30.2 بالمائة بعد أن ضاعف الرقم القياسي القياسي أربع مرات في السابق. التحذير مهم: يعتمد رقم 38.3 بالمائة على ميزتين محددتين لواجهة برمجة تطبيقات الاستجابة الخاصة بـ OpenAI.

الأول هو الاستدلال المحتفظ به، والذي يحافظ على سلسلة أفكار النموذج بين الخطوات بدلاً من التخلص منها بعد كل إجراء. والثاني هو الضغط، الذي يلخص السياق القديم بدلاً من اقتطاعه، مما يسمح للنموذج بمواصلة العمل على المسائل الطويلة دون فقدان المنطق السابق.

من خلال تشغيل الحزام الموحد الرسمي لجائزة ARC - والذي يتجنب عمدًا الإعدادات الخاصة بالمزود لضمان إجراء مقارنات من تفاح إلى تفاح - تمكن GPT-5.6 Sol من تحقيق 7.8 بالمائة فقط. السبب، كما يقول OpenAI، هو أن الإعداد الرسمي يتجاهل منطق النموذج بعد كل خطوة، مما يؤدي إلى إضعاف الأداء في المهام التي تتطلب تفكيرًا مستدامًا متعدد الخطوات.

معيار مصمم للنقاء

تم تصميم ARC-AGI-3 بواسطة فرانسوا شوليه وفريق جائزة ARC لاستكشاف قدرة النموذج على حل ألغاز تفكير جديدة لم يسبق له رؤيتها من قبل - وهو اختبار للذكاء العام بدلاً من المعرفة المحفوظة. للحفاظ على عدالة المقارنات، يقوم الحزام الرسمي بإزالة الميزات الخاصة بمزود الخدمة عن عمد، وقياس قدرة النموذج الأولي في بيئة محايدة.

والحجة المضادة لشركة OpenAI هي أن هذا الحياد يمكن أن يصبح عائقًا. تدعي الشركة أن الأداة الرسمية اعتمدت على "واجهة برمجة تطبيقات إكمال نمط OpenAI" الأقدم التي تفتقر إلى القدرات التي قدمتها واجهة برمجة تطبيقات Claude API بالفعل، مما يضع OpenAI بشكل فعال في وضع غير مؤات هيكليًا مقارنة بالأنثروبيك في المقارنة الأصلية.

في جوهر الأمر، تقول OpenAI: لقد قمت بقياس نموذجنا بيد واحدة مقيدة خلف ظهره.

رد شوليه

استجاب المؤسس المشارك لجائزة ARC، فرانسوا شوليه، من خلال رسم خط واضح بين نوعين من إعدادات الاختبار. وقال إن الأدوات "المصممة خصيصًا لحل المعيار أو التي تحتوي على معرفة حول تنسيق المعيار" محظورة. لكن إعدادات واجهة برمجة التطبيقات للأغراض العامة "التي لم يتم تطويرها لـ ARC-AGI-3 والمتاحة لجميع مستخدمي واجهة برمجة التطبيقات" تعتبر لعبة عادلة.

في الواقع، اعترف شوليه بأن نتيجة GPT-5.6 Sol الخاصة بجائزة ARC وضعت OpenAI في وضع غير مؤات. وأشار إلى أن المنظمة أجرت "الكثير من المحادثات مع OpenAI حول أفضل طريقة لاختبار نماذجها، خاصة فيما يتعلق بالضغط"، ورحب بالشركة "التي بدأت في اكتشاف الإجابة".

لقد أشار شوليت إلى أحد المخاوف المتبقية. إن مقدمي الخدمات المختلفين الذين يستخدمون إعدادات مختلفة يخلقون ما أسماه "مشكلة تكافؤ محتملة" - لكنه يعتبر ذلك مقبولاً "طالما تم الإبلاغ عن الإعدادات والتكلفة بوضوح".

سبب أهمية هذا الأمر خارج نطاق لوحة المتصدرين

وتسلط هذه الحادثة الضوء على التوتر الذي يعيد تشكيل كيفية تقييم صناعة الذكاء الاصطناعي للتقدم. نظرًا لنشر النماذج بشكل متزايد من خلال واجهات برمجة التطبيقات الغنية بالميزات بدلاً من الأنظمة المستقلة، فإن الخط الفاصل بين القدرة المتأصلة للنموذج والهندسة المحيطة به يظل غير واضح. المعيار الذي يتجاهل السقالات قد يقلل من الأداء في العالم الحقيقي؛ الشخص الذي يحتضنه قد يكافئ الشركات على التلاعب بالاختبار.

من غير المرجح أن تكون مناقشة ARC-AGI-3 هي الأخيرة. ومع تجمع النماذج الحدودية بالقرب من قمة المعايير الراسخة، فإن الخلافات حول ما يمكن اعتباره مقياسا عادلا ــ ومن يستطيع أن يضع المعيار ــ سوف تشتد.

ابق في صدارة الذكاء الاصطناعي

هل تريد متابعة أخبار الذكاء الاصطناعي العاجلة حول النماذج والمعايير والمختبرات التي تعمل على بنائها؟ لقد قمت بتغطية AI Buzz Wire.

اقرأ المزيد من أخبار الذكاء الاصطناعي