أصدرت شركة التحليل الاصطناعي المعيارية الإصدار 4.2 من مؤشر الذكاء الخاص بها في 4 سبتمبر 2026، وهو تحديث مؤقت يعيد صياغة كيفية قياس نماذج الذكاء الاصطناعي الحدودية - ووفقًا للوحة المتصدرين الجديدة، يحتل Claude Fable 5.1 من Anthropic المركز الأول، مع GPT-6 Astra من OpenAI في المركز الثاني بعد ربح أربع نقاط على GPT-5.6 Sol.
ويأتي التحديث بعد ثمانية أشهر فقط من إطلاق Index v4 في يناير، وهو تحول سريع غير عادي تعزوه الشركة إلى وتيرة الإصدارات الحدودية الأخيرة. وكتبت الشركة في إعلانها: "مع تحرك الحدود بسرعة كبيرة في الأسابيع الماضية، نشعر أنه من المهم تقديم تحديث مؤقت فوري لضمان بقاء مؤشرنا ملائمًا ومفيدًا كما كان دائمًا".
التصنيف الرئيسي
وفقًا للنتائج المنشورة، يتصدر المؤشر Claude Fable 5.1 من Anthropic، يليه GPT-6 Astra من OpenAI، والذي تحسن بأربع نقاط عن GPT-5.6 Sol. يُصنف Meta على أنه ثالث أقوى مختبر في قائمة المتصدرين، يليه SpaceXAI، وMoonshot/Kimi، وZ.AI، وGoogle.
تشترك Anthropic وOpenAI أيضًا في الصورة المحدثة لفعالية التكلفة: فالشركتان، جنبًا إلى جنب مع Meta وZ.AI، تحتلان حدود باريتو "للتكلفة لكل مهمة"، مما يعني أنه لا يوجد مختبر آخر يقدم حاليًا معلومات أفضل بدقة بنفس السعر لكل مهمة مكتملة.
فيما يتعلق بالكفاءة الرمزية، وجد التحليل الاصطناعي أن GPT-6 Astra "أكثر كفاءة من جميع النماذج الأخرى تقريبًا بالقرب من حدود الذكاء"، مع وجود كلود فابل 5.1، وغروك 4.5، وجيمناي 3.5 فلاش لايت في كلا طرفي المنحنى. ومع ذلك، أشارت الشركة في تحليل مصاحب، إلى أن الاستخدام الأقل للرمز المميز لشركة Astra يفوقه ارتفاع أسعارها - وهو تذكير بأن الكفاءة الأولية والتكلفة الإجمالية لا تتحركان معًا دائمًا.
ما الذي تغير في الإصدار 4.2
التغيير الهيكلي الأكثر أهمية هو الدفع المتعمد ضد الألعاب المعيارية. يأتي الآن أربعون بالمائة من وزن المؤشر من مجموعات الاختبار الخاصة والمحفوظة - ضعف الحصة في الإصدار 4.1 - بما في ذلك AA-Briefcase وAA-Omniscience وحلول CritPt. وقالت الشركة إن هذا الرقم سيرتفع أكثر في المؤشر v5.
هناك تقييمان جديدان يرسيان التحديث:
- AA-Briefcase، وهو معيار عمل داخلي للمعرفة الوكيلة مع مجموعة اختبار خاصة. يتم تقييم النماذج في مشاريع احترافية متعددة الأسابيع، ولكل منها العديد من المهام المرتبطة وآلاف من ملفات مصدر الإدخال، ويتم تصنيفها من خلال مجموعة من نقاط التقييم والمقارنة الزوجية التي تغطي نجاح المهمة الذي يمكن التحقق منه، والجودة التحليلية، وجودة العرض التقديمي.
- GDP.pdf، تم إنشاؤه بواسطة Surge AI، الذي يختبر المنطق أحادي المنعطف عبر المستندات الاحترافية: 100 ملف PDF يمتد على عشرة مجالات، مع توزيع الأدلة عبر 4592 صفحة من النصوص والجداول والرسوم البيانية والحواشي السفلية. يتم تصنيف الإجابات مقابل 1,275 معيارًا ذريًا من تأليف الخبراء، وينسب معدل النجاح الشامل للمهمة المهمة فقط عند استيفاء كل معيار.
وهناك معيار طويل الأمد في طريقه إلى الزوال: فقد تمت إزالة اختبار GPQA Diamond، وهو اختبار الاستدلال العلمي على مستوى الدراسات العليا، لأنه تم تشبعه فعليا بالنماذج الحدودية.
قامت الشركة أيضًا بتحديث البنية التحتية للتصنيف الخاصة بها، حيث أطلقت AA-LCR v1.1 مع نظام تصنيف جديد سريع ومفاتيح إجابات مصححة، وأعادت تثبيت مقياس Elo لـGDDval-AA v2 وAA-Briefcase بحيث تظل التقييمات مستقرة مع وصول نماذج جديدة، وتقوية صناديق الحماية الخاصة بتصنيف SciCode بحيث لا يعد الكود البطيء ولكن الصحيح بمثابة فشل.
ما تكشفه الاختبارات الجديدة
تقدم نتائج التقييمات الجديدة صورة أكثر تفصيلاً للوضع الفعلي للمختبرات الحدودية.
في AA-Briefcase، يتصدر كلود Fable 5.1 وOpus 5 من Anthropic، يليه GPT-6 Astra من OpenAI وMuse Spark 1.3 من Meta. سجل GPT-6 Astra ما يقرب من 85 نقطة Elo أعلى من GPT-5.6 Sol في نفس التقييم - وهي قفزة كبيرة بين أجيال OpenAI المتعاقبة.
على ملفDP.pdf، تنقلب الصورة: يتقدم OpenAI مع GPT-6 Astra بمعدل تمرير كلي يبلغ 33.2%، يليه GPT-5.6 Sol بنسبة 28.2% وكلود فابل 5.1 بنسبة 26.2%. يشير الاختلاف إلى أن تركيب المستندات الطويلة عبر سياقات كبيرة جدًا يظل قوة نسبية لأحدث نموذج لـ OpenAI، حتى عندما تقود نماذج Anthropic المؤشر العام ومهام العمل الوكيل.
أهمية مجموعات الاختبار الخاصة
ويعكس التحول نحو التقييم المستمر مشكلة مصداقية أوسع في قياس معايير الذكاء الاصطناعي. ومع استيعاب النماذج لمزيد من بيانات الاختبارات العامة، تزايد قلق المختبرات والمراقبين المستقلين من أن النتائج الرئيسية في المعايير المعروفة تعكس الحفظ أو التدريب المستهدف وليس القدرة الحقيقية. من خلال الحفاظ على حصة متزايدة من مجموعات الاختبار الخاصة بها وترجيحها بشكل أكبر، يحاول التحليل الاصطناعي الحفاظ على الإشارة إلى أن لوحات المتصدرين العامة كانت تخسر.
قالت الشركة إنها قامت ببناء عناصر المؤشر v5 "لأشهر" وأوقفت التحديثات عمدًا للحفاظ على استقرار المؤشر خلال الموجة الأخيرة من إطلاق النماذج الرئيسية. وبعيدًا عن الإصدار المؤقت v4.2، فإنه يخطط لإجراء المزيد من التحديثات الإضافية في المستقبل القريب عند استكماله للانتقال إلى الإصدار الخامس.
بالنسبة للمشترين الذين يختارون بين النماذج الحدودية، فإن النتيجة العملية من الإصدار 4.2 هي أن قمة السوق تظل عبارة عن سباق بين Anthropic وOpenAI، مع قيام Meta بسد الفجوة - وأن التقييمات المصممة لتكون مقاومة للألعاب تقوم الآن بالمزيد من أعمال التصنيف. يمكن للمستخدمين الذين يتتبعون قرارات اختيار النموذج متابعة أحدث تطورات الذكاء الاصطناعي مع اقتراب طرح الإصدار الخامس.
ابق في صدارة الذكاء الاصطناعي
تعمل التحديثات المعيارية مثل هذه على إعادة تشكيل كيفية تقييم الصناعة للتقدم. اقرأ المزيد من أخبار الذكاء الاصطناعي وكن مطلعًا على كل إصدار من النماذج.
اقرأ المزيد من أخبار الذكاء الاصطناعي →