نشر GPT-6 Astra من OpenAI أحدث النتائج على ARC-AGI-3، وهو معيار التفكير المجرد المصمم لقياس الذكاء الوكيل، وفقًا للنتائج التي نشرتها مؤسسة جائزة ARC يوم الأربعاء. سجل النموذج 62.7% في المجموعة شبه الخاصة للمعيار ضمن مجموعة أدوات القياس القياسية للمؤسسة، و99.9% عند تقييمه باستخدام مجموعة أدوات موفر الخدمة التي تحافظ على حالة الاستدلال الداخلي للنموذج بين الطلبات.

وصلت النتائج بعد يوم واحد من بدء OpenAI في الطرح المرحلي لـ Astra، النموذج الرئيسي الذي وضعته الشركة كبداية لعصر جديد. بالنسبة للقراء الذين يحاولون الحفاظ على النتيجة مع انخفاض معايير التجارة الحدودية، فإن صفحة آخر تطورات الذكاء الاصطناعي تتتبع كل إصدار رئيسي فور حدوثه.

اثنين من السروج، نتيجتين مختلفتين للغاية

تعد الفجوة بين الرقمين الرئيسيين لشركة Astra هي أهم التفاصيل في التقرير. تقوم جائزة ARC بتقييم الوكلاء ضمن أدوات مختلفة، ويغير كل منهم ما يُسمح للنموذج بفعله في سياقه الخاص.

ضمن الحزام القياسي، يمكن للنموذج ترحيل الملاحظات التي يختار الاحتفاظ بها أثناء عمله في البيئة. من خلال هذا الإعداد، سجلت Astra، بأقصى جهد تفكير، 62.7%، بتكلفة إجمالية قدرها 26.098 دولارًا أمريكيًا لعملية التقييم. على الجانب الآخر، أدى تشغيل نفس الأداة مع إيقاف التفكير المنطقي إلى إنتاج 35.2% فقط بينما كان يكلف أكثر – 49.791 دولارًا أمريكيًا – لأن النموذج يحتاج إلى العديد من الإجراءات الإضافية لإحراز التقدم.

تعتبر أداة محول الموفر أكثر سخاء: فهي تحافظ على حالة الاستدلال المبهم للنموذج بين الطلبات وتستخدم الضغط لإجراء محادثات أطول، مما يسمح لـ Astra بإعادة استخدام العمل السابق. وبموجب هذا الحزام، سجلت Astra 99.9% في جهد التفكير العالي مقابل 18,817 دولارًا، و98.6% في أقصى جهد مقابل 17,332 دولارًا. حتى أدنى إعداد منطقي وصل إلى 96.7%.

وبعبارة أخرى، فإن الفرق بين الدرجة الجزئية والدرجة شبه الكاملة لا يتمثل في القدرة الأولية وحدها - بل هو مقدار بقاء حالة عمل النموذج بين الخطوات.

التغلب على البشر في كفاءة العمل

تم تصميم ARC-AGI-3 حول بيئات ألعاب جديدة ومجردة تعتمد على الأدوار. يجب على الوكلاء الاستكشاف دون تعليمات، واستنتاج كيفية عمل العالم، وتحديد الأهداف من المكافآت المتفرقة، والتخطيط لإجراءات متعددة الخطوات. تتم معايرة البيئات بحيث يتمكن البشر من حلها بنسبة 100%، مما يجعل الأداء البشري هو الأساس الذي يتم قياسه.

لم تقم Astra بحل معظم المستويات فحسب، بل قامت بحلها بكفاءة. وفقًا لجائزة ARC، استخدم النموذج إجراءات أقل من المتوسط ​​الذي تم اختباره من قبل الإنسان على 96% من المستويات، متجاوزًا خط الأساس البشري في كفاءة العمل عبر المجموعة.

اقتصاديات المقارنة صارخة. تم دفع 115 دولارًا للمشاركين في الاختبار البشري لكل جلسة مدتها 90 دقيقة بالإضافة إلى 5 دولارات لكل لعبة مكتملة، أي ما يعادل 12.78 دولارًا تقريبًا لكل محاولة لعبة. تبلغ تكلفة عملية تقييم Astra الكاملة خمسة أرقام، اعتمادًا على التكوين. لكن جائزة ARC أشارت إلى مشكلة غير بديهية: جهد الاستدلال العالي يكلف بشكل عام أقل، لأن Astra تحل الألعاب بعدد أقل من الإجراءات، مما يقلل العدد الإجمالي لاستدعاءات النماذج والرموز المميزة التي يتم حرقها في كل عملية تشغيل.

نموذج يبني لغته الخاصة

وبعيدًا عن النتائج، سلطت جائزة ARC الضوء على السلوك النوعي الذي لاحظه الفريق. قامت Astra باستمرار بتحويل البيئات غير المألوفة إلى نماذج عالمية رمزية مدمجة - تمثل ميكانيكا اللعبة كقواعد منطقية، وتطور اختصارًا خاصًا بالمجال الخاص بها لتتبع إجراءات الحالة والتخطيط.

هذه هي بالضبط المهارة التي تم تصميم ARC-AGI-3 لاستكشافها. حيث قامت الأجيال السابقة من المعيار باختبار التفكير المرن على أنماط جديدة، يختبر الجيل الثالث ما إذا كان الوكيل يمكنه الاستكشاف والنمذجة وتحديد الأهداف وتنفيذ الخطط في بيئات لم يسبق له رؤيتها من قبل - المكونات التي تدرجها جائزة ARC مثل الاستكشاف والنمذجة وتحديد الأهداف والتخطيط والتنفيذ.

خلفية عصر الذكاء الاصطناعي العام (AGI).

وصلت النتائج المعيارية وسط خطاب شديد اللهجة من OpenAI نفسها. وفي مؤتمر صحفي قبل الإطلاق يوم الخميس، قال رئيس الشركة جريج بروكمان إنه "ليس من غير المعقول أن نشعر بأننا الآن في عصر الذكاء الاصطناعي العام"، بينما لم يصل إلى حد الإعلان الرسمي، وفقًا لتغطية The New Stack لعملية الإطلاق. ووصف الذكاء الاصطناعي العام بأنه "مفهوم مهمة أو مفهوم روحي" وليس محفزًا تعاقديًا.

قال الباحث في OpenAI، إيدان كلارك، إن Astra كان أكبر تدريب للشركة حتى الآن - أول تدريب مسبق على أكثر من 100000 وحدة معالجة رسوميات في موقع Stargate في تكساس - وأول إصدار لـ OpenAI لعبت فيه النماذج السابقة دورًا مهمًا في الإشراف على عملية التدريب. يظل الوصول منظمًا: يبدأ الطرح مع عملاء المؤسسات في برنامج Daybreak، مع توفر Plus وPro وBusiness وEnterprise بالإضافة إلى الوصول إلى واجهة برمجة التطبيقات (API) وAWS الموعودة في الأيام المقبلة.

العلامة النجمية على النتيجة

الحذر مطلوب على عدة جبهات. يعتمد أداء ARC-AGI-3 الخاص بـ Astra بشكل كبير على تكوين الحزام، كما يظهر الرقمان الرئيسيان، وكانت الأدوات المخصصة التي تحافظ على حالة النموذج نقطة خلاف متكررة في النزاعات المعيارية. أشار تحليل The New Stack لعملية الإطلاق إلى أن Astra "تحقق مكاسب كبيرة في المهام المتخصصة، لكنها تأتي بسعر أعلى ولا تتصدر حزمة البرمجة بشكل واضح" - وهو تذكير بأن معايير الألغاز الوكيلة وأعباء العمل التجارية اليومية تقيس أشياء مختلفة.

جائزة ARC نفسها تؤطر التمرين على أنه قياس "الفجوة المتبقية" بين الذكاء الاصطناعي الحالي والذكاء الاصطناعي العام، وتعريف الذكاء الاصطناعي العام على أنه القدرة على اكتساب أي مهارة يمكن للإنسان أن يكتسبها، بكفاءة مثل الإنسان. إن النتيجة شبه المثالية في ظل ظروف مواتية لا تسد هذه الفجوة من تلقاء نفسها. وبتكلفة قدرها 17.000 إلى 50.000 دولار أمريكي لكل عملية تقييم، فإن المختبرات ذات الموارد الجيدة هي وحدها القادرة على تحمل تكاليف تشغيل المعيار على هذا النطاق - على الرغم من أن بيانات تكلفة جائزة ARC تظهر أن التفكير الأكثر ذكاءً يمكنه بالفعل تقليص الفاتورة.

لماذا يهم

كفاءة العمل هي محور جديد حقا للمقارنة. إن النموذج الذي يحل كل المستويات ولكنه يهدر آلاف المكالمات أثناء القيام بذلك هو أقل فائدة - وأكثر تكلفة - من النموذج الذي يتصرف مثل Astra هنا: الاستكشاف المتعمد، وضغط ما يتعلمه، والتصرف بناءً عليه. وأيًا كان الاستنتاج الذي يستنتجه المرء حول النقاش الدائر حول الذكاء الاصطناعي العام، فإن بيانات جائزة ARC تظهر أن عملاء الحدود أصبحوا الآن ينافسون البشر ليس فقط فيما يتعلق بقدرتهم على حل المشكلات الجديدة، ولكن أيضًا فيما يتعلق بكيفية حلها اقتصاديًا.

البقاء في صدارة الذكاء الاصطناعي

يتم تتبع كل نتيجة معيارية، وإطلاق نموذج، ونقاش حول السلامة فور حدوثها — اقرأ المزيد من أخبار الذكاء الاصطناعي →