أكمل Jev، "نموذج القرار" غير التابع لـ LLM من شركة TypeSafe AI الناشئة، Pokémon Red - وهو يشق طريقه من Pallet Town إلى Hall of Fame في 37 ساعة و40 دقيقة من اللعب بتكلفة حسابية إجمالية تبلغ حوالي 1.65 دولار، وفقًا لموقع المشروع على الويب.

تم بث العرض، الذي صممه المطور كريستيان ماثيسن، مباشرةً باستخدام الرموز المميزة والتكاليف المعروضة ومفتوح المصدر على GitHub. لقد تم نشره على الصفحة الأولى من Hacker News خلال عطلة نهاية الأسبوع، حيث اجتذب مئات من الأصوات المؤيدة ومناقشة حيوية حول ما يقوله عن مستقبل عملاء الذكاء الاصطناعي. غطت Tom's Hardware هذا الإنجاز، مشيرة إلى أن محركًا غير تابع لـ LLM نجح حيث توقفت برامج الدردشة التقليدية لعدة أشهر - وأن كلود أوبوس 5 قام بتدريب النموذج عبر طرقه المسدودة.

السباق بالأرقام

تُظهر الإحصائيات من تتبع المشروع الخاص مدى غرابة هذا التشغيل بالنسبة لنظام الذكاء الاصطناعي:

  • الوقت الإجمالي: 37 ساعة و40 دقيقة
  • القرارات المتخذة: 16,150
  • رموز الإدخال: ما يقرب من 39.2 مليونًا
  • إجمالي تكلفة المشروع: حوالي 1.65 دولار
  • الوقت النموذجي لاتخاذ القرار: 0.4 ثانية
  • المعارضون الذين قاتلوا: حوالي 1,660
  • مناديل الفريق: 16
  • محاولات النخبة الأربعة: 15
  • أصعب امتداد: طريق النصر

فريق Hall of Fame الأخير: Charizard في المستوى 83، مدعومًا بـ Graveler (62)، Nidoqueen (45)، Beedrill (44)، Haunter (39)، وPrimeape (29).

الاقتصاد هو العنوان الرئيسي. يعد ستة عشر ألف قرار بأقل من سعر القهوة تناقضًا صارخًا مع وكلاء ممارسة الألعاب المعتمدين على LLM، والذين يمكنهم حرق عشرات الدولارات من الرموز المميزة على مدار جلسات طويلة. قال ماتيسين إنه اختار بوكيمون بعد أن خلص إلى أن جيف يمكنه اتخاذ القرار بسرعة، ولكن ليس بالسرعة الكافية للعب Doom.

لماذا يعتبر Pokémon Red صعبًا بالنسبة للذكاء الاصطناعي

أصبح Pokémon Red معيارًا غير متوقع للذكاء الاصطناعي الوكيل. تتطلب لعبة Game Boy الكلاسيكية لعام 1996 تخطيطًا طويل المدى: مستويات الطحن، وإدارة مجموعة مكونة من ستة أفراد، والتنقل في كهوف تشبه المتاهة بدون خريطة، والتراجع عند فقدان عنصر رئيسي. لقد تجول وكلاء نماذج اللغة تاريخيًا في دوائر، وعلقوا في الكهوف، وأحرقوا ميزانيات هائلة على أعمال زائدة عن الحاجة.

يأخذ جيف نهجا مختلفا جذريا. بدلاً من إنشاء نص، يقوم النموذج بإرجاع قرارات معايرة مباشرة - وهو تصميم قامت شركة TypeSafe AI بتسويقه كبديل "System One" للاستدلال المتعمد والمليء باللغة للنماذج الكبيرة. وفقًا لتغطية Tom's Hardware السابقة للنموذج، تدعي الشركة أن Jev أسرع بحوالي 193 مرة وأرخص 445 مرة من بدائل LLM في مهام القرار.

المشكلة، كما اعترف المطور، هي أن جيف يحتاج إلى المساعدة. وفقًا لـ Tom's Hardware، قام كلود أوبوس 5 بتدريب نموذج القرار من خلال طرقه المسدودة - وهو نهج هجين يوفر فيه نموذج اللغة الكبير توجيهًا استراتيجيًا بينما ينفذ النموذج السريع والرخيص آلاف القرارات الفردية. تشير صفحة المشروع بسخرية إلى أن جيف "لم يكن يعرف إلى أين يتجه بعد ذلك إلا لأنه كان لديه دليل".

ماذا يعني ذلك بالنسبة لعملاء الذكاء الاصطناعي

والنتيجة هي نقطة بيانات في حجة متنامية مفادها أن مستقبل وكلاء الذكاء الاصطناعي ليس نموذجًا عملاقًا واحدًا يفعل كل شيء، بل تقسيم العمل: نماذج سريعة ورخيصة ومتخصصة تتعامل مع قرارات عالية التردد، مع نماذج تفكير أبطأ تتدخل فقط عندما يصبح الموقف غامضًا.

بالنسبة للروبوتات، والألعاب، وأنظمة التحكم في الوقت الفعلي - وهي المجالات التي يجب أن تصل فيها القرارات بالمللي ثانية ويتم قياس الميزانيات فيها بالسنت - فإن هذه الهندسة المعمارية جذابة. لا يستطيع روبوت المستودع، أو الشخصية غير القابلة للعب (NPC) التي تلعب الألعاب، أو نظام التداول تحمل تكلفة رحلة ذهابًا وإيابًا لمدة ثانيتين على غرار GPT لكل إجراء صغير.

أشار المتشككون في Hacker News إلى التحذيرات التي تطرحها هذه اللعبة: فاللعبة عمرها عقود من الزمن وموثقة بدقة، ونموذج التدريب هو الذي قام بالمهمة الإستراتيجية الثقيلة، و15 محاولة من Elite Four تشير إلى الكثير من التجربة والخطأ. هذه نقاط عادلة، لكنها تفتقد الإشارة الأكثر إثارة للاهتمام. إن ستة عشر ألف قرار جيد بسعر 0.0001 دولار لكل منها هو بالضبط ملف تعريف التكلفة الذي يحتاجه الوكلاء المستقلون إذا أرادوا العمل على نطاق واسع.

قامت شركة TypeSafe AI، التي أسسها باحث سابق في OpenAI RLHF، بوضع Jev كمكمل لنماذج اللغة وليس كبديل. يعد مشروع Pokémon - الكود، والبث، وتفصيل التكلفة للجميع - هو العرض الأكثر وضوحًا حتى الآن لما يمكن أن تفعله حزمة القرار أولاً.

كود المصدر الكامل متاح على GitHub، ويمكن مشاهدة التشغيل المكتمل على YouTube، بما في ذلك كل عملية مسح على طريق النصر.

البقاء في صدارة الذكاء الاصطناعي

تابع AI Buzz Wire للاطلاع على أحدث تطورات الذكاء الاصطناعي.

اقرأ المزيد من أخبار الذكاء الاصطناعي →