Jev، «مدل تصمیم‌گیری» غیر LLM از استارت‌آپ TypeSafe AI، Pokémon Red را تکمیل کرده است – طبق وب‌سایت این پروژه، راه خود را از Pallet Town به تالار مشاهیر در 37 ساعت و 40 دقیقه بازی با هزینه محاسباتی حدود 1.65 دلار تکمیل کرده است.

اجرا که توسط توسعه دهنده کریستین ماتیسن ساخته شده است، به صورت زنده با توکن ها و هزینه های نمایش داده شده و منبع باز در GitHub پخش شد. در آخر هفته به صفحه اول Hacker News پرتاب شد و صدها رأی موافق و بحثی پر جنب و جوش در مورد آنچه در مورد آینده عوامل هوش مصنوعی می گوید به همراه داشت. Tom's Hardware این دستاورد را پوشش داد و خاطرنشان کرد که یک موتور غیر LLM در جایی که چت ربات‌های سنتی ماه‌ها متوقف شده بودند موفق شد - و Claude Opus 5 این مدل را از طریق بن‌بست‌ها هدایت کرد.

اجرا توسط اعداد

آمار ردیابی خود پروژه نشان می دهد که این اجرا چقدر برای یک سیستم هوش مصنوعی غیرعادی بوده است:

  • زمان کل: 37 ساعت و 40 دقیقه
  • تصمیمات اتخاذ شده: 16150
  • توکن های ورودی: تقریباً 39.2 میلیون
  • هزینه کل Jev: حدود 1.65 دلار
  • زمان تصمیم گیری معمولی: 0.4 ثانیه
  • مخالفان جنگیدند: تقریباً 1660 نفر
  • دستمال مرطوب تیمی: 16
  • Elite Four تلاش: 15
  • سخت ترین کشش: جاده پیروزی

آخرین تیم تالار مشاهیر: Charizard در سطح 83، با حمایت Graveler (62)، Nidoqueen (45)، Beedrill (44)، Haunter (39) و Primeape (29).

اقتصاد سرفصل خبر است. شانزده هزار تصمیم برای کمتر از قیمت یک قهوه، تضاد قابل توجهی با عوامل بازی مبتنی بر LLM است، که می توانند ده ها دلار را در توکن ها در جلسات طولانی بسوزانند. متیسن گفت که او پس از این که به این نتیجه رسید که Jev می تواند به سرعت تصمیم بگیرد، پوکمون را انتخاب کرد، اما هنوز به اندازه کافی سریع برای بازی Doom نیست.

چرا پوکمون رد برای هوش مصنوعی سخت است؟

پوکمون رد به یک معیار بعید برای هوش مصنوعی تبدیل شده است. کلاسیک Game Boy 1996 به برنامه ریزی افق طولانی نیاز دارد: سطوح سنگ زنی، مدیریت یک مهمانی شش نفره، پیمایش در غارهای پیچ و خم مانند بدون نقشه، و عقب نشینی در صورت از دست دادن یک مورد کلیدی. عوامل مدل زبان در طول تاریخ در دایره‌ها پرسه می‌زنند، در غارها گیر می‌افتند و بودجه‌های هنگفتی را با اقدامات اضافی سوزانده‌اند.

Jev رویکردی اساسا متفاوت دارد. این مدل به‌جای تولید متن، تصمیم‌های کالیبره‌شده را مستقیماً برمی‌گرداند – طراحی TypeSafe AI به عنوان جایگزین «System One» برای استدلال عمدی و زبانی مدل‌های بزرگ به بازار عرضه شده است. با توجه به پوشش قبلی Tom's Hardware از این مدل، این شرکت ادعا می کند که Jev تقریباً 193 برابر سریعتر و 445 برابر ارزانتر از جایگزین های LLM در وظایف تصمیم گیری است.

توسعه‌دهنده اذعان کرد نکته مهم این است که Jev به کمک نیاز داشت. طبق سخت افزار تام، کلود اوپوس 5 مدل تصمیم گیری را از طریق بن بست های خود هدایت کرد - یک رویکرد ترکیبی که در آن یک مدل زبان بزرگ راهنمایی استراتژیک ارائه می دهد در حالی که مدل سریع و ارزان هزاران تصمیم فردی را اجرا می کند. صفحه پروژه با بدبینی اشاره می کند که Jev "فقط می دانست کجا باید برود زیرا راهنما داشت."

چه معنایی برای عوامل هوش مصنوعی دارد

نتیجه یک نقطه داده در یک بحث رو به رشد است که آینده عوامل هوش مصنوعی یک مدل غول پیکر نیست که همه کارها را انجام می دهد، بلکه یک تقسیم کار است: مدل های سریع، ارزان و تخصصی که تصمیمات با فرکانس بالا را مدیریت می کنند، با مدل های استدلال کندتر که تنها زمانی وارد عمل می شوند که وضعیت مبهم می شود.

برای روباتیک، بازی‌ها و سیستم‌های کنترل بلادرنگ - حوزه‌هایی که تصمیم‌ها باید در میلی‌ثانیه باشد و بودجه‌ها بر حسب سنت اندازه‌گیری می‌شوند - این معماری جذاب است. یک ربات انبار، یک NPC که بازی می‌کند، یا یک سیستم معاملاتی نمی‌تواند یک سفر رفت و برگشت ۲ ثانیه‌ای به سبک GPT برای هر ریز اقدام داشته باشد.

Skeptics on Hacker News به هشدارهای اجرا اشاره کرد: بازی چند دهه قدمت دارد و کاملاً مستند شده است، مدل مربیگری کارهای استراتژیک سنگین را انجام داد، و 15 تلاش Elite Four نشان از آزمون و خطای فراوان دارد. اینها نکات عادلانه ای هستند - اما سیگنال جالب تر را از دست می دهند. شانزده هزار تصمیم خوب با قیمت 0.0001 دلار برای هر کدام دقیقاً همان هزینه ای است که نمایندگان مستقل برای اجرا در مقیاس به آن نیاز دارند.

TypeSafe AI، که توسط یک محقق سابق OpenAI RLHF تأسیس شد، Jev را به‌جای جایگزینی، مکملی برای مدل‌های زبانی قرار داده است. پروژه Pokémon – کد، جریان و تفکیک هزینه به صورت عمومی – واضح‌ترین نمایشی است که نشان می‌دهد یک پشته تصمیم‌گیری می‌تواند انجام دهد.

کد منبع کامل در GitHub در دسترس است، و اجرای کامل را می توان در YouTube مشاهده کرد، از جمله هر پاک کردن در Victory Road.

از هوش مصنوعی جلوتر بمانید

برای آخرین تحولات هوش مصنوعی، [AI Buzz Wire] (https://aibuzzwire.news) را دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید →