Jev، «مدل تصمیمگیری» غیر LLM از استارتآپ TypeSafe AI، Pokémon Red را تکمیل کرده است – طبق وبسایت این پروژه، راه خود را از Pallet Town به تالار مشاهیر در 37 ساعت و 40 دقیقه بازی با هزینه محاسباتی حدود 1.65 دلار تکمیل کرده است.
اجرا که توسط توسعه دهنده کریستین ماتیسن ساخته شده است، به صورت زنده با توکن ها و هزینه های نمایش داده شده و منبع باز در GitHub پخش شد. در آخر هفته به صفحه اول Hacker News پرتاب شد و صدها رأی موافق و بحثی پر جنب و جوش در مورد آنچه در مورد آینده عوامل هوش مصنوعی می گوید به همراه داشت. Tom's Hardware این دستاورد را پوشش داد و خاطرنشان کرد که یک موتور غیر LLM در جایی که چت رباتهای سنتی ماهها متوقف شده بودند موفق شد - و Claude Opus 5 این مدل را از طریق بنبستها هدایت کرد.
اجرا توسط اعداد
آمار ردیابی خود پروژه نشان می دهد که این اجرا چقدر برای یک سیستم هوش مصنوعی غیرعادی بوده است:
- زمان کل: 37 ساعت و 40 دقیقه
- تصمیمات اتخاذ شده: 16150
- توکن های ورودی: تقریباً 39.2 میلیون
- هزینه کل Jev: حدود 1.65 دلار
- زمان تصمیم گیری معمولی: 0.4 ثانیه
- مخالفان جنگیدند: تقریباً 1660 نفر
- دستمال مرطوب تیمی: 16
- Elite Four تلاش: 15
- سخت ترین کشش: جاده پیروزی
آخرین تیم تالار مشاهیر: Charizard در سطح 83، با حمایت Graveler (62)، Nidoqueen (45)، Beedrill (44)، Haunter (39) و Primeape (29).
اقتصاد سرفصل خبر است. شانزده هزار تصمیم برای کمتر از قیمت یک قهوه، تضاد قابل توجهی با عوامل بازی مبتنی بر LLM است، که می توانند ده ها دلار را در توکن ها در جلسات طولانی بسوزانند. متیسن گفت که او پس از این که به این نتیجه رسید که Jev می تواند به سرعت تصمیم بگیرد، پوکمون را انتخاب کرد، اما هنوز به اندازه کافی سریع برای بازی Doom نیست.
چرا پوکمون رد برای هوش مصنوعی سخت است؟
پوکمون رد به یک معیار بعید برای هوش مصنوعی تبدیل شده است. کلاسیک Game Boy 1996 به برنامه ریزی افق طولانی نیاز دارد: سطوح سنگ زنی، مدیریت یک مهمانی شش نفره، پیمایش در غارهای پیچ و خم مانند بدون نقشه، و عقب نشینی در صورت از دست دادن یک مورد کلیدی. عوامل مدل زبان در طول تاریخ در دایرهها پرسه میزنند، در غارها گیر میافتند و بودجههای هنگفتی را با اقدامات اضافی سوزاندهاند.
Jev رویکردی اساسا متفاوت دارد. این مدل بهجای تولید متن، تصمیمهای کالیبرهشده را مستقیماً برمیگرداند – طراحی TypeSafe AI به عنوان جایگزین «System One» برای استدلال عمدی و زبانی مدلهای بزرگ به بازار عرضه شده است. با توجه به پوشش قبلی Tom's Hardware از این مدل، این شرکت ادعا می کند که Jev تقریباً 193 برابر سریعتر و 445 برابر ارزانتر از جایگزین های LLM در وظایف تصمیم گیری است.
توسعهدهنده اذعان کرد نکته مهم این است که Jev به کمک نیاز داشت. طبق سخت افزار تام، کلود اوپوس 5 مدل تصمیم گیری را از طریق بن بست های خود هدایت کرد - یک رویکرد ترکیبی که در آن یک مدل زبان بزرگ راهنمایی استراتژیک ارائه می دهد در حالی که مدل سریع و ارزان هزاران تصمیم فردی را اجرا می کند. صفحه پروژه با بدبینی اشاره می کند که Jev "فقط می دانست کجا باید برود زیرا راهنما داشت."
چه معنایی برای عوامل هوش مصنوعی دارد
نتیجه یک نقطه داده در یک بحث رو به رشد است که آینده عوامل هوش مصنوعی یک مدل غول پیکر نیست که همه کارها را انجام می دهد، بلکه یک تقسیم کار است: مدل های سریع، ارزان و تخصصی که تصمیمات با فرکانس بالا را مدیریت می کنند، با مدل های استدلال کندتر که تنها زمانی وارد عمل می شوند که وضعیت مبهم می شود.
برای روباتیک، بازیها و سیستمهای کنترل بلادرنگ - حوزههایی که تصمیمها باید در میلیثانیه باشد و بودجهها بر حسب سنت اندازهگیری میشوند - این معماری جذاب است. یک ربات انبار، یک NPC که بازی میکند، یا یک سیستم معاملاتی نمیتواند یک سفر رفت و برگشت ۲ ثانیهای به سبک GPT برای هر ریز اقدام داشته باشد.
Skeptics on Hacker News به هشدارهای اجرا اشاره کرد: بازی چند دهه قدمت دارد و کاملاً مستند شده است، مدل مربیگری کارهای استراتژیک سنگین را انجام داد، و 15 تلاش Elite Four نشان از آزمون و خطای فراوان دارد. اینها نکات عادلانه ای هستند - اما سیگنال جالب تر را از دست می دهند. شانزده هزار تصمیم خوب با قیمت 0.0001 دلار برای هر کدام دقیقاً همان هزینه ای است که نمایندگان مستقل برای اجرا در مقیاس به آن نیاز دارند.
TypeSafe AI، که توسط یک محقق سابق OpenAI RLHF تأسیس شد، Jev را بهجای جایگزینی، مکملی برای مدلهای زبانی قرار داده است. پروژه Pokémon – کد، جریان و تفکیک هزینه به صورت عمومی – واضحترین نمایشی است که نشان میدهد یک پشته تصمیمگیری میتواند انجام دهد.
کد منبع کامل در GitHub در دسترس است، و اجرای کامل را می توان در YouTube مشاهده کرد، از جمله هر پاک کردن در Victory Road.
از هوش مصنوعی جلوتر بمانیدبرای آخرین تحولات هوش مصنوعی، [AI Buzz Wire] (https://aibuzzwire.news) را دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید →