جیو، اسٹارٹ اپ TypeSafe AI سے غیر LLM "فیصلہ کرنے والا ماڈل"، نے Pokémon Red مکمل کر لیا ہے - 37 گھنٹے اور 40 منٹ کے کھیل میں پیلیٹ ٹاؤن سے ہال آف فیم تک لڑتے ہوئے تقریباً $1.65 کی کل کمپیوٹ لاگت پر، پروجیکٹ کی ویب سائٹ کے مطابق۔
رن، جو ڈویلپر کرسچن میتھیسن نے بنایا تھا، کو ٹوکنز اور لاگت کے ساتھ ڈسپلے پر لائیو نشر کیا گیا اور GitHub پر اوپن سورس کیا گیا۔ اس نے ہفتے کے آخر میں ہیکر نیوز کے صفحہ اول پر تصویر کشی کی، جس میں سیکڑوں ووٹ حاصل کیے گئے اور اس بارے میں ایک جاندار بحث ہوئی کہ یہ AI ایجنٹوں کے مستقبل کے بارے میں کیا کہتا ہے۔ Tom's Hardware نے کامیابی کا احاطہ کیا، یہ نوٹ کرتے ہوئے کہ ایک غیر LLM انجن کامیاب ہوا جہاں روایتی چیٹ بوٹس مہینوں سے رکے ہوئے تھے - اور یہ کہ Claude Opus 5 نے ماڈل کو اس کے آخری انجام تک پہنچایا۔
نمبرز کے ذریعے چلائیں۔
پراجیکٹ کے اپنے ٹریکنگ کے اعدادوشمار بتاتے ہیں کہ یہ رن AI سسٹم کے لیے کتنا غیر معمولی تھا:
- کل وقت: 37 گھنٹے، 40 منٹ
- فیصلے کیے گئے: 16,150
- ان پٹ ٹوکن: تقریباً 39.2 ملین
- کل جیو لاگت: تقریباً $1.65
- عام فیصلے کا وقت: 0.4 سیکنڈ
- مخالفین لڑے: تقریباً 1,660
- ٹیم وائپس: 16
- ایلیٹ فور کوششیں: 15
- سب سے مشکل اسٹریچ: وکٹری روڈ
فائنل ہال آف فیم ٹیم: لیول 83 پر چارزارڈ، جس کی حمایت گریولر (62)، نائیڈوکین (45)، بیڈرل (44)، ہانٹر (39) اور پرائمیپ (29)۔
معاشیات کی سرخی ہے۔ کافی کی قیمت سے کم قیمت پر سولہ ہزار فیصلے LLM پر مبنی گیم پلےنگ ایجنٹس کے ساتھ ایک زبردست تضاد ہے، جو طویل سیشنوں میں دسیوں ڈالر کے ٹوکن کے ذریعے جلا سکتے ہیں۔ میتھیسن نے کہا کہ اس نے پوکیمون کا انتخاب اس نتیجے پر کرنے کے بعد کیا کہ جیو جلدی فیصلہ کر سکتا ہے، لیکن ڈوم کھیلنے کے لیے ابھی اتنی جلدی نہیں۔
پوکیمون ریڈ AI کے لیے کیوں مشکل ہے۔
پوکیمون ریڈ ایجنٹ AI کے لیے ایک غیر متوقع معیار بن گیا ہے۔ 1996 کا گیم بوائے کلاسک طویل افق کی منصوبہ بندی کا مطالبہ کرتا ہے: سطحوں کو پیسنا، چھ لوگوں کی پارٹی کا انتظام کرنا، بغیر نقشے کے بھولبلییا جیسی غاروں پر جانا، اور جب کوئی اہم چیز چھوٹ گئی تو پیچھے ہٹنا۔ لینگویج ماڈل ایجنٹ تاریخی طور پر حلقوں میں گھومتے رہے ہیں، غاروں میں پھنس گئے ہیں، اور بے کار اقدامات پر بہت زیادہ بجٹ جلا چکے ہیں۔
Jev بنیادی طور پر مختلف انداز اختیار کرتا ہے۔ ٹیکسٹ بنانے کے بجائے، ماڈل کیلیبریٹڈ فیصلوں کو براہ راست واپس کرتا ہے - ایک ڈیزائن TypeSafe AI نے بڑے ماڈلز کے جان بوجھ کر، زبان سے بھرپور استدلال کے لیے "سسٹم ون" متبادل کے طور پر مارکیٹنگ کی ہے۔ Tom's Hardware کی ماڈل کی پہلے کی کوریج کے مطابق، کمپنی کا دعویٰ ہے کہ Jev تقریباً 193 گنا تیز اور فیصلہ کن کاموں پر LLM متبادل کے مقابلے میں 445 گنا سستا ہے۔
کیچ، ڈویلپر نے تسلیم کیا کہ جیو کو مدد کی ضرورت ہے۔ Tom's Hardware کے مطابق، Claude Opus 5 نے فیصلہ سازی کے ماڈل کو اس کے آخری انجام تک پہنچایا - ایک ہائبرڈ نقطہ نظر جس میں ایک بڑی زبان کا ماڈل اسٹریٹجک رہنمائی فراہم کرتا ہے جب کہ تیز رفتار، سستا ماڈل ہزاروں انفرادی فیصلوں کو انجام دیتا ہے۔ پروجیکٹ کا صفحہ واضح طور پر نوٹ کرتا ہے کہ جیو "صرف جانتا تھا کہ آگے کہاں جانا ہے کیونکہ اس کے پاس ایک گائیڈ تھا۔"
AI ایجنٹوں کے لیے اس کا کیا مطلب ہے۔
نتیجہ ایک بڑھتی ہوئی دلیل میں ایک ڈیٹا پوائنٹ ہے کہ AI ایجنٹوں کا مستقبل سب کچھ کرنے والا ایک بڑا ماڈل نہیں ہے، بلکہ محنت کی تقسیم ہے: تیز، سستے، خصوصی ماڈلز جو اعلی تعدد کے فیصلوں کو سنبھالتے ہیں، سست استدلال کے ماڈل صرف اس صورت میں قدم رکھتے ہیں جب صورت حال غیر واضح ہو جاتی ہے۔
روبوٹکس، گیمنگ، اور ریئل ٹائم کنٹرول سسٹمز کے لیے — ایسے ڈومینز جہاں فیصلے ملی سیکنڈ میں آتے ہیں اور بجٹ کو سینٹ میں ماپا جاتا ہے — وہ فن تعمیر دلکش ہے۔ گودام کا روبوٹ، گیم کھیلنے والا NPC، یا تجارتی نظام ہر مائیکرو ایکشن کے لیے 2 سیکنڈ کے GPT طرز کے راؤنڈ ٹرپ کا متحمل نہیں ہو سکتا۔
ہیکر نیوز پر شک کرنے والوں نے رن کے انتباہات کی نشاندہی کی: گیم دہائیوں پرانا ہے اور پوری طرح سے دستاویزی ہے، کوچنگ ماڈل نے اسٹریٹجک ہیوی لفٹنگ کی، اور ایلیٹ فور کی 15 کوششیں کافی آزمائش اور غلطی کی تجویز کرتی ہیں۔ وہ منصفانہ نکات ہیں - لیکن وہ زیادہ دلچسپ سگنل سے محروم ہیں۔ ہر ایک $0.0001 پر سولہ ہزار اچھے فیصلے بالکل وہی لاگت پروفائل ہے جو خود مختار ایجنٹوں کی ضرورت ہوتی ہے اگر وہ کبھی پیمانے پر چلنا چاہتے ہیں۔
TypeSafe AI، جسے OpenAI RLHF کے ایک سابق محقق نے قائم کیا ہے، Jev کو متبادل کے بجائے زبان کے ماڈلز کے لیے ایک تکمیلی کے طور پر رکھا ہے۔ پوکیمون پروجیکٹ — کوڈ، اسٹریم، اور لاگت کی خرابی تمام عوامی — ابھی تک کا سب سے واضح مظاہرہ ہے کہ فیصلہ کرنے والا پہلا اسٹیک کیا کر سکتا ہے۔
مکمل سورس کوڈ GitHub پر دستیاب ہے، اور مکمل رن یوٹیوب پر دیکھا جا سکتا ہے، بشمول وکٹری روڈ پر ہر وائپ کو۔
اے آئی سے آگے رہیںAI کی تازہ ترین پیشرفت کے لیے AI Buzz Wire کو فالو کریں۔
مزید AI خبریں پڑھیں →