Nvidia کے محققین نے ایک ایسا ایجنٹ سسٹم بنایا ہے جس نے Anthropic کے Claude Opus 5 کو ARC-AGI-3 پر کامل 100% سکور پر دھکیل دیا، جو کہ AI میں سب سے زیادہ مطالبہ کرنے والے انٹرایکٹو ریجننگ بینچ مارکس میں سے ایک ہے — اسی ماڈل کا استعمال کرتے ہوئے جو 30% اسکور کرتا ہے جب یہ خود چلتا ہے۔ جمعہ کو Nvidia ٹیکنیکل بلاگ پر شائع ہونے والا نتیجہ اس بات کا سب سے مضبوط ثبوت ہے کہ فرنٹیئر ماڈل کے گرد لپیٹے ہوئے سافٹ ویئر کی اتنی ہی اہمیت ہے جتنی کہ خود ماڈل۔ کسی بھی شخص کے لیے تازہ ترین AI پیش رفت سے باخبر رہنے کے لیے، یہ اس تبدیلی کی نشاندہی کرتا ہے جہاں ایجنٹی AI میں مسابقتی فائدہ درحقیقت رہتا ہے۔

اس سسٹم کو AVO کہا جاتا ہے، مختصراً ایجنٹی ویری ایشن آپریٹرز کے لیے، اور یہ Nvidia کا طویل افق کے خود مختار ایجنٹوں کے لیے ایک عمومی مقصد کے فن تعمیر کا اختیار ہے — AI جو کسی ایک اشارے کا جواب دینے کے بجائے گھنٹوں یا دنوں تک کام پر رہ سکتا ہے۔ ARC-AGI-3 پبلک سیٹ پر، AVO نے تمام 25 گیم ماحول میں 100.00 RHAE سکور ریکارڈ کیا، جس نے اپنے بیک اینڈ ماڈل کے طور پر Claude Opus 5 کا استعمال کرتے ہوئے 6,624 ماحولیاتی ایکشنز میں تمام 183 لیولز کو مکمل کیا۔

ARC-AGI-3 اصل میں کیا ٹیسٹ کرتا ہے۔

ARC-AGI-3 ایک انٹرایکٹو ریجننگ بینچ مارک ہے جسے ARC پرائز فاؤنڈیشن نے بنایا ہے۔ ایک ایجنٹ کو غیر مانوس، کھیل جیسے ماحول میں چھوڑ دیا جاتا ہے جس میں کوئی ہدایات، کوئی بیان کردہ اصول، اور کوئی مقصد نہیں بتایا جاتا ہے۔ اسے آزمائش اور غلطی کے ذریعے دریافت کرنا ہوگا، اندازہ لگانا ہوگا کہ ماحول کیسے کام کرتا ہے، یہ جاننا ہوگا کہ "جیتنے" کا کیا مطلب ہے، اور پھر آہستہ آہستہ سخت ترین سطحوں سے آگے بڑھنے کے لیے کافی مؤثر طریقے سے کام کرنا ہوگا۔

بینچ مارک کا اسکورنگ میٹرک، ریلیٹیو ہیومن ایکشن ایفیشنسی (RHAE)، ٹاسک کی تکمیل کو اس بات سے جوڑتا ہے کہ ایجنٹ پہلی بار انسانی کھلاڑیوں کے مقابلے میں کتنی کم کارروائیوں کو ضائع کرتا ہے۔ یہ اسے مستقل خودمختاری کا ایک وحشیانہ امتحان بناتا ہے: ایجنٹ کو یاد رکھنا چاہیے کہ اس نے کیا سیکھا، غلطیوں سے باز آنا، اور پوری دوڑ میں اپنے اعمال کو احتیاط سے بجٹ کرنا۔

Nvidia کا ہیڈ لائن نمبر موازنہ سے سیاق و سباق حاصل کرتا ہے۔ VISTA، ایک سابقہ ​​براہ راست تعامل کا استعمال جس نے Claude Opus 5 کا بھی استعمال کیا، 7,542 ماحولیاتی کارروائیوں میں وہی 183 عوامی سیٹ لیولز کو مکمل کیا۔ Nvidia کی بلاگ پوسٹ کے مطابق، AVO کو کام ختم کرنے کے لیے تقریباً 12% کم کارروائیوں کی ضرورت ہے۔

GPU کرنل سے نامعلوم گیمز تک

AVO پہیلیاں کے لیے نہیں بنایا گیا تھا۔ Nvidia نے سب سے پہلے GPU-kernel آپٹیمائزیشن پر فن تعمیر کا مظاہرہ کیا، ایک ایسا ڈومین جہاں کوڈ کی چھوٹی تبدیلیاں درستگی، میموری رویے، اور تھرو پٹ کو غیر متوقع طریقوں سے توڑ سکتی ہیں۔ توجہ کرنے والے ایک مطالعہ میں، AVO نے سات دنوں تک مسلسل دوڑ لگا دی، 500 سے زیادہ اصلاح کی سمتوں کی کھوج کی، اور 40 کرنل ورژنز کا ارتکاب کیا۔ NVIDIA DGX B200 سسٹمز پر، نتیجے میں ملٹی ہیڈ توجہ کے کرنل نے cuDNN کو 3.5% تک اور FlashAttention-4 کو 10.5% تک پیچھے چھوڑ دیا۔ اس کے بعد ایجنٹ نے تقریباً 30 منٹ کے اضافی خودمختار کام میں اپنے تیار کردہ دانا کو گروہی سوال کی توجہ کے لیے ڈھال لیا۔

وہی بنیادی لوپ — معائنہ، منصوبہ بندی، عمل درآمد، جانچ، تشخیص — پھر ARC-AGI-3 کی طرف اشارہ کیا گیا جس میں صرف ٹاسک انٹرفیس تبدیل ہوا۔ دو میکانزم چلائے گئے۔ پہلی مستقل میموری ہے، جو پیشگی نفاذ، تشخیص کے نتائج، مرتب کرنے والے اور پروفائلر کے نتائج، اور جمع شدہ استدلال کو ذخیرہ کرتی ہے، لہذا ایجنٹ شروع سے سیاق و سباق کو دوبارہ بنانے کے بجائے اپنی موجودہ حالت سے دوبارہ شروع کر سکتا ہے۔ دوسرا سپروائزر ہے، دوسرا ایجنٹ جو مجموعی رفتار کو دیکھتا ہے اور جب ترقی رک جاتی ہے تو مداخلت کرتا ہے۔

سپروائزر پیش رفت ہے۔

TechCrunch، جس نے کمپنی کے AI یونٹ میں پروڈکٹ کے نائب صدر، Nvidia کے Adel El Hallak کا انٹرویو کیا، نے سپروائزر کو سب سے اہم جزو کے طور پر اجاگر کیا۔ "یہ تقریباً ایک سی ای او کی طرح کام کرتا ہے کہ ایجنٹ کو دھکا دے جب وہ سمت سے ہٹ جاتا ہے یا کسی ایسے راستے کی تلاش شروع کر دیتا ہے جس سے وہ ایک مردہ انجام کا باعث بن سکتا ہے، یا اس راستے کو دوبارہ دریافت کرتا ہے جس پر وہ پہلے چل چکا تھا،" ایل ہالک نے اشاعت کو بتایا۔

کارکردگی کا فرق واضح ہے۔ Nvidia کی جانچ سے پتا چلا ہے کہ Claude Opus 5 بغیر کسی نفیس استعمال کے ARC-AGI-3 پر 30% سکور حاصل کرنے میں کامیاب رہا — ٹیسٹ کیے گئے ننگے ماڈلز میں بہترین نتیجہ، لیکن مکمل رن کے قریب کہیں بھی نہیں۔ اوپن اے آئی کے ماڈلز نے بینچ مارک پر 10 فیصد سے کم اسکور حاصل کیا ہے، اور کمپنی نے گزشتہ ماہ اپنی تحقیق شائع کی ہے جس میں بتایا گیا ہے کہ صرف دو ہارنس سیٹنگز کو موافقت کرنے سے اس کے اسکور تین گنا بڑھ گئے ہیں۔ صرف ماڈل کی کوئی ترتیب AVO کے حاصل کردہ 100% کے قریب نہیں آئی ہے۔

خاص طور پر، AVO کنفیگریشن صرف ٹیکسٹ موڈیلیٹی میں چلائی گئی: ہر مشاہدے کو ایک عین مطابق 64x64 ٹیکسٹ گرڈ کے طور پر فراہم کیا گیا تھا، جس میں ماڈل کو کوئی تصویر یا تصویری ٹوکن نہیں بھیجے گئے تھے۔ استدلال کی طاقت ماڈل کے ارد گرد کے لوپ سے آئی، ملٹی موڈل ادراک سے نہیں۔

صنعت ہارنیسس پر کیوں شرط لگا رہی ہے۔

شواہد کی لہر کے درمیان یہ تلاش زمین پر پہنچ گئی ہے کہ ایجنٹ کا بنیادی ڈھانچہ، خام ماڈل کی صلاحیت نہیں، خود مختار AI کے لیے موجودہ رکاوٹ ہے۔ ڈیٹابرکس نے جولائی میں بینچ مارکنگ ریسرچ شائع کی جس سے ظاہر ہوتا ہے کہ ہارنس ڈرامائی طور پر کارکردگی اور لاگت دونوں پر اثر انداز ہوتا ہے۔ ڈیٹابرکس کے سی ای او علی گھوڈسی نے ٹیک کرنچ کو بتایا کہ "آپ ایک ہی ماڈل کو منتخب کر سکتے ہیں لیکن مختلف ہارنسز، اور اگر آپ غلط ہارنس استعمال کرتے ہیں تو آپ کو کافی زیادہ قیمت مل جاتی ہے۔" "یہ خود آپ کی قیمت کو 2 گنا کر سکتا ہے۔"

El Hallak نے کھلے پن کے معاملے میں Nvidia کی وسیع دلیل تیار کی۔ انہوں نے کہا، "ہم ایک اوپن ایجنٹ اسٹیک رکھنے پر یقین رکھتے ہیں - جہاں آپ کا کنٹرول ہرنس، انفراسٹرکچر، پورے رن ٹائم پر ہوتا ہے - وہی ہے جو ہمارے لیے ایکو سسٹم کو آگے اور محفوظ طریقے سے آگے بڑھانے کی ضرورت ہے۔" Nvidia کے پاس اپنے NeMo برانڈ کے تحت ہارنس ٹیکنالوجی کے کھلے سائز کے ٹکڑے ہیں، اور AVO تحقیق کو arXiv پر ایک مقالے میں دستاویز کیا گیا ہے۔

تاریخ کے ساتھ ایک معیار

فرنٹیئر لیب دشمنی میں ARC-AGI-3 ایک فلیش پوائنٹ بن گیا ہے۔ اوپن اے آئی نے پہلے اپنے GPT-5.6 سول ماڈل کے بینچ مارک پر مضبوط نتائج کا دعویٰ کیا تھا، جس میں استعمال شدہ تشخیصی ترتیبات پر جانچ پڑتال کی گئی تھی۔ Nvidia کا نتیجہ ایک معنی میں بحث کو پس پشت ڈالتا ہے - یہ ایک بہتر ماڈل کا دعوی نہیں کرتا، صرف موجودہ ماڈل کے ارد گرد ایک بہتر انجنیئر ایجنٹ کا دعوی کرتا ہے۔

ایجنٹی مصنوعات بنانے والے ڈویلپرز اور کاروباری اداروں کے لیے پیغام سیدھا ہے: ماڈل کا انتخاب اب بھی اہمیت رکھتا ہے، لیکن سسٹم ڈیزائن اب فیصلہ کرتا ہے کہ آیا فرنٹیئر ماڈل فرنٹیئر نتائج فراہم کرتا ہے۔ جیسا کہ Nvidia کہتا ہے، کسی ماڈل کا اندازہ لگانا کسی ایجنٹ کا جائزہ لینے جیسا نہیں ہے — اور 2026 کے بینچ مارک ٹیبلز ان انجینئرز کو تیزی سے انعام دے رہے ہیں جو سہاروں کی تعمیر کرتے ہیں۔

AI سے آگے رہیں

ایجنٹ کے فن تعمیر پہلے سے کہیں زیادہ تیزی سے آگے بڑھ رہے ہیں، اور اچھے استعمال اور خراب کے درمیان فرق کو اب بینچ مارک پوائنٹس اور حقیقی ڈالر میں ماپا جاتا ہے۔ AI Buzz Wire کی پیروی کریں روزانہ، AI تحقیق، بینچ مارکس، اور پروڈکٹ لانچوں کی ماخذ سے تصدیق شدہ کوریج کے لیے۔

مزید AI تحقیقی خبریں پڑھیں →