OpenAI کے GPT-6 Astra نے ARC-AGI-3 پر جدید ترین نتائج شائع کیے ہیں، یہ تجریدی استدلال بینچ مارک ہے جو ایجنٹی ذہانت کی پیمائش کے لیے ڈیزائن کیا گیا ہے، ARC پرائز فاؤنڈیشن کے بدھ کو شائع ہونے والے نتائج کے مطابق۔ ماڈل نے فاؤنڈیشن کے اسٹینڈرڈ ہارنس کے تحت بینچ مارک کے سیمی پرائیویٹ سیٹ پر 62.7%، اور پرووائیڈر اڈاپٹر ہارنس کے ساتھ جانچنے پر 99.9% اسکور کیا جو درخواستوں کے درمیان ماڈل کی اندرونی استدلال کی حالت کو محفوظ رکھتا ہے۔

اوپن اے آئی کے ایسٹرا کے اسٹیجڈ رول آؤٹ شروع کرنے کے ایک دن بعد نتائج سامنے آئے، یہ فلیگ شپ ماڈل کمپنی نے ایک نئے دور کے آغاز کے طور پر تیار کیا ہے۔ فرنٹیئر لیبز کے تجارتی بینچ مارک کے طور پر اسکور کو برقرار رکھنے کی کوشش کرنے والے قارئین کے لیے، تازہ ترین AI پیش رفت صفحہ ہر بڑی ریلیز کو ٹریک کرتا ہے جیسا کہ یہ ہوتا ہے۔

دو ہارنیس، دو بہت مختلف اسکور

Astra کے دو سرخی نمبروں کے درمیان فرق رپورٹ میں سب سے اہم تفصیل ہے۔ ARC پرائز ایجنٹوں کا مختلف استعمال کے تحت جائزہ لیتا ہے، اور ہر ایک ماڈل کو اپنے سیاق و سباق کے ساتھ کیا کرنے کی اجازت ہے اسے تبدیل کرتا ہے۔

معیاری استعمال کے تحت، ایک ماڈل ان نوٹوں کو آگے لے جا سکتا ہے جسے وہ ماحول میں کام کرتے ہوئے رکھنے کا انتخاب کرتا ہے۔ اس سیٹ اپ کے ساتھ، Astra نے زیادہ سے زیادہ استدلال کی کوشش میں 62.7% اسکور کیا، جس کی کل لاگت $26,098 تھی۔ مخالف سرے پر، استدلال کو بند کرنے کے ساتھ ایک ہی استعمال کو چلانے سے صرف 35.2% پیدا ہوا جبکہ زیادہ لاگت آئے گی — $49,791 — کیونکہ ماڈل کو پیشرفت کے لیے مزید بہت سے اقدامات کی ضرورت ہے۔

فراہم کنندہ اڈاپٹر کا استعمال زیادہ فراخدلی ہے: یہ درخواستوں کے درمیان ماڈل کی مبہم استدلال کی حالت کو محفوظ رکھتا ہے اور طویل گفتگو کے لیے کمپیکشن کا استعمال کرتا ہے، جس سے Astra کو پہلے سے کام دوبارہ استعمال کرنے دیتا ہے۔ اس استعمال کے تحت، Astra نے $18,817 میں اعلیٰ استدلال کی کوشش میں 99.9%، اور $17,332 میں زیادہ سے زیادہ کوشش پر 98.6% اسکور کیا۔ یہاں تک کہ سب سے کم استدلال کی ترتیب 96.7٪ تک پہنچ گئی۔

دوسرے لفظوں میں، جزوی سکور اور قریب ترین سکور کے درمیان فرق صرف خام صلاحیت نہیں ہے - یہ ہے کہ ماڈل کی ورکنگ سٹیٹ کا کتنا حصہ قدموں کے درمیان زندہ رہتا ہے۔

عمل کی کارکردگی پر انسانوں کو مارنا

ARC-AGI-3 ناول، تجریدی، باری پر مبنی کھیل کے ماحول کے ارد گرد بنایا گیا ہے۔ ایجنٹوں کو ہدایات کے بغیر دریافت کرنا چاہیے، اندازہ لگانا چاہیے کہ دنیا کس طرح کام کرتی ہے، معمولی انعامات سے اہداف کی شناخت کریں، اور متعدد اقدامات کی منصوبہ بندی کریں۔ ماحول کو کیلیبریٹ کیا جاتا ہے تاکہ انسان ان میں سے 100% حل کر سکیں، جو انسانی کارکردگی کو بنیادی طور پر بینچ مارک اقدامات کے خلاف بناتا ہے۔

Astra نے صرف زیادہ تر سطحوں کو حل نہیں کیا - اس نے انہیں مؤثر طریقے سے حل کیا۔ اے آر سی پرائز کے مطابق، ماڈل نے 96 فیصد لیولز پر میڈین ٹیسٹ کیے گئے انسان کے مقابلے میں کم ایکشنز استعمال کیے، جو کہ پورے سیٹ میں ایکشن کی کارکردگی میں انسانی بیس لائن کو پیچھے چھوڑتے ہیں۔

موازنہ کی معاشیات سخت ہیں۔ انسانی ٹیسٹ کے شرکاء کو فی 90 منٹ سیشن $115 کے علاوہ $5 فی مکمل گیم ادا کیا گیا، جس سے تقریباً $12.78 فی کوشش کی گئی گیم۔ کنفیگریشن کے لحاظ سے ایک مکمل Astra کی تشخیص کی لاگت پانچ اعداد ہے۔ لیکن اے آر سی پرائز نے ایک متضاد شکن کو نوٹ کیا: زیادہ استدلال کی کوششیں عام طور پر کم لاگت آتی ہیں، کیونکہ Astra نے کم ایکشنز میں گیمز کو حل کیا، جس سے ماڈل کالز کی کل تعداد اور فی رن جلانے والے ٹوکنز کم ہو گئے۔

ایک ماڈل جو اپنی زبان خود بناتا ہے۔

اسکور سے آگے، اے آر سی پرائز نے ٹیم کے مشاہدہ کردہ ایک معیاری رویے پر روشنی ڈالی۔ Astra نے مسلسل غیر مانوس ماحول کو کمپیکٹ علامتی دنیا کے ماڈلز میں بدل دیا - گیم میکینکس کو منطقی اصولوں کے طور پر پیش کرتا ہے، اور ریاست اور منصوبہ بندی کے اعمال کو ٹریک کرنے کے لیے اپنا ڈومین مخصوص شارٹ ہینڈ تیار کرتا ہے۔

یہ بالکل وہی مہارت ہے جو ARC-AGI-3 کو تحقیقات کے لیے ڈیزائن کیا گیا تھا۔ جہاں بینچ مارک کی پچھلی نسلوں نے ناول کے نمونوں پر سیال استدلال کا تجربہ کیا، تیسری نسل یہ جانچتی ہے کہ آیا کوئی ایجنٹ ایسے ماحول میں دریافت، ماڈل، اہداف اور منصوبوں پر عمل درآمد کر سکتا ہے جو اس نے کبھی نہیں دیکھے ہوں گے — ARC پرائز کے اجزاء کی فہرستیں بطور ایکسپلوریشن، ماڈلنگ، گول سیٹنگ، اور منصوبہ بندی اور عمل درآمد۔

AGI-Era پس منظر

بینچ مارک کے نتائج خود OpenAI کی طرف سے زیادہ سے زیادہ بیان بازی کے درمیان آئے۔ جمعرات کے آغاز سے پہلے ایک پریس بریفنگ میں، کمپنی کے صدر گریگ بروک مین نے کہا کہ "یہ محسوس کرنا غیر معقول نہیں ہے کہ ہم اب AGI کے دور میں ہیں"، جب کہ لانچ کے بارے میں دی نیو اسٹیک کی کوریج کے مطابق، باضابطہ اعلان کو روکتے ہوئے انہوں نے AGI کو معاہدہ کے محرک کے بجائے ایک "مشن تصور یا روحانی تصور" کے طور پر بیان کیا۔

اوپن اے آئی کے محقق ایڈن کلارک نے کہا کہ ایسٹرا کمپنی کی اب تک کی سب سے بڑی ٹریننگ تھی - ٹیکساس میں اسٹار گیٹ سائٹ پر 100,000 سے زیادہ GPUs پر پہلے سے تربیت یافتہ - اور پہلی OpenAI ریلیز جس میں پہلے کے ماڈلز نے تربیتی عمل کی نگرانی میں اہم کردار ادا کیا۔ رسائی جاری رہتی ہے: رول آؤٹ ڈے بریک پروگرام میں انٹرپرائز صارفین کے ساتھ شروع ہوتا ہے، جس میں پلس، پرو، بزنس اور انٹرپرائز کی دستیابی کے علاوہ API اور AWS رسائی کا وعدہ کیا گیا ہے آنے والے دنوں میں۔

اسکور پر نجمہ

کئی محاذوں پر احتیاط کی ضرورت ہے۔ Astra کی ARC-AGI-3 کارکردگی کافی حد تک ہارنس کنفیگریشن پر منحصر ہے، جیسا کہ دو ہیڈ لائن نمبرز دکھاتے ہیں، اور کسٹم ہارنس جو ماڈل اسٹیٹ کو محفوظ رکھتے ہیں، بینچ مارک تنازعات میں تکرار کا ایک نقطہ رہا ہے۔ لانچ کے نئے اسٹیک کے تجزیے نے نوٹ کیا کہ Astra "خصوصی کاموں پر بڑے فوائد پوسٹ کرتا ہے، لیکن یہ ایک پریمیم پر آتا ہے اور واضح طور پر کوڈنگ پیک کی قیادت نہیں کرتا" - ایک یاد دہانی کہ ایجنٹی پہیلی کے بینچ مارکس اور روزمرہ کے تجارتی کام کا بوجھ مختلف چیزوں کی پیمائش کرتا ہے۔

ARC پرائز بذات خود اس مشق کو موجودہ AI اور AGI کے درمیان "بقیہ خلا" کی پیمائش کے طور پر تیار کرتا ہے، AGI کی تعریف کسی بھی ایسی مہارت کو حاصل کرنے کی صلاحیت کے طور پر کرتا ہے جو انسان کر سکتا ہے، جتنا ایک انسان کر سکتا ہے۔ سازگار حالات میں قریب قریب پرفیکٹ سکور اس فرق کو خود سے ختم نہیں کرتا ہے۔ اور $17,000 سے $50,000 فی ایویلیویشن رن پر، صرف اچھی وسائل والی لیبز ہی اس پیمانے پر بینچ مارک چلانے کی متحمل ہوسکتی ہیں - حالانکہ ARC پرائز کے لاگت کے اعداد و شمار سے ظاہر ہوتا ہے کہ ذہین استدلال دراصل بل کو سکڑ سکتا ہے۔

یہ کیوں اہمیت رکھتا ہے۔

عمل کی کارکردگی موازنہ کا حقیقی طور پر نیا محور ہے۔ ایک ایسا ماڈل جو ہر سطح کو حل کرتا ہے لیکن ہزاروں کالوں کو ضائع کرتا ہے اس سے کم کارآمد ہے — اور زیادہ مہنگا — جو کہ Astra کی طرح یہاں کام کرتا ہے: جان بوجھ کر دریافت کرنا، جو کچھ سیکھتا ہے اسے دبانا، اور اس پر عمل کرنا۔ AGI کی بحث کے بارے میں جو بھی نتیجہ اخذ کیا جائے، ARC پرائز کے اعداد و شمار سے پتہ چلتا ہے کہ فرنٹیئر ایجنٹس اب انسانوں سے میل کھا رہے ہیں نہ صرف اس بات پر کہ آیا وہ نئے مسائل کو حل کر سکتے ہیں، بلکہ اس بات پر کہ وہ انہیں معاشی طور پر کیسے حل کرتے ہیں۔

AI سے آگے رہیں

ہر بینچ مارک نتیجہ، ماڈل لانچ اور حفاظتی بحث، جیسا کہ یہ ہوتا ہے اس کا پتہ لگایا جاتا ہے — مزید AI خبریں پڑھیں →