Anthropic کے Claude Opus 5 کے ARC-AGI-3 بینچ مارک پر حاوی ہونے کے بعد OpenAI پیچھے ہٹ رہا ہے، ایسے نتائج شائع کر رہا ہے جو اس کے اپنے GPT-5.6 Sol ماڈل کو 38.3 فیصد تک پہنچاتے ہیں — بشرطیکہ آپ آفیشل ٹیسٹ ہارنس کے بجائے OpenAI کی ترجیحی ترتیبات استعمال کریں۔

یہ تنازعہ، جو 30 جولائی 2026 کو شروع ہوا، AI کی تشخیص میں بڑھتے ہوئے مسئلے کے دل کو کاٹ دیتا ہے: بینچ مارکس اب صرف ایک ماڈل کی پیمائش نہیں کرتے، بلکہ پورا تکنیکی پاڑ اس کے گرد لپٹا ہوا ہے۔ تازہ ترین AI پیش رفت اور ماڈل ریلیز کے گہرے تجزیے کے لیے، AI Buzz Wire کہانی کو ٹریک کر رہا ہے۔

نمبرز اور کیچ

OpenAI نے اطلاع دی ہے کہ GPT-5.6 Sol ARC-AGI-3 پر 38.3 فیصد تک پہنچ گیا ہے، جس نے Anthropic کے Claude Opus 5 کو پیچھے چھوڑ دیا، جس نے پہلے بینچ مارک کے ریکارڈ کو چار گنا کرنے کے بعد 30.2 فیصد اسکور کیا۔ انتباہ اہم ہے: کہ 38.3 فیصد اعداد و شمار OpenAI کے ریسپانس API کی دو مخصوص خصوصیات پر منحصر ہے۔

پہلا ریٹینڈ ریزننگ ہے، جو ہر ایک عمل کے بعد اسے ترک کرنے کے بجائے مراحل کے درمیان سوچ کے ماڈل کے سلسلے کو محفوظ رکھتا ہے۔ دوسرا Compaction ہے، جو پرانے سیاق و سباق کو تراشنے کے بجائے اس کا خلاصہ کرتا ہے، جس سے ماڈل کو پہلے کی دلیل کو کھوئے بغیر طویل مسائل پر کام جاری رکھنے کی اجازت ملتی ہے۔

ARC پرائز کے آفیشل معیاری استعمال کے ذریعے چلائیں — جو جان بوجھ کر سیب سے سیب کے موازنہ کو یقینی بنانے کے لیے فراہم کنندہ کی مخصوص ترتیبات سے گریز کرتا ہے — GPT-5.6 Sol نے صرف 7.8 فیصد کا انتظام کیا۔ اوپن اے آئی کا استدلال ہے کہ اس کی وجہ یہ ہے کہ آفیشل سیٹ اپ ہر قدم کے بعد ماڈل کے استدلال کو رد کر دیتا ہے، جس سے ان کاموں پر کارکردگی میں اضافہ ہوتا ہے جن کے لیے مستقل کثیر مرحلہ سوچ کی ضرورت ہوتی ہے۔

پاکیزگی کے لیے بنایا گیا ایک بینچ مارک

ARC-AGI-3 کو François Chollet اور ARC پرائز ٹیم نے ڈیزائن کیا تھا تاکہ ایک ماڈل کی نئی استدلال کی پہیلیاں حل کرنے کی صلاحیت کی جانچ پڑتال کی جا سکے جو اس نے پہلے کبھی نہیں دیکھی تھی - حفظ علم کے بجائے عمومی ذہانت کا امتحان۔ موازنہ کو منصفانہ رکھنے کے لیے، آفیشل ہارنس جان بوجھ کر فراہم کنندہ کی مخصوص خصوصیات کو ہٹا دیتا ہے، غیر جانبدار ماحول میں خام ماڈل کی صلاحیت کی پیمائش کرتا ہے۔

OpenAI کی جوابی دلیل یہ ہے کہ یہ غیر جانبداری ایک معذوری بن سکتی ہے۔ کمپنی کا دعویٰ ہے کہ آفیشل استعمال ایک پرانے "اوپن اے آئی طرز کی تکمیلات API" پر انحصار کرتا ہے جس میں کلاڈ API کی پہلے سے پیش کردہ صلاحیتوں کا فقدان تھا، جس نے مؤثر طریقے سے OpenAI کو اصل مقابلے میں Anthropic کے مقابلے میں ساختی نقصان میں ڈال دیا۔

خلاصہ یہ ہے کہ OpenAI کہہ رہا ہے: آپ نے ہمارے ماڈل کو اس کی پیٹھ کے پیچھے بندھے ہوئے ایک ہاتھ سے ناپا۔

چولیٹ کا جواب

ARC پرائز کے شریک بانی François Chollet نے دو قسم کے ٹیسٹ سیٹ اپ کے درمیان واضح لکیر کھینچ کر جواب دیا۔ انہوں نے کہا کہ "بینچ مارک کو حل کرنے کے لیے اپنی مرضی کے مطابق بنایا گیا ہے یا جس میں بینچ مارک فارمیٹ کے بارے میں معلومات ہیں" حد سے باہر ہیں۔ لیکن عمومی مقصد والی API ترتیبات "جو ARC-AGI-3 کے لیے تیار نہیں کی گئی تھیں اور جو تمام API صارفین کے لیے دستیاب ہیں" منصفانہ گیم ہیں۔

درحقیقت، Chollet نے تسلیم کیا کہ ARC پرائز کے اپنے GPT-5.6 سول سکور نے OpenAI کو نقصان پہنچایا۔ انہوں نے نوٹ کیا کہ تنظیم نے "اوپن اے آئی کے ساتھ بہت آگے پیچھے اس بارے میں بہت کچھ کیا ہے کہ کس طرح ان کے ماڈلز کو بہترین طریقے سے جانچنا ہے، خاص طور پر کمپیکشن کے حوالے سے" اور کمپنی کا خیرمقدم کیا "جواب تلاش کرنا شروع کر دیا ہے۔"

Chollet نے ایک باقی تشویش کو جھنڈا دیا۔ مختلف سیٹنگز استعمال کرنے والے مختلف فراہم کنندگان اس چیز کو تخلیق کرتے ہیں جسے انہوں نے "ممکنہ برابری کا مسئلہ" کہا ہے — لیکن وہ اسے قابل قبول سمجھتا ہے "جب تک کہ سیٹنگز اور لاگت کی واضح طور پر اطلاع نہ ہو۔"

یہ لیڈر بورڈ سے آگے کیوں اہم ہے۔

یہ واقعہ ایک تناؤ کی نشاندہی کرتا ہے جو نئی شکل دے رہا ہے کہ AI صنعت کس طرح ترقی کا جائزہ لیتی ہے۔ چونکہ ماڈلز اسٹینڈ اسٹون سسٹم کے بجائے فیچر سے بھرپور APIs کے ذریعے تیزی سے تعینات کیے جا رہے ہیں، اس لیے ماڈل کی موروثی صلاحیت اور اس کے ارد گرد کی انجینئرنگ کے درمیان لائن دھندلی ہوتی رہتی ہے۔ ایک بینچ مارک جو سہاروں کو نظر انداز کرتا ہے حقیقی دنیا کی کارکردگی کو کم کر سکتا ہے۔ جو اسے قبول کرتا ہے وہ کمپنیوں کو ٹیسٹ گیمنگ کے لیے انعام دے سکتا ہے۔

ARC-AGI-3 بحث آخری ہونے کا امکان نہیں ہے۔ جیسا کہ فرنٹیئر ماڈلز قائم کردہ معیارات کے اوپری حصے کے قریب ہوتے ہیں، اس بات پر اختلاف جو کہ ایک منصفانہ پیمائش کے طور پر شمار کیا جاتا ہے — اور جن کا استعمال معیار کو متعین کرتا ہے — مزید شدت اختیار کرے گا۔

AI سے آگے رہیں

ماڈلز، بینچ مارکس اور ان کی تعمیر کرنے والی لیبز پر بریکنگ اے آئی نیوز کی پیروی کرنا چاہتے ہیں؟ AI Buzz Wire نے آپ کو کور کیا ہے۔

مزید AI خبریں پڑھیں