بینچ مارکنگ فرم مصنوعی تجزیہ نے 4 ستمبر 2026 کو اپنے انٹیلی جنس انڈیکس کا ورژن 4.2 جاری کیا، یہ ایک عبوری اپ ڈیٹ ہے جو کہ فرنٹیئر AI ماڈلز کی پیمائش کیسے کرتا ہے - اور نئے لیڈر بورڈ کے مطابق، Anthropic's Claude Fable 5.1 سرفہرست مقام رکھتا ہے، OpenAI کے GPT-6 Astra- کے بعد GPT-6 Astra- کے بعد دوسرے نمبر پر۔

یہ اپ ڈیٹ جنوری میں Index v4 کے لانچ ہونے کے ٹھیک آٹھ ماہ بعد سامنے آئی ہے، جو کہ فرم کی غیر معمولی تیزی سے تبدیلی حالیہ فرنٹیئر ریلیز کی رفتار سے منسوب ہے۔ "پچھلے ہفتوں میں سرحد اتنی تیزی سے آگے بڑھنے کے ساتھ، ہم محسوس کرتے ہیں کہ فوری طور پر عبوری اپ ڈیٹ فراہم کرنا ضروری ہے تاکہ یہ یقینی بنایا جا سکے کہ ہمارا انڈیکس ہمیشہ کی طرح متعلقہ اور مفید رہے،" کمپنی نے اپنے اعلان میں لکھا۔

سرخی کی درجہ بندی

شائع شدہ نتائج کے مطابق، Anthropic's Claude Fable 5.1 انڈیکس میں سب سے آگے ہے، اس کے بعد OpenAI کا GPT-6 Astra ہے، جس نے GPT-5.6 Sol کے مقابلے میں چار پوائنٹس کو بہتر کیا ہے۔ میٹا لیڈر بورڈ پر تیسری مضبوط ترین لیب کے طور پر اس کے بعد SpaceXAI، Moonshot/Kimi، Z.AI، اور Google کا درجہ رکھتا ہے۔

اینتھروپک اور اوپن اے آئی نے بھی اپ ڈیٹ شدہ لاگت کی کارکردگی کی تصویر شیئر کی ہے: دونوں کمپنیاں، میٹا اور Z.AI کے ساتھ، انڈیکس کے "کاسٹ فی ٹاسک" پریٹو فرنٹیئر پر قابض ہیں، یعنی فی الحال کوئی بھی دوسری لیب یکساں قیمت فی مکمل کام کے لیے سختی سے بہتر انٹیلی جنس پیش نہیں کرتی ہے۔

ٹوکن کی کارکردگی پر، مصنوعی تجزیہ نے GPT-6 Astra "انٹیلی جنس فرنٹیئر کے قریب تقریباً ہر دوسرے ماڈل سے زیادہ ٹوکن موثر پایا،" کلاڈ فیبل 5.1، گروک 4.5، اور جیمنی 3.5 فلیش لائٹ وکر کے دونوں سرے پر بیٹھے ہیں۔ فرم نے ایک ساتھی تجزیہ میں نوٹ کیا، تاہم، Astra کا کم ٹوکن استعمال اس کی زیادہ قیمتوں سے زیادہ ہے - ایک یاد دہانی کہ خام کارکردگی اور کل لاگت ہمیشہ ایک ساتھ نہیں چلتی۔

v4.2 میں کیا تبدیل ہوا۔

سب سے اہم ساختی تبدیلی بینچ مارک گیمنگ کے خلاف جان بوجھ کر دباؤ ہے۔ انڈیکس کا چالیس فیصد وزن اب پرائیویٹ، ہولڈ آؤٹ ٹیسٹ سیٹس سے آتا ہے — v4.1 میں حصہ دوگنا — بشمول AA-Briefcase، AA-Omniscience، اور CritPt کے حل۔ فرم نے کہا کہ انڈیکس v5 میں اعداد و شمار مزید بڑھیں گے۔

دو نئے تجزیے اپ ڈیٹ کو لنگر انداز کرتے ہیں:

  • AA-بریف کیس، ایک اندرون خانہ ایجنٹی علمی کام کا بینچ مارک جس میں پرائیویٹ ہولڈ آؤٹ ٹیسٹ سیٹ ہے۔ ماڈلز کی جانچ کئی ہفتوں کے پیشہ ورانہ پروجیکٹس پر کی جاتی ہے، ہر ایک میں بہت سے منسلک کاموں اور ہزاروں ان پٹ سورس فائلوں کے ساتھ، اور قابل تصدیق کام کی کامیابی، تجزیاتی معیار، اور پریزنٹیشن کے معیار کو شامل کرتے ہوئے روبرک اسکورنگ اور جوڑے کے لحاظ سے موازنہ کے امتزاج کے ذریعے درجہ بندی کی جاتی ہے۔
  • GDP.pdf، سرج AI کے ذریعہ تخلیق کیا گیا ہے، جو پیشہ ورانہ دستاویزات میں سنگل ٹرن استدلال کی جانچ کرتا ہے: دس ڈومینز پر محیط 100 پی ڈی ایف، ثبوت کے ساتھ 4,592 صفحات کے متن، ٹیبلز، چارٹس اور فوٹ نوٹ میں تقسیم کیے گئے ہیں۔ جوابات کو 1,275 ماہر تصنیف کردہ جوہری معیار کے مطابق درجہ بندی کیا جاتا ہے، اور سرخی آل پاس ریٹ کسی کام کو صرف اس صورت میں کریڈٹ کرتی ہے جب ہر معیار مطمئن ہو۔

ایک دیرینہ بینچ مارک ختم ہونے والا ہے: GPQA ڈائمنڈ، گریجویٹ سطح کا سائنس ریجننگ ٹیسٹ، ہٹا دیا گیا ہے کیونکہ اسے فرنٹیئر ماڈلز کے ذریعے مؤثر طریقے سے سیر کیا گیا ہے۔

فرم نے اپنے گریڈنگ انفراسٹرکچر کو بھی اپ گریڈ کیا، AA-LCR v1.1 کو ایک نئے گریڈنگ سسٹم پرامپٹ کے ساتھ جاری کیا اور جوابی کلیدوں کو درست کیا، GDPval-AA v2 اور AA-Briefcase کے لیے Elo اسکیل کو دوبارہ اینکر کیا تاکہ نئے ماڈلز کے آتے ہی ریٹنگز مستحکم رہیں، اور SciCode کے سخت کوڈ کو اس قدر سست کر دیا جائے کہ گریڈنگ کے کوڈ کو سست کر دیا جائے۔ ناکامی

نئے ٹیسٹ سے کیا پتہ چلتا ہے۔

نئی تشخیصات کے نتائج اس بات کی زیادہ دانے دار تصویر پیش کرتے ہیں کہ فرنٹیئر لیبز اصل میں کہاں کھڑی ہیں۔

AA-بریف کیس پر، Anthropic's Claude Fable 5.1 اور Opus 5 لیڈ، اس کے بعد OpenAI's GPT-6 Astra اور Meta's Muse Spark 1.3۔ اسی تشخیص پر GPT-6 Astra نے GPT-5.6 Sol سے تقریباً 85 Elo پوائنٹس اسکور کیے ہیں - یکے بعد دیگرے OpenAI نسلوں کے درمیان ایک نمایاں چھلانگ۔

GDP.pdf پر، تصویر پلٹ جاتی ہے: OpenAI GPT-6 Astra کے ساتھ 33.2% آل پاس ریٹ پر آگے ہے، اس کے بعد GPT-5.6 Sol 28.2% پر اور Claude Fable 5.1 پر 26.2% ہے۔ انحراف سے پتہ چلتا ہے کہ بہت بڑے سیاق و سباق پر طویل دستاویز کی ترکیب OpenAI کے جدید ترین ماڈل کے لیے نسبتاً طاقت بنی ہوئی ہے، یہاں تک کہ انتھروپک کے ماڈل مجموعی انڈیکس اور ایجنٹی کام کے کاموں کی قیادت کرتے ہیں۔

پرائیویٹ ٹیسٹ سیٹ کیوں اہمیت رکھتا ہے۔

ہولڈ آؤٹ تشخیص کی طرف تبدیلی AI بینچ مارکنگ میں ایک وسیع اعتبار کے مسئلے کی عکاسی کرتی ہے۔ جیسا کہ ماڈلز نے زیادہ عوامی ٹیسٹ کے اعداد و شمار کو جذب کیا ہے، لیبز اور آزاد مبصرین کی تشویش میں اضافہ ہوا ہے کہ معروف بینچ مارکس پر سرخی کے اسکور حقیقی صلاحیت کے بجائے حفظ یا ہدف شدہ تربیت کی عکاسی کرتے ہیں۔ اپنے ٹیسٹ سیٹوں کے بڑھتے ہوئے حصے کو نجی رکھ کر اور انہیں زیادہ وزن دے کر، مصنوعی تجزیہ اس سگنل کو محفوظ رکھنے کی کوشش کر رہا ہے کہ عوامی لیڈر بورڈز کھو رہے ہیں۔

فرم نے کہا کہ وہ "مہینوں سے" انڈیکس v5 کے عناصر بنا رہی ہے اور بڑے ماڈل لانچوں کی حالیہ لہر کے ذریعے انڈیکس کو مستحکم رکھنے کے لیے جان بوجھ کر اپ ڈیٹس کو روک رہی ہے۔ عبوری v4.2 ریلیز کے علاوہ، یہ مستقبل قریب میں مزید اضافی اپ ڈیٹس کی منصوبہ بندی کرتا ہے کیونکہ یہ v5 کی منتقلی کو مکمل کرتا ہے۔

فرنٹیئر ماڈلز کے درمیان انتخاب کرنے والے خریداروں کے لیے، v4.2 سے عملی فائدہ یہ ہے کہ مارکیٹ کا سب سے اوپر Anthropic اور OpenAI کے درمیان دو گھوڑوں کی دوڑ بنی ہوئی ہے، جس میں Meta اس خلا کو ختم کر رہا ہے — اور یہ کہ گیمنگ کے خلاف مزاحم ہونے کے لیے ڈیزائن کیے گئے تشخیص اب درجہ بندی کا زیادہ کام کر رہے ہیں۔ ماڈل کے انتخاب کے فیصلوں پر نظر رکھنے والے صارفین AI کی تازہ ترین پیشرفت کی پیروی کر سکتے ہیں جیسے جیسے v5 رول آؤٹ قریب آتا ہے۔

AI سے آگے رہیں

اس طرح کے بینچ مارک اپ ڈیٹس نئی شکل دیتے ہیں کہ انڈسٹری کی ترقی کیسے ہوتی ہے۔ مزید AI خبریں پڑھیں اور ہر ماڈل کی ریلیز سے آگے رہیں۔

مزید AI خبریں پڑھیں →