آزاد بینچ مارکنگ فرم مصنوعی تجزیہ کے مطابق، OpenAI نے 29 ستمبر کو GPT-6.1 Sol کو جاری کیا، اس ماڈل کے ڈیبیو کے صرف سات دن بعد GPT-6 Sol کو ریٹائر کر دیا۔ یہ تبادلہ کمپنی کی DevDay ڈویلپر کانفرنس کے ساتھ ہوا، جہاں CNET نے اطلاع دی کہ حاضرین نئے شروع کیے گئے ڈاٹس ایجنٹس اور سبسکرپشن کی تبدیلیوں کے ایک سیٹ کے ساتھ فوری طور پر GPT-6.1 Sol کا استعمال شروع کر سکتے ہیں۔

2026 کے تیز رفتار معیارات کے باوجود سات دن کے فلیگ شپ سے فلیگ شپ کی تبدیلی غیر معمولی ہے، اور بینچ مارک بتاتے ہیں کہ OpenAI تیزی سے کیوں منتقل ہوا۔ ماڈل کی لانچوں، بینچ مارک لڑائیوں، اور ان کے نیچے قیمتوں کی جنگ کی مسلسل کوریج کے لیے، AI Buzz Wire ان پیش رفتوں کا پتہ لگاتا ہے جو ہوتے ہی اہم ہیں۔

سات دنوں میں ایک قابل پیمائش چھلانگ

مصنوعی تجزیہ رپورٹ کرتا ہے کہ GPT-6.1 Sol نے GPT-6 Sol کے مقابلے فرم کے انٹیلی جنس انڈیکس پر 4 پوائنٹس حاصل کیے، اور GPT-5.6 Sol پر 5 پوائنٹس، OpenAI کے سب سے قابل ماڈل GPT-6 Astra سے صرف 1 پوائنٹ نیچے اترے۔ فرم کی تشخیص استدلال، علمی کام، ریاضی، اور ایجنٹی کاموں کو ایک واحد تقابلی اسکور میں ملا دیتی ہے۔

ذیلی اسکور ظاہر کرتے ہیں کہ فوائد کہاں مرکوز ہیں۔ GPT-6.1 Sol نے AA-Briefcase v1.1 میں 4 پوائنٹس اور GDPval-AA v2.1 میں 5 پوائنٹس کو بہتر کیا، یہ دونوں ہی ایجنٹی علم کے کام کی جانچ کرتے ہیں۔ حقیقی ٹرمینل ماحول میں مادی طور پر بہتر کارکردگی کے لیے ٹرمینل-بینچ 4.0 پوائنٹس میں 12 پوائنٹ کی چھلانگ، جبکہ ہیومینٹی کے آخری امتحان میں 5 پوائنٹس اور GDP.pdf میں 6 کا اضافہ ہوا۔

ایک نمبر ہر اس شخص کے لیے نمایاں ہے جو تحقیق کے لیے ماڈلز کا استعمال کرتا ہے: AA-Omniscience پر درستگی 8 پوائنٹس پر چڑھ گئی جب کہ فریب کاری کی شرح 60 فیصد سے گر کر 54 فیصد ہوگئی۔ دونوں اعداد و شمار مطلق طور پر بلند رہتے ہیں، لیکن سفر کی سمت کام کے بہاؤ کے لیے اہمیت رکھتی ہے جہاں پر اعتماد غلط جواب جواب نہ ہونے سے بدتر ہوتا ہے۔

ایک ہی اسٹیکر کی قیمت، عملی طور پر سستی۔

قیمت کے تعین پر، GPT-6.1 Sol GPT-6 Sol کا ریٹ کارڈ $2 فی ملین ان پٹ ٹوکنز اور $10 فی ملین آؤٹ پٹ ٹوکن رکھتا ہے، لیکن کیش ریڈ ڈسکاؤنٹ 90 فیصد سے بڑھ کر 95 فیصد ہو جاتا ہے۔ مصنوعی تجزیہ نوٹ کرتا ہے کہ ایجنٹی کام کے بوجھ کے لیے GPT-6.1 Sol کی ملاوٹ شدہ قیمت اس لیے GPT-6 Sol's سے قدرے کم ہے، جس سے قیمتوں میں مؤثر کٹوتیوں کا سلسلہ شروع ہوا جو اس وقت شروع ہوا جب GPT-6 Sol نے GPT-5.6 Sol پر 50 فیصد رعایت پر لانچ کیا۔

قیمتوں کا تعین یہاں کی اصل کہانی ہے۔ دو ریلیز کی مدت کے اندر، OpenAI نے اپنی وسط درجے کی سرحدی لائن کی مؤثر لاگت کو دو بار تقریباً نصف کر دیا ہے، جبکہ ہر بار معیار کو اوپر کی طرف جھکایا ہے۔

فی کام لاگت: $0.72 بمقابلہ $3.26

فی کام لاگت وہ جگہ ہے جہاں GPT-6 Astra کے ساتھ فرق بالکل واضح ہو جاتا ہے۔ زیادہ سے زیادہ کوشش پر، مصنوعی تجزیہ GPT-6.1 Sol کو $0.72 فی انٹیلی جنس انڈیکس ٹاسک پر پیش کرتا ہے، جو GPT-6 Astra کے $3.26 کے ایک چوتھائی سے بھی کم ہے۔ اس کے اپنے پیشرو کے مقابلے میں بچت 31 فیصد (GPT-6 Sol کے لیے $1.05) ہے، اور GPT-5.6 Sol کے مقابلے میں وہ 64 فیصد ($1.99) تک پہنچ جاتی ہے۔

فرم کے مطابق، GPT-6.1 Sol کی ہر کوشش کی سطح لاگت کی کارکردگی کو آگے بڑھاتی ہے Pareto Frontier — یعنی کہ ذہانت کی دی گئی سطح کے لیے، اس کے ٹریک کردہ ماڈلز میں کوئی سستا آپشن موجود نہیں ہے۔ ٹوکن کی کارکردگی کی تصویر زیادہ ملی جلی ہے: GPT-6.1 Sol کوشش کی سطحوں پر GPT-6 Sol کے مقابلے میں تقریباً 10 سے 30 فیصد زیادہ آؤٹ پٹ ٹوکن استعمال کرتا ہے، حالانکہ اس کی کم اور درمیانی کوشش کی ترتیبات ٹوکن کی کارکردگی کے لیے Pareto-بہترین رہتی ہیں ایک بار جب اعلی ذہانت کا عنصر ہوتا ہے۔ کوڈنگ ایجنٹ انڈیکس۔

سات دن کی تبدیلی کیوں اہمیت رکھتی ہے۔

DevDay کی وسیع تر سلیٹ اسی تصویر کو تقویت دیتی ہے۔ CNET کی رپورٹ نے کانفرنس کو تین چیزوں کے ارد گرد تیار کیا جو ڈویلپر ابھی استعمال کر سکتے ہیں - GPT-6.1 Sol، ڈاٹس ایجنٹس، اور دوبارہ کام کیے گئے سبسکرپشن پلانز - دور دراز کے تحقیقی پیش نظارہ کے بجائے۔ ڈویلپرز کو پیغام آج دستیابی تھا، کل امکان نہیں۔

فلیگ شپ اس مختصر اشارے کو تقویت دیتا ہے کہ مسابقتی رکاوٹ ٹریننگ رن سے پوسٹ ٹریننگ ریفائنمنٹ اور سرونگ انفراسٹرکچر کی طرف منتقل ہو گئی ہے۔ ایک پوائنٹ لیول اپ گریڈ جو ایک ہفتے میں بھیجتا ہے ایک بہتر چیک پوائنٹ اور ایک نئے پرائس شیٹ کی طرح لگتا ہے جیسا کہ شروع سے شروع ہونے والے فاؤنڈیشن ماڈل کے مقابلے میں، اور حریف بھی اسی طرح برتاؤ کر رہے ہیں: گوگل نے 30 ستمبر کو Gemini 4 Argon کا اعلان کیا، ایک فرنٹیئر ماڈل جو ابتدائی طور پر اپنے Fairwind پروگرام کے ذریعے قابل اعتماد سائبر ڈیفنڈرز تک پہنچ رہا ہے۔

ڈویلپرز کے لیے، تصدیق شدہ نمبروں سے تین عملی راستے ہیں۔ سب سے پہلے، بھاری کیش کے دوبارہ استعمال والے ایجنٹی ورک بوجھ کو 95 فیصد کیش ڈسکاؤنٹ سے فوری فائدہ ہوتا ہے۔ دوسرا، بجٹ کو ہجرت کرنے سے پہلے زیادہ آؤٹ پٹ ٹوکن کی کھپت کا نمونہ بنانا چاہیے، کیونکہ فی ٹوکن قیمت میں کوئی تبدیلی نہیں ہوتی چاہے ماڈل زیادہ سوچتا ہو۔ تیسرا، Astra ان کاموں کے لیے زیادہ سے زیادہ حد بنا ہوا ہے جہاں ذہانت کا آخری نقطہ 4x لاگت کے پریمیم کے قابل ہے — GPT-6.1 Sol کا معاملہ یہ ہے کہ زیادہ تر کاموں کے لیے ایسا نہیں ہے۔

دہرانے کے قابل انتباہ: یہ اعداد و شمار ایک آزاد تشخیص کار سے آتے ہیں، اگرچہ اس کا طریقہ کار کتنا ہی سخت ہو، اور انڈیکس اسکورز کام کے بوجھ کے مخصوص مرکب کو انعام دیتے ہیں۔ ڈیمانڈنگ ورک بوجھ والی ٹیموں کو پروڈکشن ٹریفک کو ری روٹ کرنے سے پہلے اپنی تشخیصات کو دوبارہ چلانا چاہئے۔

---

AI سے آگے رہیں

تازہ ترین AI خبریں، تجزیہ اور کامیابیاں حاصل کریں — سب ایک جگہ پر۔

مزید AI خبریں پڑھیں →