انسیپشن لیبز نے منگل کو مرکری 2.5 جاری کیا، جو اس کے کمرشل ڈفیوژن لینگویج ماڈل کا ایک نیا ورژن ہے جسے کمپنی مارکیٹ میں سب سے زیادہ قابل ڈفیوژن ایل ایل ایم کے طور پر بیان کرتی ہے اور اس کے علم کے مطابق، اب تک کا سب سے بڑا ڈفیوژن لینگویج ماڈل تربیت یافتہ ہے۔ کمپنی کے اعلان کے مطابق، یہ ماڈل اپنے پیشرو مرکری 2 کے مقابلے ذہانت میں 40 فیصد اضافہ فراہم کرتا ہے، جبکہ اسی کم لیٹنسی، کم لاگت والے سرونگ پروفائل کو برقرار رکھتے ہوئے جس نے ڈفیوژن آرکیٹیکچر کو زیادہ حجم کے کام کے بوجھ کے لیے پرکشش بنا دیا ہے۔

سی ای او سٹیفانو ایرمون کی قیادت میں کمپنی کا دعویٰ ہے کہ مرکری 2.5 لاگت کے لحاظ سے بہتر فرنٹیئر ماڈلز کے ساتھ موازنہ ہے جس میں GPT-5.6 لونا (کم)، جیمنی 3.5 فلیش لائٹ اور کلاڈ ہائیکو 4.5 شامل ہیں۔ وہ موازنہ وینڈر کی طرف سے رپورٹ کیے گئے ہیں اور ابھی تک ان کی تصدیق آزاد بینچ مارکس سے نہیں ہوئی ہے، لیکن وہ ایک پھیلاؤ ماڈل — ایک طویل تحقیقی تجسس — کو خود بخود ذمہ داروں کے پروڈکشن متبادل کے طور پر رکھتے ہیں۔ AI ماڈل کی تازہ ترین خبروں کے لیے، AI Buzz Wire کی جاری ماڈل کوریج کو فالو کریں۔ اے آئی ماڈل کی تازہ ترین خبریں

رفتار، سیاق و سباق اور قیمت

سرخی کے نمبر جارحانہ ہیں۔ Inception Labs کا کہنا ہے کہ مرکری 2.5 وسیع پیمانے پر دستیاب NVIDIA GPUs پر 1,107 ٹوکن فی سیکنڈ تیار کرتا ہے، جس کی سیاق و سباق کی ونڈو 260,000 ٹوکنز ہے۔ قیمت کا تعین $0.20 فی ملین ان پٹ ٹوکنز اور $0.75 فی ملین آؤٹ پٹ ٹوکنز پر مقرر کیا گیا ہے، لانچ پروموشن کے ساتھ ماڈل میں 80% سے $0.04 فی ملین ان پٹ اور $0.15 فی ملین آؤٹ پٹ کی چھوٹ ہے۔

قابلیت کی طرف، ماڈل ٹیون ایبل استدلال کے ساتھ بھیجتا ہے — ڈویلپرز کو فی درخواست کی بنیاد پر گہرائی کے لیے لیٹنسی ٹریڈ کرنے دیتا ہے — ساتھ ساتھ متوازی ٹول کالز اور اسٹرکچرڈ جنریشن کے لیے اسکیما سے منسلک JSON آؤٹ پٹ۔ کمپنی نے ریلیز کو پروڈکشن ٹیلی میٹری کے ذریعے چلنے والے ٹریننگ لوپ کے پہلے نتیجے کے طور پر تیار کیا ہے: جب سے مرکری 2 لانچ ہوا ہے، ہزاروں ڈویلپرز نے اسے بنایا ہے، درجنوں کاروباری اداروں نے اسے تعینات کیا ہے، اور استعمال میں ایک ترتیب سے زیادہ اضافہ ہوا ہے۔

کیوں ڈفیوژن ماڈلز تیزی سے ٹیکسٹ تیار کرتے ہیں۔

OpenAI، Google اور Anthropic کے مین اسٹریم ایل ایل ایم خود بخود ہیں: وہ ایک وقت میں ٹیکسٹ ایک ٹوکن تیار کرتے ہیں، ہر ٹوکن اس سے پہلے پیدا ہونے والی ہر چیز پر مشروط ہوتا ہے۔ یہ سلسلہ وار انحصار نسل کی رفتار کے نیچے سخت منزل رکھتا ہے۔ ڈفیوژن لینگویج ماڈل اس کے بجائے شور کے ایک بلاک سے شروع ہوتے ہیں اور متوازی طور پر تمام ٹوکنز کو متوازی طور پر بہتر کرتے ہیں، جو روایتی GPU ہارڈویئر پر بہت زیادہ تھرو پٹ کی اجازت دیتا ہے جب ماڈل کو صاف طور پر اکٹھا ہونے کی تربیت دی جاتی ہے۔

ٹریڈ آف تاریخی طور پر معیاری رہا ہے: بازی ماڈلز نے استدلال اور ہدایات کے بعد معیارات پر خود بخود پیچھے ہٹنے والوں کو پیچھے چھوڑ دیا ہے۔ انسیپشن لیبز کی بنیادی شرط — اور مرکری 2.5 کے تحت ہونے والا دعوی — یہ ہے کہ یہ فرق اس حد تک کم ہو گیا ہے جہاں زیادہ تر صارفین حقیقت میں محسوس کرتے ہیں کہ پھیلاؤ کی جیت ہوتی ہے: پیداوار کے حجم پر تاخیر اور لاگت۔

ابتدائی صارفین کی طرف سے پیداوار کے دعوے

اعلان بینچ مارک ٹیبلز کے بجائے کسٹمر کی تعیناتیوں پر بہت زیادہ جھکاؤ رکھتا ہے۔ اوپن کال، جو لائیو کسٹمر کالز کے لیے AI فون ایجنٹس بناتا ہے، نے اطلاع دی کہ مرکری میں منتقل ہونے سے اس کے میڈین ماڈل کے ردعمل میں تاخیر تقریباً 170 ملی سیکنڈز تک پہنچ گئی۔ اوپن کال کے شریک بانی اور سی ای او اولیور سلورسٹائن نے کہا کہ کمپنی کا P99 رسپانس ٹائم کئی منٹ سے ایک سیکنڈ تک گر گیا، اور اس کا میڈین 0.4 سیکنڈ سے کم ہو کر 0.2 تک رہ گیا — وہ اعداد و شمار جو انہوں نے کسی بھی دوسرے فراہم کنندہ کے مقابلے میں نمایاں طور پر تیز بتائے ہیں جن کا کمپنی نے تجربہ کیا تھا، بشمول استدلال فعال۔

Augment Code، ایک AI کوڈنگ اسسٹنٹ بنانے والا، مرکری کو سیاق و سباق کو کم کرنے، ماڈل روٹنگ اور MCP ٹول کی تلاش کے لیے استعمال کرتا ہے۔ انسیپشن لیبز کے مطابق، مرکری میں کمپیکشن ورک بوجھ کو منتقل کرنے سے اس قدم کی تاخیر کو 82 فیصد کم کر دیا گیا، تقریباً 150 سیکنڈ سے 27 سیکنڈ تک، اور کوالٹی کو برقرار رکھتے ہوئے اس کی لاگت میں %90 کمی ہوئی۔ استعمال کا کیس واضح کرتا ہے کہ معاشیات کہاں کاٹتی ہے: کوڈنگ ایجنٹ ہر پرائمری جنریشن کے ارد گرد بہت سی چھوٹی سپورٹنگ ماڈل کالز کرتے ہیں، اور ان کالوں میں تاخیر اور لاگت کا مرکب ہوتا ہے۔

NVIDIA، جس کا ہارڈویئر ماڈل چلاتا ہے، اس میں بھی وزن تھا۔ NVIDIA کے ایکسلریٹڈ کمپیوٹنگ گروپ میں پروڈکٹ کی ایک سینئر مینیجر شروتی کوپارکر نے کہا کہ Inception نے NVIDIA AI انفراسٹرکچر پر ڈفیوژن پر مبنی لینگویج ماڈلز کو آگے بڑھایا ہے، اور یہ کہ مرکری 2.5 کی کوالٹی سٹیپ اپ کے ساتھ پائیدار پروڈکشن کی نئی رفتار کیسے دکھا سکتی ہے۔ نظام

مرکری وائس اور مرکری راؤٹر کے پیش نظارے۔

ماڈل کے ساتھ، Inception Labs نے دو نئی مصنوعات کے پیش نظارہ کا اعلان کیا۔ مرکری وائس ایک ڈفیوژن ایل ایل ایم ہے جسے صوتی ایجنٹوں کے لیے سب سے سخت لیٹنسی بجٹ کے ساتھ بہتر بنایا گیا ہے، 170 ملی سیکنڈز کے تحت ٹائم ٹو فرسٹ ٹوکن کی تشہیر کی جاتی ہے۔ مرکری راؤٹر آنے والے اشارے کو سمجھنے کے لیے ایک ڈفیوژن ماڈل کا استعمال کرتا ہے اور انہیں کسی بھی ماڈل تک لے جاتا ہے — کھلا یا بند — معیار، رفتار اور لاگت کا بہترین امتزاج پیش کرتا ہے، پوزیشننگ Inception اپنے حریف کے اوپر ایک پرت کے طور پر اور ساتھ ہی ساتھ ان میں سے ایک ہے۔

مرکری 2.5 Inception کے اپنے API کے ساتھ ساتھ Baseten اور OpenRouter کے ذریعے دستیاب ہے۔ انٹرپرائز کی تعیناتیوں میں وقف صلاحیت، آٹو اسکیلنگ، تعمیل کنٹرول اور قابل ترتیب ڈیٹا برقرار رکھنے کا اضافہ ہوتا ہے۔ کمپنی API کو آزمانے والے ڈویلپرز کو 100 ملین مفت ٹوکن پیش کر رہی ہے۔

کمپنی نے یہ بھی کہا کہ اس نے پہلے ہی اپنے اگلے ماڈل کی تربیت شروع کر دی ہے - اس کا ابھی تک کا سب سے بڑا، آنے والے مہینوں میں ریلیز کے لیے ہدف بنایا گیا ہے - جسے یہ صلاحیت میں چھلانگ کے طور پر بیان کرتا ہے جو بازی کی رفتار یا ٹوکن کی کارکردگی کو ترک نہیں کرتا ہے۔ اگر یہ دعویٰ برقرار رہتا ہے، تو مارکیٹ کے اجناس کے درجات میں پہلے خود بخود ذمہ داروں پر دباؤ محسوس کیا جائے گا، جہاں قیمت اور تاخیر زیادہ تر معاہدوں کا فیصلہ کرتی ہے۔

AI سے آگے رہیں

AI کی تازہ ترین پیشرفت اور مصنوعی ذہانت سے متعلق خبروں کی پیروی کریں کیونکہ نئے ماڈل آرکیٹیکچرز پروڈکشن میں دوڑ رہے ہیں۔

مزید AI خبریں پڑھیں →