NVIDIA نے Nemotron 3 Embed جاری کیا ہے، جو ایمبیڈنگ ماڈلز کا ایک کھلا مجموعہ ہے جسے پاور پروڈکشن اسکیل ریٹریول-آگمینٹڈ جنریشن (RAG)، ایجنٹی بازیافت، کوڈ کی بازیافت، اور ایجنٹ میموری کے لیے ڈیزائن کیا گیا ہے۔ 17 جولائی 2026 کو MarkTechPost کی طرف سے تفصیلی ریلیز، اس پرت کے طور پر پہنچی ہے جو یہ فیصلہ کرتی ہے کہ AI ایجنٹ کون سے حصّوں کو دیکھتا ہے ایک مسابقتی میدان بن جاتا ہے، اس پبلیکیشن کے بریکنگ AI نیوز ڈیسک کے ایک رجحان کے بعد انٹرپرائزز چیٹ بوٹس پر نالج بوٹس پر عمل کرنے والے نظام سے دوبارہ کام کی طرف بڑھتے ہیں۔

سرایت کرنے والے ماڈل فیصلہ کرتے ہیں کہ ایجنٹ کبھی کون سے حصئوں کو دیکھتا ہے، جو انہیں تخلیقی AI اسٹیک میں ایک پرسکون لیکن فیصلہ کن چوک پوائنٹ بناتا ہے۔ NVIDIA نے اس پرت کو مضبوط کرنے کے لیے Nemotron 3 Embed بنایا۔ مجموعہ میں تین کھلی چوکیاں شامل ہیں: Nemotron-3-Embed-8B-BF16، درستگی کا پہلا آپشن؛ Nemotron-3-Embed-1B-BF16، جو ایک ہی ڈیزائن کو چھوٹے نقش میں لے جاتا ہے۔ اور Nemotron-3-Embed-1B-NVFP4، ایک بلیک ویل آپٹمائزڈ 4 بٹ ویرینٹ۔ تینوں ٹرانسفارمر انکوڈرز ہیں جن کو دو طرفہ توجہ کے ماسکنگ کے ساتھ تربیت دی گئی ہے، جس میں حتمی ایمبیڈنگ ٹوکن سطح کی نمائندگی پر اوسط پولنگ کے ذریعہ تیار کی گئی ہے۔ ہر ایک 32,768 ٹوکن کی زیادہ سے زیادہ ترتیب کی لمبائی کو سپورٹ کرتا ہے۔

لیڈر بورڈ کو ٹاپ کرنا

سرخی کا نتیجہ یہ ہے کہ Nemotron-3-Embed-8B-BF16 اپنے 16 عوامی کاموں میں 17 جولائی 2026 تک RTEB، بازیافت ایمبیڈنگ بینچ مارک پر مجموعی طور پر پہلے نمبر پر ہے۔ اسکور کو 4,096 ماڈل کی ترتیب کی لمبائی پر اوسط NDCG@10 کے طور پر ماپا جاتا ہے۔ NVIDIA نے 34 زبانوں میں ہر ماڈل کا جائزہ لیا، اور تینوں چوکیوں کو OpenMDW لائسنس ایگریمنٹ ورژن 1.1 کے تحت جاری کیا گیا ہے، جس سے وہ ڈویلپرز کو ڈاؤن لوڈ، چلانے، اور ترمیم کرنے کے لیے آزادانہ طور پر دستیاب ہیں۔

خاص طور پر، ماڈل کے اڈے Mistral سے بنائے گئے ہیں۔ MarkTechPost کی رپورٹ کے مطابق، 8B چیک پوائنٹ Ministral-3-8B-Instruct-2512 پر بنایا گیا ہے، جبکہ 1B کے دونوں ویریئنٹس Ministral-3-3B-Instruct-2512 کا استعمال کرتے ہیں۔ NVIDIA کا مکمل طور پر اندرون ملک فن تعمیر کے بجائے Mistral کی بنیاد پر تعمیر کرنے کا فیصلہ اس بات کی عکاسی کرتا ہے کہ فلوڈ ماڈل کی ترقی کس طرح ہوئی ہے، کھلے اڈوں کو معمول کے مطابق دوبارہ تیار کیا جاتا ہے اور خصوصی کاموں کے لیے دوبارہ تربیت دی جاتی ہے۔

کمپریشن، کوئی چھوٹی ٹریننگ رن نہیں۔

کارکردگی کے دو فرق نمایاں ہیں۔ 1B ماڈل نے پچھلی نسل کے lama-nemotron-embed-vl-1b-v2 بیس لائن پر 10.4 RTEB پوائنٹس حاصل کیے ہیں۔ علیحدہ طور پر، NVFP4 4 بٹ چیک پوائنٹ کی قیمت اس کے BF16 پیرنٹ کے مقابلے میں صرف 0.38 RTEB پوائنٹس ہے، جو اس کی بازیافت کی درستگی کا تقریباً 99.5 فیصد برقرار رکھتی ہے۔ یہ تقریباً نقصان کے بغیر کمپریشن ان ٹیموں کے لیے خاص طور پر اہم ہے جنہیں پیمانے پر سرایت کرنے کی ضرورت ہوتی ہے، جہاں میموری اور تخمینہ لاگت اکثر حاوی ہوتی ہے۔

وہ 1B سکور چھوٹے ٹریننگ رن کے بجائے کمپریشن پائپ لائن کے ذریعے حاصل کیے گئے تھے۔ پیرنٹ، nemotron-3-embed-3b، کو کاٹ کر دو تکراری راؤنڈز میں کشید کیا گیا تھا۔ سب سے پہلے، 3B پیرنٹ کو NVIDIA ModelOpt کی mcore_minitron نیورل آرکیٹیکچر سرچ کا استعمال کرتے ہوئے 2B میں کاٹ دیا گیا، جو چھپی ہوئی چوڑائی، FFN سائز، توجہ کے سروں، اور گہرائی کو تلاش کرتا ہے، پھر ٹاپ-10 Pareto کے سامنے سے بہترین امیدوار چنتا ہے۔ ایک 50,000 نمونہ ڈومین کیلیبریشن کارپس نے ان امیدواروں کو اسکور کیا۔

اس کے بعد، 2B ماڈل کو فائن ٹیونڈ 8B ایمبیڈنگ ٹیچر سے ڈسٹل کیا گیا، جس میں کوسائن فاصلاتی نقصان اور ایک کثیر لسانی، ان ڈومین ڈیٹا مرکب پر مربع غلطی کے نقصان کو ملایا گیا۔ 1.14B چیک پوائنٹ تیار کرنے کے لیے اسی طریقہ کار کو دہرایا گیا، جس سے یہ ظاہر ہوتا ہے کہ چھوٹی قسمیں خود مختار تربیت کے بجائے سٹرکچرڈ کمپریشن کے ذریعے بڑے ماڈل کی زیادہ تر صلاحیت کو وراثت میں رکھتی ہیں۔

بلیک ویل کی کارکردگی کے لیے بنایا گیا ہے۔

کمپریشن سرونگ فارمیٹ میں جاری ہے۔ NVFP4 ڈیٹا کی قسم کا استعمال کرتے ہوئے، تحقیقی ٹیم کے ساتھ Nvidia-modelopt v0.45.0 پر انحصار کرتے ہوئے، کوانٹائزیشن کا ہدف وزن اور صرف لکیری تہوں کی ایکٹیویشن۔ کوانٹائزیشن-آگاہی کشید کی پیروی کی گئی، بنیادی طور پر طویل ان پٹ پر درستگی کو بحال کرنے کے لیے۔ کیلیبریشن میں 512 نمونے استعمال کیے گئے، cnn_dailymail ڈیٹاسیٹ سے 256 سوالات اور 256 اقتباسات کے درمیان تقسیم، جبکہ QAD ٹریننگ 20,000 نمونوں پر مشتمل تھی۔

عملی ادائیگی NVIDIA کے جدید ترین ہارڈ ویئر پر کارکردگی ہے۔ تحقیقی ٹیم رپورٹ کرتی ہے کہ بلیک ویل پر NVFP4 BF16 کے مقابلے میں 2x زیادہ تھرو پٹ فراہم کرتا ہے جبکہ BF16 کی بازیافت کی 99% سے زیادہ درستگی کو برقرار رکھتا ہے۔ NVFP4 ماڈل کارڈ ڈائنامک ایمبیڈنگ سائزز کو بھی دستاویز کرتا ہے، جس سے ڈویلپرز کو 2,048 جہتی ویکٹر کو 1,024 یا 512 ڈائمینشنز تک سلائس کرنے اور بعد میں دوبارہ نارملائز کرنے کی اجازت دیتا ہے، کم اسٹوریج لاگت کے لیے تھوڑی درستگی کی تجارت کرتا ہے۔ یہ لچک ویکٹر ڈیٹا بیس کے لیے اہمیت رکھتی ہے، جہاں اربوں اعلیٰ جہتی ویکٹرز کو ذخیرہ کرنا مہنگا ہے۔

ایمبیڈنگز اب کیوں اہم ہیں۔

ایمبیڈنگ ماڈل جنریٹو AI اسٹیک میں ایک پرسکون چوکی پوائنٹ بن گئے ہیں۔ بازیافت پر مبنی ہر ایجنٹ، انٹرپرائز سرچ ٹول، اور کوڈ اسسٹنٹ ان پر انحصار کرتا ہے کہ وہ صحیح سیاق و سباق کو حاصل کرنے کے لیے اس سے پہلے کہ کسی بڑے زبان کے ماڈل کا جواب پیدا ہو۔ ایک مضبوط، سستا ایمبیڈنگ ماڈل براہ راست جواب کے معیار کو بہتر بنا سکتا ہے اور آپریٹنگ لاگت کو کم کر سکتا ہے، یہی وجہ ہے کہ اوپن اے آئی سے لے کر کوہیر تک اوپن سورس کلیکٹیو تک دکاندار نئے خاندانوں کی رہائی کے لیے دوڑ پڑے ہیں۔

اجازت دینے والے لائسنس کے تحت ایک اعلی درجے کے مجموعہ کو اوپن سورس کرکے اور اسے بلیک ویل ٹیونڈ کوانٹائزیشن کے ساتھ جوڑ کر، NVIDIA وسیع تر AI ایکو سسٹم کو ایسے ٹولز کے ساتھ سیڈنگ کرنے کی اپنی حکمت عملی کو تقویت دے رہا ہے جو اس کے اپنے سلکان پر بہترین چلتے ہیں۔ RAG پائپ لائنز یا ایجنٹ میموری سسٹم بنانے والے ڈویلپرز کے لیے، Nemotron 3 Embed ایک تازہ، آزادانہ طور پر دستیاب آپشن پیش کرتا ہے جو آرٹ کی حالت کو وسیع پیمانے پر دیکھے جانے والے بینچ مارک پر دھکیلتا ہے، جبکہ NVFP4 ویرینٹ ٹیموں کو بازیافت کے معیار کو قربان کیے بغیر تخمینہ لاگت کو کم کرنے کا ایک قابل اعتبار راستہ فراہم کرتا ہے جس پر ان کی ایپلی کیشنز انحصار کرتی ہیں۔

AI سے آگے رہیں

اوپن ایمبیڈنگ ماڈل جیسے Nemotron 3 Embed خاموشی سے نئی شکل دے رہے ہیں کہ کس طرح AI ایجنٹ معلومات تلاش کرتے اور استعمال کرتے ہیں۔ فیلڈ کو آگے بڑھانے والے ماڈلز، ریلیزز اور تحقیق کے بارے میں مزید جاننے کے لیے، ہماری تازہ ترین AI پیش رفت کے ٹوٹتے ہی ان کی پیروی کریں۔

مزید AI خبریں پڑھیں ->