انویدیا Nemotron 3 Embed را منتشر کرده است، مجموعهای باز از مدلهای تعبیهشده که برای تولید قدرت بازیابی در مقیاس تولید (RAG)، بازیابی عاملی، بازیابی کد و حافظه عامل طراحی شدهاند. این نسخه که توسط MarkTechPost در 17 ژوئیه 2026 شرح داده شد، زمانی که لایهای که تصمیم میگیرد کدام بخشهایی را که یک عامل هوش مصنوعی ببیند، به میدان نبرد رقابتی تبدیل میشود، ارائه میشود، روندی که میز [اخبار هوش مصنوعی] (https://aibuzzwire.news) این نشریه با حرکت شرکتها از رباتهای چت به سیستمهای دانشی که بر اساس مجدد عمل میکنند دنبال کرده است.
مدلهای تعبیهشده تصمیم میگیرند که یک نماینده کدام مسیر را ببیند، که آنها را به نقطهای خاموش اما تعیینکننده در پشته هوش مصنوعی مولد تبدیل میکند. NVIDIA Nemotron 3 Embed را برای تقویت آن لایه ساخته است. این مجموعه شامل سه نقطه بازرسی باز است: Nemotron-3-Embed-8B-BF16، گزینه اول دقت. Nemotron-3-Embed-1B-BF16، که همان طرح را در یک ردپای کوچکتر حمل می کند. و Nemotron-3-Embed-1B-NVFP4، یک نوع 4 بیتی بهینه شده توسط Blackwell. هر سه رمزگذار ترانسفورماتور هستند که با پوشاندن توجه دو طرفه آموزش دیده اند، و جاسازی نهایی با ادغام متوسط روی نمایش های سطح نشانه ایجاد می شود. هر کدام حداکثر طول دنباله 32768 توکن را پشتیبانی می کند.
در صدر جدول امتیازات
نتیجه سرفصل این است که Nemotron-3-Embed-8B-BF16 در RTEB، معیار جاسازی بازیابی، از 17 ژوئیه 2026، رتبه یک را در 16 وظیفه عمومی خود دارد. نمرات به عنوان میانگین NDCG@10 در طول توالی مدل 4096 اندازه گیری می شود. انویدیا هر مدل را در 34 زبان ارزیابی کرد و هر سه نقطه بازرسی تحت توافقنامه مجوز OpenMDW نسخه 1.1 منتشر شدند و آنها را به صورت رایگان برای دانلود، اجرا و تغییر در اختیار توسعه دهندگان قرار داد.
قابل ذکر است که پایه های مدل از میسترال گرفته شده اند. بر اساس گزارش MarkTechPost، ایست بازرسی 8B بر اساس Ministral-3-8B-Instruct-2512 ساخته شده است، در حالی که هر دو نوع 1B از Ministral-3-3B-Instruct-2512 استفاده می کنند. تصمیم انویدیا برای ساختن بر اساس میسترال به جای معماری صرفاً داخلی، نشاندهنده چگونگی توسعه مدل سیال است، با پایگاههای باز که به طور معمول برای کارهای تخصصی تغییر کاربری داده و دوباره آموزش میبینند.
فشرده سازی، نه یک دوره آموزشی کوچکتر
دو شکاف عملکرد برجسته است. مدل 1B 10.4 امتیاز RTEB نسبت به خط پایه llama-nemotron-embed-vl-1b-v2 نسل قبلی کسب می کند. به طور جداگانه، ایست بازرسی 4 بیتی NVFP4 تنها 0.38 امتیاز RTEB در برابر والد BF16 خود هزینه دارد و تقریباً 99.5 درصد از دقت بازیابی خود را حفظ می کند. این فشردهسازی تقریباً بدون ضرر بهویژه برای تیمهایی که نیاز به اجرای جاسازیها در مقیاس دارند، که در آن هزینههای حافظه و استنتاج اغلب غالب است، مهم است.
این امتیازات 1B از طریق یک خط لوله فشرده سازی به جای یک دوره آموزشی کوچکتر به دست آمد. والد، nemotron-3-embed-3b، در دو دور تکراری هرس و تقطیر شد. ابتدا، والد 3B با استفاده از جستجوی معماری عصبی mcore_minitron NVIDIA ModelOpt به 2B تقسیم شد، که پهنای پنهان، اندازه FFN، سر توجه و عمق را جستجو میکند، سپس بهترین نامزد را از 10 پارتو برتر انتخاب میکند. یک مجموعه کالیبراسیون 50000 نمونه در دامنه به این نامزدها امتیاز داد.
در مرحله بعد، مدل 2B از معلم تعبیه شده 8B با تنظیم دقیق تقطیر شد و از دست دادن فاصله کسینوس و میانگین مربعات خطا را در یک ترکیب داده چندزبانه و درون دامنه ترکیب کرد. همین رویه برای تولید نقطه بازرسی 1.14B تکرار شد و نشان داد که انواع کوچکتر بیشتر قابلیت مدل بزرگتر را از طریق فشرده سازی ساختاریافته به جای آموزش مستقل به ارث می برند.
برای کارایی بلک ول ساخته شده است
فشرده سازی در قالب سرویس ادامه می یابد. کمی سازی وزن ها و فعال سازی لایه های خطی را تنها با استفاده از نوع داده NVFP4 با تکیه تیم تحقیقاتی بر nvidia-modelopt v0.45.0 هدف قرار داد. تقطیر با آگاهی از کوانتیشن، عمدتاً برای بازیابی دقت در ورودیهای طولانی دنبال شد. کالیبراسیون از 512 نمونه استفاده کرد که بین 256 پرس و جو و 256 متن از مجموعه داده cnn_dailymail تقسیم شد، در حالی که آموزش QAD بر روی 20000 نمونه طراحی شد.
نتیجه عملی کارایی در آخرین سخت افزار NVIDIA است. تیم تحقیقاتی گزارش می دهد که NVFP4 در بلک ول تا 2 برابر توان عملیاتی بالاتری نسبت به BF16 ارائه می دهد در حالی که بیش از 99 درصد دقت بازیابی BF16 را حفظ می کند. کارت مدل NVFP4 همچنین اندازههای جاسازی پویا را مستند میکند و به توسعهدهندگان این امکان را میدهد تا بردار 2048 بعدی را به ابعاد 1024 یا 512 برش دهند و پس از آن مجدداً عادی شوند و دقت کمی را برای هزینه ذخیرهسازی کمتر معامله کنند. این انعطاف پذیری برای پایگاه های داده برداری مهم است، جایی که ذخیره میلیاردها بردار با ابعاد بالا گران است.
چرا جاسازی ها اکنون اهمیت دارند
مدلهای تعبیهشده به یک نقطه خفهکننده آرام در پشته هوش مصنوعی مولد تبدیل شدهاند. هر عامل مبتنی بر بازیابی، ابزار جستجوی سازمانی، و دستیار کد به آنها بستگی دارد تا زمینه مناسب را قبل از اینکه یک مدل زبان بزرگ پاسخی ایجاد کند، به دست آورند. یک مدل جاسازی قویتر و ارزانتر میتواند مستقیماً کیفیت پاسخ را بهبود بخشد و هزینههای عملیاتی را کاهش دهد، به همین دلیل است که فروشندگان از OpenAI گرفته تا Cohere و گروههای منبع باز برای انتشار خانوادههای جدید عجله کردهاند.
NVIDIA با منبع باز مجموعهای با رتبهبندی برتر تحت مجوز مجاز و جفت کردن آن با کوانتیزهسازی تنظیمشده بلکول، استراتژی خود را برای ایجاد اکوسیستم گستردهتر هوش مصنوعی با ابزارهایی که بهترین عملکرد را بر روی سیلیکون خود دارند، تقویت میکند. برای توسعهدهندگانی که خطوط لوله RAG یا سیستمهای حافظه عامل را میسازند، Nemotron 3 Embed یک گزینه جدید و آزادانه در دسترس را ارائه میکند که وضعیت هنر را در معیاری که به طور گسترده تماشا میشود، پیش میبرد، در حالی که نوع NVFP4 مسیری معتبر را برای کاهش هزینههای استنتاج به تیمها ارائه میدهد بدون اینکه کیفیت بازیابی به آن وابسته باشد.
از هوش مصنوعی جلوتر بمانید
مدلهای جاسازی باز مانند Nemotron 3 Embed به آرامی نحوه یافتن و استفاده عوامل هوش مصنوعی اطلاعات را تغییر میدهند. برای اطلاعات بیشتر در مورد مدلها، نسخهها و تحقیقاتی که این حوزه را به جلو میبرد، [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) ما را در حین شکست دنبال کنید.
اخبار هوش مصنوعی را بیشتر بخوانید ->



