انویدیا Nemotron 3 Embed را منتشر کرده است، مجموعه‌ای باز از مدل‌های تعبیه‌شده که برای تولید قدرت بازیابی در مقیاس تولید (RAG)، بازیابی عاملی، بازیابی کد و حافظه عامل طراحی شده‌اند. این نسخه که توسط MarkTechPost در 17 ژوئیه 2026 شرح داده شد، زمانی که لایه‌ای که تصمیم می‌گیرد کدام بخش‌هایی را که یک عامل هوش مصنوعی ببیند، به میدان نبرد رقابتی تبدیل می‌شود، ارائه می‌شود، روندی که میز [اخبار هوش مصنوعی] (https://aibuzzwire.news) این نشریه با حرکت شرکت‌ها از ربات‌های چت به سیستم‌های دانشی که بر اساس مجدد عمل می‌کنند دنبال کرده است.

مدل‌های تعبیه‌شده تصمیم می‌گیرند که یک نماینده کدام مسیر را ببیند، که آن‌ها را به نقطه‌ای خاموش اما تعیین‌کننده در پشته هوش مصنوعی مولد تبدیل می‌کند. NVIDIA Nemotron 3 Embed را برای تقویت آن لایه ساخته است. این مجموعه شامل سه نقطه بازرسی باز است: Nemotron-3-Embed-8B-BF16، گزینه اول دقت. Nemotron-3-Embed-1B-BF16، که همان طرح را در یک ردپای کوچکتر حمل می کند. و Nemotron-3-Embed-1B-NVFP4، یک نوع 4 بیتی بهینه شده توسط Blackwell. هر سه رمزگذار ترانسفورماتور هستند که با پوشاندن توجه دو طرفه آموزش دیده اند، و جاسازی نهایی با ادغام متوسط ​​روی نمایش های سطح نشانه ایجاد می شود. هر کدام حداکثر طول دنباله 32768 توکن را پشتیبانی می کند.

در صدر جدول امتیازات

نتیجه سرفصل این است که Nemotron-3-Embed-8B-BF16 در RTEB، معیار جاسازی بازیابی، از 17 ژوئیه 2026، رتبه یک را در 16 وظیفه عمومی خود دارد. نمرات به عنوان میانگین NDCG@10 در طول توالی مدل 4096 اندازه گیری می شود. انویدیا هر مدل را در 34 زبان ارزیابی کرد و هر سه نقطه بازرسی تحت توافقنامه مجوز OpenMDW نسخه 1.1 منتشر شدند و آنها را به صورت رایگان برای دانلود، اجرا و تغییر در اختیار توسعه دهندگان قرار داد.

قابل ذکر است که پایه های مدل از میسترال گرفته شده اند. بر اساس گزارش MarkTechPost، ایست بازرسی 8B بر اساس Ministral-3-8B-Instruct-2512 ساخته شده است، در حالی که هر دو نوع 1B از Ministral-3-3B-Instruct-2512 استفاده می کنند. تصمیم انویدیا برای ساختن بر اساس میسترال به جای معماری صرفاً داخلی، نشان‌دهنده چگونگی توسعه مدل سیال است، با پایگاه‌های باز که به طور معمول برای کارهای تخصصی تغییر کاربری داده و دوباره آموزش می‌بینند.

فشرده سازی، نه یک دوره آموزشی کوچکتر

دو شکاف عملکرد برجسته است. مدل 1B 10.4 امتیاز RTEB نسبت به خط پایه llama-nemotron-embed-vl-1b-v2 نسل قبلی کسب می کند. به طور جداگانه، ایست بازرسی 4 بیتی NVFP4 تنها 0.38 امتیاز RTEB در برابر والد BF16 خود هزینه دارد و تقریباً 99.5 درصد از دقت بازیابی خود را حفظ می کند. این فشرده‌سازی تقریباً بدون ضرر به‌ویژه برای تیم‌هایی که نیاز به اجرای جاسازی‌ها در مقیاس دارند، که در آن هزینه‌های حافظه و استنتاج اغلب غالب است، مهم است.

این امتیازات 1B از طریق یک خط لوله فشرده سازی به جای یک دوره آموزشی کوچکتر به دست آمد. والد، nemotron-3-embed-3b، در دو دور تکراری هرس و تقطیر شد. ابتدا، والد 3B با استفاده از جستجوی معماری عصبی mcore_minitron NVIDIA ModelOpt به 2B تقسیم شد، که پهنای پنهان، اندازه FFN، سر توجه و عمق را جستجو می‌کند، سپس بهترین نامزد را از 10 پارتو برتر انتخاب می‌کند. یک مجموعه کالیبراسیون 50000 نمونه در دامنه به این نامزدها امتیاز داد.

در مرحله بعد، مدل 2B از معلم تعبیه شده 8B با تنظیم دقیق تقطیر شد و از دست دادن فاصله کسینوس و میانگین مربعات خطا را در یک ترکیب داده چندزبانه و درون دامنه ترکیب کرد. همین رویه برای تولید نقطه بازرسی 1.14B تکرار شد و نشان داد که انواع کوچکتر بیشتر قابلیت مدل بزرگتر را از طریق فشرده سازی ساختاریافته به جای آموزش مستقل به ارث می برند.

برای کارایی بلک ول ساخته شده است

فشرده سازی در قالب سرویس ادامه می یابد. کمی سازی وزن ها و فعال سازی لایه های خطی را تنها با استفاده از نوع داده NVFP4 با تکیه تیم تحقیقاتی بر nvidia-modelopt v0.45.0 هدف قرار داد. تقطیر با آگاهی از کوانتیشن، عمدتاً برای بازیابی دقت در ورودی‌های طولانی دنبال شد. کالیبراسیون از 512 نمونه استفاده کرد که بین 256 پرس و جو و 256 متن از مجموعه داده cnn_dailymail تقسیم شد، در حالی که آموزش QAD بر روی 20000 نمونه طراحی شد.

نتیجه عملی کارایی در آخرین سخت افزار NVIDIA است. تیم تحقیقاتی گزارش می دهد که NVFP4 در بلک ول تا 2 برابر توان عملیاتی بالاتری نسبت به BF16 ارائه می دهد در حالی که بیش از 99 درصد دقت بازیابی BF16 را حفظ می کند. کارت مدل NVFP4 همچنین اندازه‌های جاسازی پویا را مستند می‌کند و به توسعه‌دهندگان این امکان را می‌دهد تا بردار 2048 بعدی را به ابعاد 1024 یا 512 برش دهند و پس از آن مجدداً عادی شوند و دقت کمی را برای هزینه ذخیره‌سازی کمتر معامله کنند. این انعطاف پذیری برای پایگاه های داده برداری مهم است، جایی که ذخیره میلیاردها بردار با ابعاد بالا گران است.

چرا جاسازی ها اکنون اهمیت دارند

مدل‌های تعبیه‌شده به یک نقطه خفه‌کننده آرام در پشته هوش مصنوعی مولد تبدیل شده‌اند. هر عامل مبتنی بر بازیابی، ابزار جستجوی سازمانی، و دستیار کد به آنها بستگی دارد تا زمینه مناسب را قبل از اینکه یک مدل زبان بزرگ پاسخی ایجاد کند، به دست آورند. یک مدل جاسازی قوی‌تر و ارزان‌تر می‌تواند مستقیماً کیفیت پاسخ را بهبود بخشد و هزینه‌های عملیاتی را کاهش دهد، به همین دلیل است که فروشندگان از OpenAI گرفته تا Cohere و گروه‌های منبع باز برای انتشار خانواده‌های جدید عجله کرده‌اند.

NVIDIA با منبع باز مجموعه‌ای با رتبه‌بندی برتر تحت مجوز مجاز و جفت کردن آن با کوانتیزه‌سازی تنظیم‌شده بلک‌ول، استراتژی خود را برای ایجاد اکوسیستم گسترده‌تر هوش مصنوعی با ابزارهایی که بهترین عملکرد را بر روی سیلیکون خود دارند، تقویت می‌کند. برای توسعه‌دهندگانی که خطوط لوله RAG یا سیستم‌های حافظه عامل را می‌سازند، Nemotron 3 Embed یک گزینه جدید و آزادانه در دسترس را ارائه می‌کند که وضعیت هنر را در معیاری که به طور گسترده تماشا می‌شود، پیش می‌برد، در حالی که نوع NVFP4 مسیری معتبر را برای کاهش هزینه‌های استنتاج به تیم‌ها ارائه می‌دهد بدون اینکه کیفیت بازیابی به آن وابسته باشد.

از هوش مصنوعی جلوتر بمانید

مدل‌های جاسازی باز مانند Nemotron 3 Embed به آرامی نحوه یافتن و استفاده عوامل هوش مصنوعی اطلاعات را تغییر می‌دهند. برای اطلاعات بیشتر در مورد مدل‌ها، نسخه‌ها و تحقیقاتی که این حوزه را به جلو می‌برد، [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) ما را در حین شکست دنبال کنید.

اخبار هوش مصنوعی را بیشتر بخوانید ->