أصدرت NVIDIA Nemotron 3 Embed، وهي مجموعة مفتوحة من نماذج التضمين المصممة لتشغيل الجيل المعزز للاسترجاع على نطاق الإنتاج (RAG)، والاسترجاع الوكيل، واسترجاع التعليمات البرمجية، وذاكرة الوكيل. يأتي الإصدار، الذي تم تفصيله بواسطة MarkTechPost في 17 يوليو 2026، باعتباره الطبقة التي تحدد المقاطع التي يراها وكيل الذكاء الاصطناعي على الإطلاق تصبح ساحة معركة تنافسية، وهو اتجاه اتبعه مكتب [أخبار الذكاء الاصطناعي العاجلة] (https://aibuzzwire.news) لهذا المنشور مع انتقال المؤسسات من روبوتات الدردشة إلى الأنظمة التي تعمل بناءً على المعرفة المستردة.
تحدد نماذج التضمين الممرات التي يراها العميل، مما يجعلها نقطة اختناق هادئة ولكن حاسمة في مكدس الذكاء الاصطناعي التوليدي. قامت NVIDIA ببناء Nemotron 3 Embed لتقوية تلك الطبقة. تتضمن المجموعة ثلاث نقاط تفتيش مفتوحة: Nemotron-3-Embed-8B-BF16، وهو خيار الدقة أولاً؛ Nemotron-3-Embed-1B-BF16، الذي يحمل نفس التصميم في مساحة أصغر؛ و Nemotron-3-Embed-1B-NVFP4، وهو متغير 4 بت محسّن من Blackwell. الثلاثة جميعهم عبارة عن مشفرات محولات مدربة على إخفاء الانتباه ثنائي الاتجاه، مع التضمين النهائي الذي يتم إنتاجه عن طريق التجميع المتوسط على تمثيلات مستوى الرمز المميز. يدعم كل منها الحد الأقصى لطول التسلسل وهو 32,768 رمزًا.
تتصدر المتصدرين
والنتيجة الرئيسية هي أن Nemotron-3-Embed-8B-BF16 يحتل المرتبة الأولى بشكل عام في RTEB، وهو معيار تضمين الاسترجاع، اعتبارًا من 17 يوليو 2026، عبر مهامه العامة الستة عشر. يتم قياس الدرجات كمتوسط NDCG@10 بطول تسلسل نموذجي يبلغ 4,096. قامت NVIDIA بتقييم كل نموذج عبر 34 لغة، وتم إصدار نقاط التفتيش الثلاث جميعها بموجب اتفاقية ترخيص OpenMDW الإصدار 1.1، مما يجعلها متاحة مجانًا للمطورين للتنزيل والتشغيل والتعديل.
والجدير بالذكر أن قواعد النموذج مأخوذة من ميسترال. تم بناء نقطة التفتيش 8B على Ministral-3-8B-Instruct-2512، بينما يستخدم كلا الإصدارين 1B Ministral-3-3B-Instruct-2512، وفقًا لتقرير MarkTechPost. يعكس قرار NVIDIA بالبناء على أساس Mistral بدلاً من البنية الداخلية البحتة كيف أصبح تطوير النماذج سلسًا، مع إعادة استخدام القواعد المفتوحة بشكل روتيني وإعادة تدريبها للقيام بمهام متخصصة.
الضغط، ليس تدريبًا أصغر
تبرز فجوتان في الأداء. يكتسب نموذج 1B 10.4 نقطة RTEB مقارنة بخط الأساس للجيل السابق من llama-nemotron-embed-vl-1b-v2. بشكل منفصل، تكلف نقطة تفتيش NVFP4 ذات 4 بتات 0.38 نقطة RTEB فقط مقابل BF16 الأم، مع الاحتفاظ بحوالي 99.5% من دقة الاسترجاع. يعد هذا الضغط شبه المفقود أمرًا مهمًا بشكل خاص للفرق التي تحتاج إلى تشغيل عمليات التضمين على نطاق واسع، حيث غالبًا ما تهيمن تكاليف الذاكرة والاستدلال.
تم تحقيق هذه الدرجات 1B من خلال خط أنابيب الضغط بدلاً من إجراء تدريب أصغر. تم تقليم الوالد، nemotron-3-embed-3b، وتقطيره عبر جولتين متكررتين. أولاً، تم تقليم الأصل 3B إلى 2B باستخدام mcore_minitron Neural Architecture Search من NVIDIA ModelOpt، والذي يبحث في العرض المخفي وحجم FFN ورؤوس الانتباه والعمق، ثم يختار أفضل مرشح من أفضل 10 مرشحين في واجهة Pareto. وسجلت مجموعة معايرة في المجال مكونة من 50000 عينة هؤلاء المرشحين.
بعد ذلك، تم استخلاص نموذج 2B من معلم التضمين 8B المضبوط بدقة، والجمع بين فقدان مسافة جيب التمام ومتوسط فقدان الخطأ التربيعي عبر مزيج بيانات متعدد اللغات في المجال. تم تكرار نفس الإجراء لإنتاج نقطة تفتيش 1.14B، مما يدل على أن المتغيرات الأصغر ترث الكثير من قدرة النموذج الأكبر من خلال الضغط المنظم بدلاً من التدريب المستقل.
مصمم لتحقيق كفاءة بلاكويل
يستمر الضغط في تنسيق العرض. استهدف التكميم الأوزان وتنشيط الطبقات الخطية فقط، باستخدام نوع البيانات NVFP4، مع اعتماد فريق البحث على nvidia-modelopt v0.45.0. تبع ذلك التقطير المدرك للتكميم، وذلك في المقام الأول لاستعادة الدقة في المدخلات الطويلة. استخدمت المعايرة 512 عينة، مقسمة بين 256 استعلامًا و256 مقطعًا من مجموعة بيانات cnn_dailymail، بينما اعتمد تدريب QAD على 20000 عينة.
المردود العملي هو الكفاءة على أحدث أجهزة NVIDIA. أفاد فريق البحث أن NVFP4 الموجود على Blackwell يوفر إنتاجية أعلى بما يصل إلى 2x من BF16 مع الاحتفاظ بأكثر من 99% من دقة استرجاع BF16. تقوم بطاقة نموذج NVFP4 أيضًا بتوثيق أحجام التضمين الديناميكية، مما يسمح للمطورين بتقسيم المتجهات ذات 2048 بُعدًا إلى 1024 أو 512 بُعدًا وإعادة تطبيعها بعد ذلك، مع استبدال القليل من الدقة بتكلفة تخزين أقل. هذه المرونة مهمة لقواعد بيانات المتجهات، حيث يعد تخزين مليارات المتجهات عالية الأبعاد أمرًا مكلفًا.
لماذا تعتبر عمليات التضمين مهمة الآن
أصبحت نماذج التضمين بمثابة نقطة اختناق هادئة في مكدس الذكاء الاصطناعي التوليدي. يعتمد كل وكيل قائم على الاسترجاع وأداة بحث مؤسسية ومساعد تعليمات برمجية عليها لجلب السياق الصحيح قبل أن يقوم نموذج لغة كبير بإنشاء استجابة. يمكن لنموذج التضمين الأقوى والأرخص أن يعمل بشكل مباشر على تحسين جودة الإجابات وخفض تكاليف التشغيل، ولهذا السبب سارع البائعون، من OpenAI إلى Cohere إلى المجموعات مفتوحة المصدر، إلى إطلاق عائلات جديدة.
من خلال فتح المصدر لمجموعة ذات تصنيف عالي بموجب ترخيص متساهل وإقرانها بالتكميم المضبوط من Blackwell، تعمل NVIDIA على تعزيز استراتيجيتها المتمثلة في زرع النظام البيئي الأوسع للذكاء الاصطناعي بأدوات تعمل بشكل أفضل على السيليكون الخاص بها. بالنسبة للمطورين الذين يقومون ببناء خطوط أنابيب RAG أو أنظمة ذاكرة وكيل، يوفر Nemotron 3 Embed خيارًا جديدًا ومتاحًا مجانًا يدفع بأحدث ما توصلت إليه التكنولوجيا وفقًا لمعايير مراقبة على نطاق واسع، في حين يمنح متغير NVFP4 الفرق مسارًا موثوقًا به لخفض تكلفة الاستدلال دون التضحية بجودة الاسترجاع التي تعتمد عليها تطبيقاتهم.
ابق في صدارة الذكاء الاصطناعي
تعمل نماذج التضمين المفتوحة مثل Nemotron 3 Embed على إعادة تشكيل كيفية قيام عملاء الذكاء الاصطناعي بالعثور على المعلومات واستخدامها. لمعرفة المزيد عن النماذج والإصدارات والأبحاث التي تدفع هذا المجال إلى الأمام، تابع آخر تطورات الذكاء الاصطناعي عند ظهورها.
اقرأ المزيد من أخبار الذكاء الاصطناعي ->



