NVIDIA, üretim ölçeğinde erişimle artırılmış nesil (RAG), aracılı alım, kod alımı ve aracı belleğine güç sağlamak için tasarlanmış açık bir yerleştirme modeli koleksiyonu olan Nemotron 3 Embed'i piyasaya sürdü. 17 Temmuz 2026'da MarkTechPost tarafından ayrıntılı olarak açıklanan sürüm, bir yapay zeka aracısının hangi pasajları göreceğine karar veren katmanın rekabetçi bir savaş alanı haline gelmesiyle geldi; bu yayının son dakika yapay zeka haberleri masası, işletmelerin sohbet robotlarından alınan bilgilerle hareket eden sistemlere geçmesiyle birlikte takip ettiği bir trend.

Gömme modelleri, bir aracının hangi geçitleri göreceğine karar verir, bu da onları üretken yapay zeka yığınında sessiz ama belirleyici bir geçiş noktası haline getirir. NVIDIA, bu katmanı güçlendirmek için Nemotron 3 Embed'i geliştirdi. Koleksiyon üç açık kontrol noktası içerir: Doğruluk öncelikli bir seçenek olan Nemotron-3-Embed-8B-BF16; Aynı tasarımı daha küçük bir alana taşıyan Nemotron-3-Embed-1B-BF16; ve Blackwell tarafından optimize edilmiş 4 bitlik bir varyant olan Nemotron-3-Embed-1B-NVFP4. Üçü de, iki yönlü dikkat maskeleme ile eğitilmiş dönüştürücü kodlayıcılardır ve nihai yerleştirme, belirteç düzeyindeki temsiller üzerinden ortalama havuzlamayla üretilir. Her biri maksimum 32.768 token dizi uzunluğunu destekler.

Liderlik Sıralamasında Zirvede

Sonuç olarak Nemotron-3-Embed-8B-BF16, 17 Temmuz 2026 itibarıyla 16 kamu görevi genelinde Geri Alma Gömme Karşılaştırması olan RTEB'de genel olarak birinci sırada yer alıyor. Puanlar, 4,096 model dizi uzunluğunda ortalama NDCG@10 olarak ölçülür. NVIDIA her modeli 34 dilde değerlendirdi ve üç kontrol noktasının tümü OpenMDW Lisans Anlaşması sürüm 1.1 kapsamında yayınlandı; bu da onları geliştiricilerin indirmesi, çalıştırması ve değiştirmesi için ücretsiz olarak kullanılabilir hale getiriyor.

Özellikle model tabanları Mistral'dan alınmıştır. MarkTechPost raporuna göre 8B kontrol noktası Ministral-3-8B-Instruct-2512 üzerine kuruluyken, 1B varyantlarının her ikisi de Ministral-3-3B-Instruct-2512'yi kullanıyor. NVIDIA'nın tamamen şirket içi bir mimari yerine Mistral'in temeli üzerine inşa etme kararı, açık tabanların özel görevler için rutin olarak yeniden tasarlanması ve yeniden eğitilmesiyle model geliştirmenin ne kadar akıcı hale geldiğini yansıtıyor.

Kompresyon, Daha Küçük Bir Antrenman Koşusu Değil

İki performans açığı öne çıkıyor. 1B modeli, önceki nesil lama-nemotron-embed-vl-1b-v2 temel çizgisine göre 10,4 RTEB puanı kazanıyor. Ayrı olarak, NVFP4 4 bitlik kontrol noktasının maliyeti, BF16 ebeveynine göre yalnızca 0,38 RTEB puanı olup, alma doğruluğunun kabaca %99,5'ini korur. Neredeyse kayıpsız olan bu sıkıştırma, bellek ve çıkarım maliyetlerinin genellikle baskın olduğu, yerleştirmeleri geniş ölçekte çalıştırması gereken ekipler için özellikle önemlidir.

Bu 1B puanları, daha küçük bir eğitim çalışması yerine bir sıkıştırma hattı aracılığıyla elde edildi. Ebeveyn, nemotron-3-embed-3b, iki tekrarlı turda budandı ve damıtıldı. İlk olarak, 3B üst öğesi, gizli genişliği, FFN boyutunu, dikkat başlıklarını ve derinliği araştıran ve ardından ilk 10 Pareto cephesinden en iyi adayı seçen NVIDIA ModelOpt'un mcore_minitron Nöral Mimari Araması kullanılarak 2B'ye budandı. 50.000 örnekli alan içi kalibrasyon derlemesi bu adayları puanladı.

Daha sonra, 2B modeli, çok dilli, alan içi veri harmanı üzerinde kosinüs mesafe kaybı ve ortalama karesel hata kaybını birleştiren, ince ayarlı 8B yerleştirme öğretmeninden damıtıldı. Aynı prosedür, 1.14B kontrol noktasını oluşturmak için tekrarlandı; bu, daha küçük değişkenlerin, bağımsız eğitim yerine yapılandırılmış sıkıştırma yoluyla daha büyük modelin kapasitesinin çoğunu miras aldığını gösterdi.

Blackwell Verimliliği için Tasarlandı

Sıkıştırma, sunum biçiminde devam eder. Araştırma ekibi nvidia-modelopt v0.45.0'a güvenerek NVFP4 veri türünü kullanarak yalnızca doğrusal katmanların ağırlıklarını ve aktivasyonlarını hedef alan niceleme gerçekleştirdi. Bunu öncelikle uzun girdilerde doğruluğu iyileştirmek için Kuantizasyon Farkında Damıtma izledi. Kalibrasyonda cnn_dailymail veri kümesinden 256 sorgu ve 256 pasaj olarak bölünmüş 512 örnek kullanılırken, QAD eğitimi 20.000 örnekten yararlandı.

Bunun pratik getirisi, NVIDIA'nın en yeni donanımının verimliliğidir. Araştırma ekibi, Blackwell'deki NVFP4'ün BF16'ya göre 2 kata kadar daha yüksek verim sağladığını ve BF16 alma doğruluğunun %99'undan fazlasını koruduğunu bildirmektedir. NVFP4 model kartı aynı zamanda dinamik yerleştirme boyutlarını da belgeleyerek geliştiricilerin 2.048 boyutlu vektörü 1.024 veya 512 boyuta indirmesine ve daha sonra yeniden normalleştirmesine, böylece daha düşük depolama maliyeti için biraz doğruluktan ödün vermesine olanak tanır. Bu esneklik, milyarlarca yüksek boyutlu vektörün saklanmasının pahalı olduğu vektör veritabanları için önemlidir.

Yerleştirmeler Şimdi Neden Önemli?

Gömme modelleri, üretken yapay zeka yığınında sessiz bir geçiş noktası haline geldi. Her erişim tabanlı aracı, kurumsal arama aracı ve kod asistanı, büyük bir dil modeli yanıt oluşturmadan önce doğru bağlamı getirme konusunda onlara bağlıdır. Daha güçlü, daha ucuz bir yerleştirme modeli doğrudan yanıt kalitesini artırabilir ve işletme maliyetlerini azaltabilir; bu nedenle OpenAI'den Cohere'e ve açık kaynak kolektiflerine kadar satıcılar yeni aileleri piyasaya sürmek için acele ediyor.

NVIDIA, üst düzey bir koleksiyonu izin verilen bir lisans kapsamında açık kaynak olarak kullanarak ve bunu Blackwell ayarlı nicelemeyle eşleştirerek, daha geniş yapay zeka ekosistemini kendi silikonunda en iyi şekilde çalışan araçlarla tohumlama stratejisini güçlendiriyor. RAG işlem hatları veya aracı bellek sistemleri oluşturan geliştiriciler için Nemotron 3 Embed, en son teknolojiyi yaygın olarak izlenen bir karşılaştırmaya taşıyan yeni, ücretsiz olarak kullanılabilen bir seçenek sunarken, NVFP4 varyantı ekiplere, uygulamalarının bağlı olduğu alma kalitesinden ödün vermeden çıkarım maliyetini düşürmeleri için güvenilir bir yol sunar.

Yapay Zekanın Önünde Olun

Nemotron 3 Embed gibi açık yerleştirme modelleri, yapay zeka aracılarının bilgiyi bulma ve kullanma şeklini sessizce yeniden şekillendiriyor. Alanı ileriye taşıyan modeller, sürümler ve araştırmalar hakkında daha fazla bilgi için en son AI gelişmelerimizi takip edin.

Daha fazla AI haberini okuyun ->