NVIDIA telah mengeluarkan Nemotron 3 Embed, koleksi terbuka model pembenaman yang direka untuk menjana penjanaan perolehan semula skala pengeluaran (RAG), pengambilan semula agen, pengambilan kod dan memori ejen. Keluaran, yang diperincikan oleh MarkTechPost pada 17 Julai 2026, tiba apabila lapisan yang menentukan laluan mana yang pernah dilihat oleh ejen AI menjadi medan pertempuran yang kompetitif, trend meja berita terbaharu AI penerbitan ini telah diikuti apabila perusahaan beralih daripada bot sembang kepada sistem yang bertindak berdasarkan pengetahuan yang diperoleh.

Model benam menentukan laluan mana yang pernah dilihat oleh ejen, yang menjadikannya titik tercekik yang tenang tetapi tegas dalam timbunan AI generatif. NVIDIA membina Nemotron 3 Embed untuk mengukuhkan lapisan itu. Koleksi itu termasuk tiga pusat pemeriksaan terbuka: Nemotron-3-Embed-8B-BF16, pilihan ketepatan-diutamakan; Nemotron-3-Embed-1B-BF16, yang membawa reka bentuk yang sama ke dalam jejak yang lebih kecil; dan Nemotron-3-Embed-1B-NVFP4, varian 4-bit yang dioptimumkan oleh Blackwell. Ketiga-tiganya ialah pengekod pengubah yang dilatih dengan penyekat perhatian dua arah, dengan pembenaman terakhir dihasilkan oleh pengumpulan purata ke atas perwakilan peringkat token. Setiap satu menyokong panjang jujukan maksimum 32,768 token.

Mendahului Papan Pendahulu

Hasil tajuk berita ialah Nemotron-3-Embed-8B-BF16 menduduki tempat nombor satu keseluruhan pada RTEB, Penanda Aras Pembenaman Semula, pada 17 Julai 2026, merentas 16 tugas awamnya. Markah diukur sebagai purata NDCG@10 pada panjang jujukan model 4,096. NVIDIA menilai setiap model merentas 34 bahasa, dan ketiga-tiga pusat pemeriksaan dikeluarkan di bawah Perjanjian Lesen OpenMDW versi 1.1, menjadikannya tersedia secara bebas untuk dimuat turun, dijalankan dan diubah suai oleh pembangun.

Terutamanya, pangkalan model diambil dari Mistral. Pusat pemeriksaan 8B dibina pada Ministral-3-8B-Instruct-2512, manakala kedua-dua varian 1B menggunakan Ministral-3-3B-Instruct-2512, menurut laporan MarkTechPost. Keputusan NVIDIA untuk membina asas Mistral dan bukannya seni bina dalaman semata-mata menggambarkan bagaimana pembangunan model cecair telah menjadi, dengan pangkalan terbuka secara rutin digunakan semula dan dilatih semula untuk tugas khusus.

Mampatan, Bukan Larian Latihan yang Lebih Kecil

Dua jurang prestasi menonjol. Model 1B memperoleh 10.4 mata RTEB berbanding garis dasar llama-nemotron-embed-vl-1b-v2 generasi sebelumnya. Secara berasingan, pusat pemeriksaan 4-bit NVFP4 berharga hanya 0.38 mata RTEB berbanding induk BF16nya, mengekalkan kira-kira 99.5% daripada ketepatan pengambilannya. Pemampatan hampir tanpa kerugian itu amat penting untuk pasukan yang perlu menjalankan pembenaman pada skala, di mana kos ingatan dan inferens sering mendominasi.

Skor 1B tersebut dicapai melalui saluran paip mampatan dan bukannya latihan yang lebih kecil. Induk, nemotron-3-embed-3b, telah dipangkas dan disuling merentasi dua pusingan berulang. Mula-mula, induk 3B telah dipangkas kepada 2B menggunakan Carian Seni Bina Neural mcore_minitron NVIDIA ModelOpt, yang mencari lebar tersembunyi, saiz FFN, kepala perhatian dan kedalaman, kemudian memilih calon terbaik daripada 10 teratas Pareto hadapan. Korpus penentukuran dalam domain 50,000 sampel menjaringkan calon tersebut.

Seterusnya, model 2B telah disuling daripada guru benam 8B yang diperhalusi, menggabungkan kehilangan jarak kosinus dan kehilangan ralat purata kuasa dua berbanding gabungan data dalam domain berbilang bahasa. Prosedur yang sama diulang untuk menghasilkan pusat pemeriksaan 1.14B, menunjukkan bahawa varian yang lebih kecil mewarisi banyak keupayaan model yang lebih besar melalui pemampatan berstruktur dan bukannya latihan bebas.

Dibina untuk Kecekapan Blackwell

Pemampatan diteruskan ke dalam format hidangan. Kuantiti menyasarkan pemberat dan pengaktifan lapisan linear sahaja, menggunakan jenis data NVFP4, dengan pasukan penyelidik bergantung pada nvidia-modelopt v0.45.0. Penyulingan Sedar Kuantisasi diikuti, terutamanya untuk memulihkan ketepatan pada input yang panjang. Penentukuran menggunakan 512 sampel, dibahagikan antara 256 pertanyaan dan 256 petikan daripada set data cnn_dailymail, manakala latihan QAD menggunakan 20,000 sampel.

Hasil praktikal adalah kecekapan pada perkakasan terbaharu NVIDIA. Pasukan penyelidik melaporkan bahawa NVFP4 pada Blackwell memberikan daya pemprosesan sehingga 2x lebih tinggi daripada BF16 sambil mengekalkan lebih daripada 99% ketepatan pengambilan BF16. Kad model NVFP4 juga mendokumenkan saiz benam dinamik, membolehkan pembangun memotong vektor 2,048 dimensi kepada 1,024 atau 512 dimensi dan menormalkan semula selepas itu, memperdagangkan sedikit ketepatan untuk kos penyimpanan yang lebih rendah. Fleksibiliti itu penting untuk pangkalan data vektor, di mana menyimpan berbilion-bilion vektor dimensi tinggi adalah mahal.

Mengapa Pembenaman Penting Sekarang

Model benam telah menjadi titik tercekik yang tenang dalam timbunan AI generatif. Setiap ejen berasaskan perolehan semula, alat carian perusahaan dan pembantu kod bergantung kepada mereka untuk mendapatkan konteks yang betul sebelum model bahasa yang besar menghasilkan respons. Model pembenaman yang lebih kukuh dan lebih murah secara langsung boleh meningkatkan kualiti jawapan dan mengurangkan kos operasi, itulah sebabnya vendor dari OpenAI ke Cohere kepada kolektif sumber terbuka telah bergegas untuk melepaskan keluarga baharu.

Dengan sumber terbuka koleksi kedudukan teratas di bawah lesen permisif dan menggandingkannya dengan pengkuantitian Blackwell-talaan, NVIDIA memperkukuh strateginya untuk membenihkan ekosistem AI yang lebih luas dengan alatan yang berfungsi terbaik pada silikonnya sendiri. Bagi pembangun yang membina saluran paip RAG atau sistem ingatan ejen, Nemotron 3 Embed menawarkan pilihan baharu yang tersedia secara percuma yang mendorong kecanggihan pada penanda aras yang ditonton secara meluas, manakala varian NVFP4 memberikan pasukan laluan yang boleh dipercayai untuk mengurangkan kos inferens tanpa mengorbankan kualiti perolehan semula yang bergantung kepada aplikasi mereka.

Kekal Mendahului AI

Model pembenaman terbuka seperti Nemotron 3 Embed secara senyap-senyap membentuk semula cara ejen AI mencari dan menggunakan maklumat. Untuk mengetahui lebih lanjut tentang model, keluaran dan penyelidikan yang memajukan bidang ke hadapan, ikuti perkembangan AI terkini kami apabila ia berkembang.

Baca lebih banyak berita AI ->