NVIDIA telah merilis Nemotron 3 Embed, koleksi terbuka model penyematan yang dirancang untuk mendukung generasi pengambilan-augmented (RAG) skala produksi, pengambilan agen, pengambilan kode, dan memori agen. Rilis ini, yang dirinci oleh MarkTechPost pada tanggal 17 Juli 2026, hadir sebagai lapisan yang memutuskan jalur mana yang pernah dilihat oleh agen AI untuk menjadi medan pertempuran kompetitif, sebuah tren yang diikuti oleh berita terkini AI publikasi ini seiring dengan peralihan perusahaan dari chatbot ke sistem yang bertindak berdasarkan pengetahuan yang diambil.

Model penyematan menentukan bagian mana yang pernah dilihat agen, yang menjadikannya titik hambatan yang tenang namun menentukan dalam tumpukan AI generatif. NVIDIA membangun Nemotron 3 Embed untuk memperkuat lapisan tersebut. Koleksinya mencakup tiga pos pemeriksaan terbuka: Nemotron-3-Embed-8B-BF16, opsi yang mengutamakan akurasi; Nemotron-3-Embed-1B-BF16, yang mengusung desain yang sama dengan ukuran yang lebih kecil; dan Nemotron-3-Embed-1B-NVFP4, varian 4-bit yang dioptimalkan untuk Blackwell. Ketiganya adalah pembuat enkode transformator yang dilatih dengan penyembunyian perhatian dua arah, dengan penyematan akhir dihasilkan oleh pengumpulan rata-rata pada representasi tingkat token. Masing-masing mendukung panjang urutan maksimum 32,768 token.

Memuncaki Papan Peringkat

Hasil utamanya adalah Nemotron-3-Embed-8B-BF16 menempati peringkat nomor satu secara keseluruhan di RTEB, Retrieval Embedding Benchmark, per 17 Juli 2026, dalam 16 tugas publiknya. Skor diukur sebagai rata-rata NDCG@10 pada panjang urutan model 4.096. NVIDIA mengevaluasi setiap model dalam 34 bahasa, dan ketiga pos pemeriksaan tersebut dirilis berdasarkan Perjanjian Lisensi OpenMDW versi 1.1, menjadikannya tersedia secara gratis bagi pengembang untuk diunduh, dijalankan, dan dimodifikasi.

Khususnya, basis model diambil dari Mistral. Pos pemeriksaan 8B dibangun di atas Ministral-3-8B-Instruct-2512, sedangkan kedua varian 1B menggunakan Ministral-3-3B-Instruct-2512, menurut laporan MarkTechPost. Keputusan NVIDIA untuk membangun fondasi Mistral dan bukan arsitektur internal mencerminkan bagaimana pengembangan model yang lancar, dengan basis terbuka yang secara rutin digunakan kembali dan dilatih ulang untuk tugas-tugas khusus.

Kompresi, Bukan Latihan yang Lebih Kecil

Ada dua kesenjangan kinerja yang menonjol. Model 1B memperoleh 10,4 poin RTEB dibandingkan garis dasar llama-nemotron-embed-vl-1b-v2 generasi sebelumnya. Secara terpisah, pos pemeriksaan 4-bit NVFP4 hanya berharga 0,38 poin RTEB dibandingkan induk BF16-nya, sehingga mempertahankan sekitar 99,5% akurasi pengambilannya. Kompresi yang nyaris tanpa kerugian ini sangat penting bagi tim yang perlu menjalankan penyematan dalam skala besar, di mana biaya memori dan inferensi sering kali mendominasi.

Skor 1B tersebut dicapai melalui jalur kompresi, bukan melalui pelatihan yang lebih kecil. Induknya, nemotron-3-embed-3b, dipangkas dan disuling dalam dua putaran berulang. Pertama, induk 3B dipangkas menjadi 2B menggunakan Pencarian Arsitektur Neural mcore_minitron NVIDIA ModelOpt, yang menelusuri lebar tersembunyi, ukuran FFN, kepala perhatian, dan kedalaman, lalu memilih kandidat terbaik dari 10 depan Pareto teratas. Korpus kalibrasi dalam domain dengan 50.000 sampel menilai kandidat tersebut.

Selanjutnya, model 2B disaring dari guru penyematan 8B yang telah disempurnakan, menggabungkan kehilangan jarak kosinus dan kehilangan kesalahan kuadrat rata-rata pada campuran data dalam domain multibahasa. Prosedur yang sama diulangi untuk menghasilkan pos pemeriksaan 1,14B, yang menunjukkan bahwa varian yang lebih kecil mewarisi sebagian besar kemampuan model yang lebih besar melalui kompresi terstruktur daripada pelatihan independen.

Dibangun untuk Efisiensi Blackwell

Kompresi berlanjut ke format penyajian. Kuantisasi bobot yang ditargetkan dan aktivasi lapisan linier saja, menggunakan tipe data NVFP4, dengan tim peneliti mengandalkan nvidia-modelopt v0.45.0. Distilasi Sadar Kuantisasi diikuti, terutama untuk memulihkan akurasi pada input panjang. Kalibrasi menggunakan 512 sampel, dibagi antara 256 kueri dan 256 bagian dari kumpulan data cnn_dailymail, sementara pelatihan QAD menggunakan 20.000 sampel.

Imbalan praktisnya adalah efisiensi pada perangkat keras terbaru NVIDIA. Tim peneliti melaporkan bahwa NVFP4 di Blackwell memberikan throughput hingga 2x lebih tinggi dibandingkan BF16 sekaligus mempertahankan lebih dari 99% akurasi pengambilan BF16. Kartu model NVFP4 juga mendokumentasikan ukuran penyematan dinamis, memungkinkan pengembang untuk memotong vektor 2.048 dimensi menjadi 1.024 atau 512 dimensi dan melakukan normalisasi ulang setelahnya, menukar sedikit akurasi untuk biaya penyimpanan yang lebih rendah. Fleksibilitas tersebut penting untuk database vektor, karena penyimpanan miliaran vektor berdimensi tinggi memerlukan biaya yang mahal.

Mengapa Penyematan Penting Saat Ini

Penyematan model telah menjadi titik hambatan dalam tumpukan AI generatif. Setiap agen berbasis pengambilan, alat pencarian perusahaan, dan asisten kode bergantung padanya untuk mengambil konteks yang tepat sebelum model bahasa besar menghasilkan respons. Model penyematan yang lebih kuat dan lebih murah dapat secara langsung meningkatkan kualitas jawaban dan memangkas biaya pengoperasian, itulah sebabnya vendor mulai dari OpenAI hingga Cohere hingga kolektif sumber terbuka segera merilis rangkaian produk baru.

Dengan melakukan open source pada koleksi peringkat teratas di bawah lisensi permisif dan memasangkannya dengan kuantisasi yang disesuaikan dengan Blackwell, NVIDIA memperkuat strateginya dalam menyemai ekosistem AI yang lebih luas dengan alat yang bekerja paling baik pada silikonnya sendiri. Bagi pengembang yang membangun pipeline RAG atau sistem memori agen, Nemotron 3 Embed menawarkan opsi segar dan tersedia secara gratis yang mendorong teknologi canggih pada tolok ukur yang banyak ditonton, sementara varian NVFP4 memberi tim jalur yang kredibel untuk memangkas biaya inferensi tanpa mengorbankan kualitas pengambilan yang diandalkan oleh aplikasi mereka.

Tetap Terdepan dalam AI

Model penyematan terbuka seperti Nemotron 3 Embed secara diam-diam mengubah cara agen AI menemukan dan menggunakan informasi. Untuk informasi lebih lanjut tentang model, rilis, dan penelitian yang memajukan bidang ini, ikuti perkembangan AI terbaru kami yang terbaru.

Baca lebih lanjut berita AI ->