NVIDIA a lansat Nemotron 3 Embed, o colecție deschisă de modele de încorporare concepute pentru a alimenta generarea augmentată de recuperare la scară de producție (RAG), regăsirea agentică, recuperarea codului și memoria agentului. Lansarea, detaliată de MarkTechPost pe 17 iulie 2026, vine pe măsură ce stratul care decide ce pasaje vede vreodată un agent AI devine un câmp de luptă competitiv, o tendință pe care a urmat-o biroul acestei publicații (https://aibuzzwire.news) pe măsură ce întreprinderile trec de la chatboți la sisteme care acționează pe baza cunoștințelor recuperate.
Modelele de încorporare decid ce pasaje vede vreodată un agent, ceea ce le face un punct de sufocare liniștit, dar decisiv în stiva AI generativă. NVIDIA a construit Nemotron 3 Embed pentru a consolida acel strat. Colecția include trei puncte de control deschise: Nemotron-3-Embed-8B-BF16, o opțiune pentru acuratețea în primul rând; Nemotron-3-Embed-1B-BF16, care poartă același design într-o amprentă mai mică; și Nemotron-3-Embed-1B-NVFP4, o variantă de 4 biți optimizată de Blackwell. Toți trei sunt encodere cu transformator antrenați cu mascarea bidirecțională a atenției, cu încorporarea finală produsă prin pooling mediu peste reprezentări la nivel de simbol. Fiecare acceptă o lungime maximă a secvenței de 32.768 de jetoane.
În fruntea clasamentului
Rezultatul principal este că Nemotron-3-Embed-8B-BF16 ocupă locul unu în general pe RTEB, Retrieval Embedding Benchmark, începând cu 17 iulie 2026, în cele 16 sarcini publice ale sale. Scorurile sunt măsurate ca medie NDCG@10 la o lungime a secvenței modelului de 4.096. NVIDIA a evaluat fiecare model în 34 de limbi, iar toate cele trei puncte de control sunt lansate conform Acordului de licență OpenMDW versiunea 1.1, făcându-le disponibile gratuit pentru descărcare, rulare și modificare.
În special, bazele modelului sunt extrase din Mistral. Punctul de control 8B este construit pe Ministral-3-8B-Instruct-2512, în timp ce ambele variante 1B folosesc Ministral-3-3B-Instruct-2512, conform raportului MarkTechPost. Decizia NVIDIA de a construi mai degrabă pe baza lui Mistral decât pe o arhitectură pur internă reflectă modul în care dezvoltarea modelului a devenit fluidă, cu baze deschise reutilizate și reinstruite în mod obișnuit pentru sarcini specializate.
Compresiune, nu o cursă de antrenament mai mică
Două lacune de performanță ies în evidență. Modelul 1B câștigă 10,4 puncte RTEB față de linia de bază llama-nemotron-embed-vl-1b-v2 din generația anterioară. Separat, punctul de control NVFP4 pe 4 biți costă doar 0,38 puncte RTEB față de părintele său BF16, păstrând aproximativ 99,5% din acuratețea de recuperare. Acea compresie aproape fără pierderi este deosebit de importantă pentru echipele care trebuie să ruleze înglobări la scară, unde costurile de memorie și de inferență domină adesea.
Aceste scoruri 1B au fost obținute printr-o conductă de compresie, mai degrabă decât printr-o cursă de antrenament mai mică. Părinte, nemotron-3-embed-3b, a fost tăiat și distilat în două runde iterative. Mai întâi, părintele 3B a fost tăiat la 2B utilizând mcore_minitron Neural Architecture Search de la NVIDIA ModelOpt, care caută pe lățimea ascunsă, dimensiunea FFN, capetele de atenție și adâncimea, apoi alege cel mai bun candidat din top-10 față Pareto. Un corpus de calibrare în domeniu de 50.000 de mostre a punctat acești candidați.
În continuare, modelul 2B a fost distilat din profesorul de încorporare 8B ajustat, combinând pierderea distanței cosinus și pierderea erorii pătrate medii într-un amestec de date multilingv în domeniu. Aceeași procedură a fost repetată pentru a produce punctul de control 1.14B, demonstrând că variantele mai mici moștenesc o mare parte din capacitatea modelului mai mare prin compresie structurată, mai degrabă decât prin antrenament independent.
Construit pentru eficiența Blackwell
Comprimarea continuă în formatul de servire. Cuantizarea a vizat doar ponderile și activările straturilor liniare, folosind tipul de date NVFP4, echipa de cercetare bazându-se pe nvidia-modelopt v0.45.0. A urmat distilarea cuantizată, în primul rând pentru a recupera acuratețea la intrări lungi. Calibrarea a folosit 512 mostre, împărțite între 256 de interogări și 256 de pasaje din setul de date cnn_dailymail, în timp ce instruirea QAD a folosit 20.000 de mostre.
Beneficiul practic este eficiența pe cel mai recent hardware NVIDIA. Echipa de cercetare raportează că NVFP4 pe Blackwell oferă o capacitate de transfer de până la 2 ori mai mare decât BF16, păstrând în același timp mai mult de 99% din precizia de recuperare a BF16. Cardul model NVFP4 documentează, de asemenea, dimensiuni dinamice de încorporare, permițând dezvoltatorilor să reducă vectorul de 2.048 dimensiuni până la 1.024 sau 512 dimensiuni și să se renormalizeze ulterior, schimbând o mică precizie pentru un cost de stocare mai mic. Această flexibilitate contează pentru bazele de date vectoriale, unde stocarea a miliarde de vectori de dimensiuni mari este costisitoare.
De ce contează acum înglobările
Modelele de încorporare au devenit un punct de sufocare liniştit în stiva AI generativă. Fiecare agent bazat pe recuperare, instrument de căutare pentru întreprinderi și asistent de cod depind de ei pentru a prelua contextul potrivit înainte ca un model de limbaj mare să genereze un răspuns. Un model de încorporare mai puternic și mai ieftin poate îmbunătăți în mod direct calitatea răspunsurilor și poate reduce costurile de operare, motiv pentru care furnizorii de la OpenAI la Cohere până la colectivități open-source s-au grăbit să lanseze noi familii.
Prin aprovizionarea cu surse deschise a unei colecții de top sub o licență permisivă și împerecherea acesteia cu cuantizarea reglată de Blackwell, NVIDIA își consolidează strategia de a însămânța ecosistemul AI mai larg cu instrumente care funcționează cel mai bine pe propriul siliciu. Pentru dezvoltatorii care construiesc conducte RAG sau sisteme de memorie agent, Nemotron 3 Embed oferă o opțiune proaspătă, disponibilă gratuit, care împinge stadiul tehnicii pe un etalon de referință urmărit pe scară largă, în timp ce varianta NVFP4 oferă echipelor o cale credibilă pentru reducerea costurilor de inferență fără a sacrifica calitatea de recuperare de care depind aplicațiile lor.
Rămâi înaintea AI
Modelele de încorporare deschisă, cum ar fi Nemotron 3 Embed, modifică în liniște modul în care agenții AI găsesc și folosesc informațiile. Pentru mai multe despre modele, lansări și cercetări care avansează în domeniu, urmăriți cele mai recente evoluții AI pe măsură ce se derulează.
Citiți mai multe știri AI ->



