NVIDIA ha rilasciato Nemotron 3 Embed, una raccolta aperta di modelli di incorporamento progettati per potenziare la generazione di retrieval-augmented (RAG) su scala di produzione, il recupero di agenti, il recupero di codice e la memoria degli agenti. Il rilascio, descritto in dettaglio da MarkTechPost il 17 luglio 2026, arriva come il livello che decide quali passaggi un agente AI vede mai diventare un campo di battaglia competitivo, una tendenza che il desk ultime notizie sull'intelligenza artificiale di questa pubblicazione ha seguito mentre le aziende passano dai chatbot ai sistemi che agiscono sulla conoscenza recuperata.

I modelli di incorporamento decidono quali passaggi un agente vede, il che li rende un punto di strozzatura silenzioso ma decisivo nello stack dell'IA generativa. NVIDIA ha creato Nemotron 3 Embed per rafforzare questo livello. La raccolta comprende tre checkpoint aperti: Nemotron-3-Embed-8B-BF16, un'opzione che mette al primo posto la precisione; Nemotron-3-Embed-1B-BF16, che porta lo stesso design in un ingombro ridotto; e Nemotron-3-Embed-1B-NVFP4, una variante a 4 bit ottimizzata per Blackwell. Tutti e tre sono codificatori di trasformatori addestrati con il mascheramento dell'attenzione bidirezionale, con l'incorporamento finale prodotto dal pooling medio su rappresentazioni a livello di token. Ciascuno supporta una lunghezza massima della sequenza di 32.768 token.

In cima alla classifica

Il risultato principale è che Nemotron-3-Embed-8B-BF16 si classifica al primo posto in assoluto su RTEB, il Retrieval Embedding Benchmark, al 17 luglio 2026, tra le sue 16 attività pubbliche. I punteggi vengono misurati come NDCG@10 medio con una lunghezza della sequenza del modello di 4.096. NVIDIA ha valutato ciascun modello in 34 lingue e tutti e tre i checkpoint sono rilasciati secondo il contratto di licenza OpenMDW versione 1.1, rendendoli liberamente disponibili per il download, l'esecuzione e la modifica da parte degli sviluppatori.

In particolare, le basi del modello sono tratte da Mistral. Il checkpoint 8B è costruito su Ministral-3-8B-Instruct-2512, mentre entrambe le varianti 1B utilizzano Ministral-3-3B-Instruct-2512, secondo il rapporto MarkTechPost. La decisione di NVIDIA di basarsi sulle fondamenta di Mistral piuttosto che su un'architettura puramente interna riflette quanto lo sviluppo di modelli sia diventato fluido, con basi aperte regolarmente riproposte e riqualificate per compiti specializzati.

Compressione, non una corsa di allenamento più piccola

Emergono due lacune prestazionali. Il modello 1B guadagna 10,4 punti RTEB rispetto alla linea di base lama-nemotron-embed-vl-1b-v2 della generazione precedente. Separatamente, il checkpoint NVFP4 a 4 bit costa solo 0,38 punti RTEB rispetto al genitore BF16, mantenendo circa il 99,5% della precisione di recupero. Questa compressione quasi senza perdite è particolarmente significativa per i team che devono eseguire incorporamenti su larga scala, dove spesso prevalgono i costi di memoria e inferenza.

Questi punteggi da 1 miliardo sono stati ottenuti attraverso una pipeline di compressione anziché un percorso di addestramento più piccolo. Il genitore, nemotron-3-embed-3b, è stato eliminato e distillato in due cicli iterativi. Innanzitutto, il genitore da 3B è stato ridotto a 2B utilizzando mcore_minitron Neural Architecture Search di NVIDIA ModelOpt, che effettua ricerche su larghezza nascosta, dimensione FFN, livelli di attenzione e profondità, quindi seleziona il miglior candidato dai primi 10 fronti Pareto. Un corpus di calibrazione interno al dominio di 50.000 campioni ha valutato questi candidati.

Successivamente, il modello 2B è stato distillato dal modello di incorporamento 8B perfezionato, combinando la perdita di distanza del coseno e la perdita di errore quadratico medio su una combinazione di dati multilingue all'interno del dominio. La stessa procedura è stata ripetuta per produrre il checkpoint 1.14B, dimostrando che le varianti più piccole ereditano gran parte della capacità del modello più grande attraverso la compressione strutturata piuttosto che l'addestramento indipendente.

Costruito per l'efficienza Blackwell

La compressione continua nel formato di pubblicazione. La quantizzazione ha mirato a pesi e attivazioni solo di strati lineari, utilizzando il tipo di dati NVFP4, con il team di ricerca che si è affidato a nvidia-modelopt v0.45.0. È seguita la distillazione consapevole della quantizzazione, principalmente per recuperare la precisione su input lunghi. La calibrazione ha utilizzato 512 campioni, suddivisi tra 256 query e 256 passaggi dal set di dati cnn_dailymail, mentre la formazione QAD ha utilizzato 20.000 campioni.

Il vantaggio pratico è l'efficienza sull'hardware più recente di NVIDIA. Il team di ricerca riferisce che NVFP4 su Blackwell offre un throughput fino a 2 volte superiore rispetto a BF16 pur mantenendo oltre il 99% della precisione di recupero di BF16. La scheda modello NVFP4 documenta anche le dimensioni di incorporamento dinamiche, consentendo agli sviluppatori di suddividere il vettore da 2.048 dimensioni fino a 1.024 o 512 dimensioni e rinormalizzarlo successivamente, barattando un po' di precisione con costi di archiviazione inferiori. Questa flessibilità è importante per i database vettoriali, dove archiviare miliardi di vettori ad alta dimensione è costoso.

Perché gli incorporamenti sono importanti adesso

I modelli di incorporamento sono diventati un punto di strozzatura silenzioso nello stack dell’intelligenza artificiale generativa. Ogni agente basato sul recupero, strumento di ricerca aziendale e assistente di codice dipende da loro per recuperare il contesto corretto prima che un modello linguistico di grandi dimensioni generi una risposta. Un modello di incorporamento più forte ed economico può migliorare direttamente la qualità delle risposte e ridurre i costi operativi, motivo per cui i fornitori da OpenAI a Cohere fino ai collettivi open source si sono affrettati a rilasciare nuove famiglie.

Rendendo open source una raccolta di alto livello con una licenza permissiva e abbinandola alla quantizzazione ottimizzata per Blackwell, NVIDIA sta rafforzando la sua strategia di seminare l'ecosistema AI più ampio con strumenti che funzionano meglio sul proprio silicio. Per gli sviluppatori che realizzano pipeline RAG o sistemi di memoria per agenti, Nemotron 3 Embed offre una nuova opzione disponibile gratuitamente che spinge lo stato dell'arte su un benchmark ampiamente seguito, mentre la variante NVFP4 offre ai team un percorso credibile per ridurre i costi di inferenza senza sacrificare la qualità di recupero da cui dipendono le loro applicazioni.

Stai al passo con l'intelligenza artificiale

I modelli di incorporamento aperto come Nemotron 3 Embed stanno tranquillamente rimodellando il modo in cui gli agenti di intelligenza artificiale trovano e utilizzano le informazioni. Per ulteriori informazioni su modelli, versioni e ricerche che fanno avanzare il settore, segui i nostri ultimi sviluppi dell'intelligenza artificiale non appena vengono pubblicati.

Leggi altre notizie sull'AI ->