NVIDIA a publié Nemotron 3 Embed, une collection ouverte de modèles d'intégration conçus pour alimenter la génération augmentée par récupération (RAG), la récupération agentique, la récupération de code et la mémoire d'agent à l'échelle de la production. La publication, détaillée par MarkTechPost le 17 juillet 2026, arrive alors que la couche qui décide quels passages un agent d'IA voit devient un champ de bataille concurrentiel, une tendance que le bureau dernières nouvelles de l'IA de cette publication a suivie alors que les entreprises passent des chatbots aux systèmes qui agissent sur les connaissances récupérées.

Les modèles d'intégration décident quels passages un agent voit, ce qui en fait un point d'étranglement discret mais décisif dans la pile d'IA générative. NVIDIA a construit Nemotron 3 Embed pour renforcer cette couche. La collection comprend trois points de contrôle ouverts : Nemotron-3-Embed-8B-BF16, une option axée sur la précision ; Nemotron-3-Embed-1B-BF16, qui reprend la même conception dans un encombrement réduit ; et Nemotron-3-Embed-1B-NVFP4, une variante 4 bits optimisée par Blackwell. Tous les trois sont des codeurs de transformateur formés avec un masquage d'attention bidirectionnel, l'intégration finale étant produite par une mise en commun moyenne sur des représentations au niveau du jeton. Chacun prend en charge une longueur de séquence maximale de 32 768 jetons.

En tête du classement

Le résultat principal est que Nemotron-3-Embed-8B-BF16 se classe numéro un au classement général sur RTEB, le Retrieval Embedding Benchmark, au 17 juillet 2026, pour ses 16 tâches publiques. Les scores sont mesurés en moyenne NDCG@10 pour une longueur de séquence modèle de 4 096. NVIDIA a évalué chaque modèle dans 34 langues, et les trois points de contrôle sont publiés dans le cadre du contrat de licence OpenMDW version 1.1, ce qui les rend disponibles gratuitement pour que les développeurs puissent les télécharger, les exécuter et les modifier.

Notamment, les bases du modèle sont tirées de Mistral. Le point de contrôle 8B est construit sur Ministral-3-8B-Instruct-2512, tandis que les deux variantes 1B utilisent Ministral-3-3B-Instruct-2512, selon le rapport MarkTechPost. La décision de NVIDIA de s'appuyer sur les fondations de Mistral plutôt que sur une architecture purement interne reflète à quel point le développement de modèles est devenu fluide, avec des bases ouvertes régulièrement réutilisées et recyclées pour des tâches spécialisées.

Compression, pas une course d'entraînement plus petite

Deux écarts de performance ressortent. Le modèle 1B gagne 10,4 points RTEB par rapport à la référence lama-nemotron-embed-vl-1b-v2 de la génération précédente. Par ailleurs, le point de contrôle NVFP4 4 bits ne coûte que 0,38 point RTEB par rapport à son parent BF16, conservant environ 99,5 % de sa précision de récupération. Cette compression quasiment sans perte est particulièrement importante pour les équipes qui doivent exécuter des intégrations à grande échelle, où les coûts de mémoire et d'inférence dominent souvent.

Ces scores 1B ont été obtenus grâce à un pipeline de compression plutôt qu'à une petite série d'entraînement. Le parent, nemotron-3-embed-3b, a été élagué et distillé en deux cycles itératifs. Tout d'abord, le parent 3B a été réduit à 2B à l'aide de la recherche d'architecture neuronale mcore_minitron de NVIDIA ModelOpt, qui recherche sur la largeur cachée, la taille du FFN, les têtes d'attention et la profondeur, puis sélectionne le meilleur candidat parmi les 10 premiers fronts de Pareto. Un corpus d'étalonnage dans le domaine de 50 000 échantillons a évalué ces candidats.

Ensuite, le modèle 2B a été distillé à partir du professeur d'intégration 8B affiné, combinant la perte de distance cosinusoïdale et la perte d'erreur quadratique moyenne sur un mélange de données multilingues dans le domaine. La même procédure a été répétée pour produire le point de contrôle 1.14B, démontrant que les variantes plus petites héritent d'une grande partie des capacités du modèle plus grand grâce à une compression structurée plutôt qu'à un entraînement indépendant.

Conçu pour l'efficacité Blackwell

La compression se poursuit dans le format de diffusion. La quantification a ciblé les poids et les activations des couches linéaires uniquement, en utilisant le type de données NVFP4, l'équipe de recherche s'appuyant sur nvidia-modelopt v0.45.0. Une distillation sensible à la quantification a suivi, principalement pour récupérer la précision sur de longues entrées. L'étalonnage a utilisé 512 échantillons, répartis entre 256 requêtes et 256 passages de l'ensemble de données cnn_dailymail, tandis que la formation QAD s'est appuyée sur 20 000 échantillons.

Le gain pratique est l'efficacité du dernier matériel NVIDIA. L'équipe de recherche rapporte que NVFP4 sur Blackwell offre un débit jusqu'à 2 fois supérieur à celui du BF16 tout en conservant plus de 99 % de la précision de récupération du BF16. La carte modèle NVFP4 documente également les tailles d'intégration dynamiques, permettant aux développeurs de découper le vecteur de 2 048 dimensions à 1 024 ou 512 dimensions et de le renormaliser par la suite, en échangeant un peu de précision contre un coût de stockage inférieur. Cette flexibilité est importante pour les bases de données vectorielles, où le stockage de milliards de vecteurs de grande dimension coûte cher.

Pourquoi les intégrations sont importantes maintenant

L’intégration de modèles est devenue un point d’étranglement discret dans la pile d’IA générative. Chaque agent basé sur la récupération, outil de recherche d'entreprise et assistant de code en dépend pour récupérer le bon contexte avant qu'un grand modèle de langage ne génère une réponse. Un modèle d'intégration plus solide et moins cher peut directement améliorer la qualité des réponses et réduire les coûts d'exploitation. C'est pourquoi les fournisseurs, d'OpenAI à Cohere en passant par les collectifs open source, se sont précipités pour publier de nouvelles familles.

En open source une collection de premier ordre sous une licence permissive et en l'associant à une quantification adaptée à Blackwell, NVIDIA renforce sa stratégie consistant à doter l'écosystème plus large de l'IA d'outils qui fonctionnent mieux sur son propre silicium. Pour les développeurs créant des pipelines RAG ou des systèmes de mémoire d'agent, Nemotron 3 Embed offre une nouvelle option disponible gratuitement qui repousse l'état de l'art sur un benchmark largement surveillé, tandis que la variante NVFP4 offre aux équipes une voie crédible pour réduire les coûts d'inférence sans sacrifier la qualité de récupération dont dépendent leurs applications.

Gardez une longueur d'avance sur l'IA

Les modèles d'intégration ouverts comme Nemotron 3 Embed remodèlent discrètement la façon dont les agents d'IA trouvent et utilisent les informations. Pour en savoir plus sur les modèles, les versions et les recherches qui font avancer le domaine, suivez nos derniers développements en IA au fur et à mesure de leurs nouveautés.

Lire plus d'actualités sur l'IA ->