Alors que l’intelligence artificielle passe des chatbots à tour unique à des agents autonomes fonctionnant en continu, NVIDIA élargit sa gamme de modèles ouverts pour répondre au moment présent. Le 11 août 2026, la société a dévoilé Nemotron 3.5 Lightning, un modèle combinant 30 milliards de paramètres d'experts qu'elle qualifie de modèle le plus efficace de sa catégorie pour les charges de travail d'IA agentique de longue durée. La version, détaillée sur le blog NVIDIA par Kari Briski, arrive aux côtés de NeMo Switchyard, une bibliothèque de routage open source conçue pour diriger automatiquement chaque tâche vers le modèle le plus performant et le plus rentable. Pour connaître la dernière couverture de l'industrie de l'IA, suivez l'évolution de la pile d'IA agentique.
Un modèle conçu pour les agents toujours disponibles
Les systèmes agents modernes fonctionnent de plus en plus comme ce que NVIDIA décrit comme des « systèmes de modèles » ou des ensembles de modèles. Un modèle de raisonnement frontalier tel que Nemotron 3 Ultra ou GPT-5.6 peut planifier et orchestrer un flux de travail, tandis que des modèles spécialisés plus petits gèrent des tâches ciblées telles que la révision du code, l'utilisation d'outils, la surveillance des alertes de sécurité ou la réponse aux questions de facturation. Nemotron 3.5 Lightning est spécialement conçu pour ce deuxième niveau : des tâches spécialisées à grand volume qui alimentent des agents toujours actifs.
Selon NVIDIA, le modèle offre une vitesse de sortie jusqu'à 4 fois plus rapide, ce qui permet d'effectuer des tâches agentiques environ 30 % plus rapidement par rapport aux autres modèles de sa catégorie. Les propres tests PinchBench de NVIDIA démontreraient que Nemotron 3.5 Lightning maintient une précision de premier ordre tout en accomplissant les tâches plus rapidement que ses pairs. Le modèle a été développé avec les contributions de la Nemotron Coalition, dont les membres ont fourni des méthodologies d'évaluation, des logiciels d'inférence et des ensembles de données pour contribuer à faire progresser le modèle.
Parce qu'il est ouvert et personnalisable, les organisations peuvent post-former Nemotron 3.5 Lightning avec NVIDIA NeMo sur leurs propres données, outils et flux de travail de domaine pour améliorer la précision des tâches spécialisées. NVIDIA publie également Nemotron-RL-Agentic-Terminal-Pivot, un ensemble de données d'apprentissage par renforcement agent utilisé pour post-entraîner le modèle aux capacités de l'agent de codage.
Exécution n'importe où, de la périphérie au cloud
L'un des principaux arguments de vente de Nemotron 3.5 Lightning est la flexibilité de déploiement. Le modèle peut fonctionner sur des systèmes d'IA locaux, notamment les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson, permettant aux organisations de maximiser leurs investissements dans l'infrastructure existante. Il peut également s'adapter aux appareils d'IA de pointe, aux postes de travail NVIDIA RTX PRO, aux centres de données et aux environnements cloud pour les cas d'utilisation en entreprise. Cette flexibilité est importante pour les organisations qui gèrent des données sensibles qui doivent rester sur site.
Comme pour chaque lancement de Nemotron, NVIDIA affirme publier autant de données et de techniques de formation que la licence le permet, ce qui permet la traçabilité, l'audit et la formation d'autres modèles. Cet engagement en faveur de la transparence est devenu un différenciateur concurrentiel dans la mesure où les entreprises comparent les modèles ouverts aux alternatives propriétaires qui offrent moins de visibilité sur la manière dont ils ont été construits.
NeMo Switchyard : Routage intelligent pour les systèmes de modèles
Si Nemotron 3.5 Lightning est le cheval de bataille, NeMo Switchyard est le répartiteur. La bibliothèque open source achemine automatiquement les invites vers le modèle le plus performant et le plus efficace pour chaque étape du flux de travail d'un agent, en fonction des besoins spécifiques. Certains modèles sont meilleurs pour le codage, d'autres pour le raisonnement, d'autres pour les tâches légères et certains sont optimisés pour s'exécuter localement pour une plus grande confidentialité et une plus grande efficacité. S'appuyer sur un seul modèle par défaut peut signifier dépenser trop ou sacrifier la qualité ; la gestion manuelle du routage, quant à elle, devient un travail d'intégration qui peut ralentir un déploiement.
Les développeurs d'applications d'agent peuvent régler ou modifier le routeur avec différents algorithmes de routage pour correspondre à leurs priorités, telles que les exigences de qualité, de latence et de coût. Les tests internes de NVIDIA montrent que NeMo Switchyard maintient une précision de pointe tout en réduisant le coût d'exécution des tâches à près d'un tiers de celui de l'Opus 4.8 seul — un gain d'efficacité frappant pour les organisations exécutant un grand nombre de tâches d'agent.
La société a mis en avant une série d’intégrations de partenaires. Boomi a signalé une précision de routage de domaine de 100 % et a envoyé 59 % du trafic vers un modèle affiné 5 fois plus rapide. Cadence a amélioré l'efficacité de 9,9 % sur un cas d'utilisation de vérification formelle. Cognition a intégré Switchyard dans Devin Desktop, atteignant des performances proches de la frontière sur FrontierCode Main tout en réduisant le coût moyen de 28 %. LangChain a signalé une réduction de 74 % des coûts sur 145 tâches Deep Agents multi-tours en acheminant seulement 7 % des appels vers un modèle frontière. LiteLLM ajoute NeMo Switchyard en tant que plug-in à sa couche proxy, et Kong propose désormais le routage de manière native via Kong AI Gateway. Notamment, Nous Research a intégré NeMo Switchyard dans Hermes pour offrir aux développeurs un système de routage facile à configurer pour l'efficacité des agents.
Adoption par l'industrie et vue d'ensemble
Les leaders de l'IA de tous les secteurs personnalisent déjà Nemotron 3.5 Lightning pour leurs charges de travail. CrowdStrike l'applique à la cybersécurité, Harvey l'utilise pour les services juridiques et CodeRabbit le déploie pour la révision du code. Lila Sciences contribue à améliorer les capacités de raisonnement pour les tâches agentiques dans les sciences physiques et de la vie, tandis que Fastino Labs a personnalisé le modèle et signalé des précisions de pointe pour les charges de travail de développement de logiciels, de finance et de soins de santé.
Cette version souligne une tendance plus large du secteur : à mesure que l’IA agentique évolue, aucun modèle ne peut à lui seul tout faire correctement à un coût acceptable. L’avenir appartient aux ensembles – les planificateurs des frontières coordonnant des flottes de travailleurs spécialisés – et aux outils qui les relient entre eux. Le pari de NVIDIA est que les modèles ouverts et le routage intelligent permettront aux entreprises d'assembler ces systèmes sans s'enfermer dans la pile d'un seul fournisseur.
Gardez une longueur d'avance sur l'IA
Le Nemotron 3.5 Lightning et le NeMo Switchyard de NVIDIA indiquent vers où se dirige l'IA agentique : plus rapide, moins cher, plus transparent et déployable n'importe où. Pour suivre les versions de modèles et les outils d'entreprise qui remodèlent le paysage, explorez nos dernières actualités sur l'IA.
Lire plus d'actualités sur l'IA →