Mentre l'intelligenza artificiale passa dai chatbot a turno singolo agli agenti autonomi che funzionano continuamente, NVIDIA sta espandendo la sua gamma di modelli aperti per soddisfare il momento. L'11 agosto 2026, l'azienda ha presentato Nemotron 3.5 Lightning, un modello con una combinazione di esperti di 30 miliardi di parametri che definisce il modello con la massima efficienza nella sua categoria per carichi di lavoro di intelligenza artificiale agenti di lunga durata. Il rilascio, dettagliato sul blog NVIDIA da Kari Briski, arriva insieme a NeMo Switchyard, una libreria di routing open source progettata per indirizzare automaticamente ogni attività al modello più capace ed economico. Per l'ultima copertura sul settore dell'intelligenza artificiale, segui mentre prende forma lo stack dell'intelligenza artificiale degli agenti.

Un modello creato per agenti sempre attivi

I moderni sistemi ad agenti operano sempre più come ciò che NVIDIA descrive come "sistemi di modelli" o insiemi di modelli. Un modello di ragionamento di frontiera come Nemotron 3 Ultra o GPT-5.6 potrebbe pianificare e orchestrare un flusso di lavoro, mentre modelli specializzati più piccoli gestiscono attività mirate come la revisione del codice, l’uso degli strumenti, il monitoraggio degli avvisi di sicurezza o la risposta a domande sulla fatturazione. Nemotron 3.5 Lightning è stato creato appositamente per il secondo livello: attività specializzate ad alto volume che alimentano agenti sempre attivi.

Secondo NVIDIA, il modello offre una velocità di output fino a 4 volte più veloce, portando a un completamento delle attività degli agenti di circa 30% più veloce rispetto ad altri modelli della sua categoria. Secondo quanto riferito, i benchmark PinchBench di NVIDIA dimostrano che Nemotron 3.5 Lightning mantiene una precisione a livello di frontiera mentre completa le attività più rapidamente rispetto ai suoi pari. Il modello è stato sviluppato con il contributo della Nemotron Coalition, i cui membri hanno fornito metodologie di valutazione, software di inferenza e set di dati per contribuire a far avanzare il modello.

Poiché è aperto e personalizzabile, le organizzazioni possono eseguire il post-addestramento di Nemotron 3.5 Lightning con NVIDIA NeMo sui dati, sugli strumenti e sui flussi di lavoro del proprio dominio per migliorare la precisione delle attività specializzate. NVIDIA sta inoltre rilasciando Nemotron-RL-Agentic-Terminal-Pivot, un set di dati di apprendimento di rinforzo degli agenti utilizzato per post-addestrare il modello per le capacità dell'agente di codifica.

Correre ovunque, dall'edge al cloud

Uno dei punti di forza centrali di Nemotron 3.5 Lightning è la flessibilità di implementazione. Il modello può essere eseguito su sistemi IA locali, inclusi PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson, consentendo alle organizzazioni di massimizzare gli investimenti nelle infrastrutture esistenti. Può anche scalare su dispositivi AI edge, workstation NVIDIA RTX PRO, data center e ambienti cloud per casi d'uso aziendali. Questa flessibilità è importante per le organizzazioni che gestiscono dati sensibili che devono rimanere in sede.

Come per ogni lancio di Nemotron, NVIDIA afferma di pubblicare la maggior parte dei dati e delle tecniche di addestramento consentiti dalla licenza, il che consente la tracciabilità, il controllo e la formazione di altri modelli. Questo impegno per la trasparenza è diventato un elemento di differenziazione competitiva poiché le aziende valutano i modelli aperti rispetto alle alternative proprietarie che offrono meno visibilità sul modo in cui sono stati costruiti.

NeMo Switchyard: routing intelligente per sistemi di modelli

Se Nemotron 3.5 Lightning è il cavallo di battaglia, NeMo Switchyard è il dispatcher. La libreria open source indirizza automaticamente le richieste al modello più capace ed efficiente per ogni fase del flusso di lavoro di un agente, in base a esigenze specifiche. Alcuni modelli sono migliori per la codifica, altri per il ragionamento, altri per attività leggere e altri ancora sono ottimizzati per l'esecuzione locale per una maggiore privacy ed efficienza. Affidarsi a un unico modello predefinito può significare spendere troppo o sacrificare la qualità; la gestione manuale del routing, nel frattempo, diventa un lavoro di integrazione che può rallentare una distribuzione.

Gli sviluppatori di applicazioni agente possono ottimizzare o modificare il router con diversi algoritmi di routing per soddisfare le loro priorità, come requisiti di qualità, latenza e costi. I benchmark interni di NVIDIA mostrano che NeMo Switchyard mantiene una precisione a livello di frontiera riducendo al tempo stesso i costi di completamento delle attività a quasi un terzo del solo Opus 4.8: un sorprendente guadagno di efficienza per le organizzazioni che eseguono un gran numero di attività degli agenti.

L'azienda ha evidenziato una serie di integrazioni di partner. Boomi ha riportato una precisione di routing del dominio del 100% e ha inviato il 59% del traffico a un modello ottimizzato 5 volte più veloce. Cadence ha migliorato l'efficienza del 9,9% in un caso d'uso di verifica formale. Cognition ha integrato Switchyard in Devin Desktop, ottenendo prestazioni quasi all'avanguardia su FrontierCode Main e riducendo i costi medi del 28%. LangChain ha registrato costi inferiori del 74% per 145 attività multi-turno di Deep Agents instradando solo il 7% delle chiamate a un modello di frontiera. LiteLLM sta aggiungendo NeMo Switchyard come plug-in al suo livello proxy e Kong ora fornisce il routing in modo nativo attraverso Kong AI Gateway. In particolare, Nous Research ha integrato NeMo Switchyard in Hermes per offrire agli sviluppatori un sistema di routing facile da configurare per l'efficienza degli agenti.

Adozione da parte del settore e quadro più ampio

I leader dell'intelligenza artificiale in tutti i settori stanno già personalizzando Nemotron 3.5 Lightning per i loro carichi di lavoro. CrowdStrike lo sta applicando alla sicurezza informatica, Harvey lo sta utilizzando per i servizi legali e CodeRabbit lo sta implementando per la revisione del codice. Lila Sciences sta contribuendo a migliorare le capacità di ragionamento per le attività degli agenti nelle scienze fisiche e della vita, mentre Fastino Labs ha personalizzato il modello e ha riportato accuratezze leader per i carichi di lavoro di sviluppo software, finanza e assistenza sanitaria.

Il comunicato sottolinea una tendenza più ampia del settore: con la maturazione dell’intelligenza artificiale degli agenti, nessun singolo modello può fare tutto bene a un costo accettabile. Il futuro appartiene agli insiemi – pianificatori di frontiera che coordinano flotte di lavoratori specializzati – e agli strumenti che li tengono insieme. La scommessa di NVIDIA è che i modelli aperti e il routing intelligente consentiranno alle aziende di assemblare tali sistemi senza vincolarsi allo stack di un unico fornitore.

Stai al passo con l'intelligenza artificiale

Nemotron 3.5 Lightning e NeMo Switchyard di NVIDIA segnalano la direzione in cui si sta dirigendo l'intelligenza artificiale degli agenti: più veloce, più economica, più trasparente e implementabile ovunque. Per restare al passo con i nuovi modelli e gli strumenti aziendali che stanno rimodellando il panorama, esplora le nostre ultime notizie sull'intelligenza artificiale.

Leggi altre notizie sull'AI →