À medida que a inteligência artificial muda de chatbots de giro único para agentes autônomos que funcionam continuamente, a NVIDIA está expandindo sua linha de modelos abertos para atender o momento. Em 11 de agosto de 2026, a empresa lançou o Nemotron 3.5 Lightning, um modelo de mistura de especialistas de 30 bilhões de parâmetros que ela chama de modelo de maior eficiência em sua classe para cargas de trabalho de IA de agente de longa duração. O lançamento, detalhado no blog da NVIDIA por Kari Briski, chega junto com NeMo Switchyard, uma biblioteca de roteamento de código aberto projetada para direcionar automaticamente cada tarefa para o modelo mais capaz e econômico. Para obter a mais recente cobertura do setor de IA, acompanhe enquanto a pilha de IA da agência toma forma.

Um modelo criado para agentes sempre ativos

Os sistemas agentes modernos operam cada vez mais como o que a NVIDIA descreve como “sistemas de modelos” ou conjuntos de modelos. Um modelo de raciocínio de fronteira, como Nemotron 3 Ultra ou GPT-5.6, pode planejar e orquestrar um fluxo de trabalho, enquanto modelos especializados menores lidam com tarefas específicas, como revisão de código, uso de ferramentas, monitoramento de alertas de segurança ou resposta a perguntas de cobrança. O Nemotron 3.5 Lightning foi desenvolvido especificamente para esse segundo nível: tarefas especializadas de alto volume que capacitam agentes sempre ativos.

De acordo com a NVIDIA, o modelo oferece velocidade de saída até 4x mais rápida, levando a uma conclusão de tarefas de agente cerca de 30% mais rápida em comparação com outros modelos de sua classe. Os próprios benchmarks PinchBench da NVIDIA demonstram que o Nemotron 3.5 Lightning mantém uma precisão de nível de fronteira enquanto completa tarefas mais rapidamente do que seus pares. O modelo foi desenvolvido com contribuições da Coalizão Nemotron, cujos membros forneceram metodologias de avaliação, software de inferência e conjuntos de dados para ajudar no avanço do modelo.

Por ser aberto e personalizável, as organizações podem treinar pós-treinamento do Nemotron 3.5 Lightning com NVIDIA NeMo em dados, ferramentas e fluxos de trabalho de seu próprio domínio para melhorar a precisão de tarefas especializadas. A NVIDIA também está lançando o Nemotron-RL-Agentic-Terminal-Pivot, um conjunto de dados de aprendizagem por reforço de agente usado para pós-treinar o modelo para codificação de recursos do agente.

Executando em qualquer lugar, da borda à nuvem

Um dos principais pontos de venda do Nemotron 3.5 Lightning é a flexibilidade de implantação. O modelo pode ser executado em sistemas locais de IA – incluindo PCs NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson – permitindo que as organizações maximizem os investimentos em infraestrutura existentes. Ele também pode ser dimensionado em dispositivos de IA de ponta, estações de trabalho NVIDIA RTX PRO, data centers e ambientes de nuvem para casos de uso corporativo. Essa flexibilidade é importante para as organizações que lidam com dados confidenciais que devem permanecer no local.

Como acontece com todo lançamento do Nemotron, a NVIDIA afirma que publica tantos dados e técnicas de treinamento quanto o licenciamento permite, o que permite rastreabilidade, auditoria e treinamento de outros modelos. Este compromisso com a transparência tornou-se um diferencial competitivo à medida que as empresas comparam modelos abertos com alternativas proprietárias que oferecem menos visibilidade sobre como foram construídos.

NeMo Switchyard: Roteamento Inteligente para Sistemas de Modelos

Se o Nemotron 3.5 Lightning é o carro-chefe, o NeMo Switchyard é o despachante. A biblioteca de código aberto encaminha automaticamente os prompts para o modelo mais capaz e eficiente para cada etapa do fluxo de trabalho de um agente, com base em necessidades específicas. Alguns modelos são melhores para codificação, alguns para raciocínio, alguns para tarefas leves e alguns são otimizados para execução local para maior privacidade e eficiência. Depender de um único modelo padrão pode significar gastos excessivos ou sacrifício da qualidade; Enquanto isso, gerenciar o roteamento manualmente se torna um trabalho de integração que pode retardar a implantação.

Os desenvolvedores de aplicativos de agente podem ajustar ou modificar o roteador com diferentes algoritmos de roteamento para atender às suas prioridades, como qualidade, latência e requisitos de custo. Os benchmarks internos da NVIDIA mostram que o NeMo Switchyard mantém uma precisão de nível de fronteira enquanto reduz o custo de conclusão de tarefas para quase um terço do Opus 4.8 sozinho — um ganho de eficiência impressionante para organizações que executam um grande número de tarefas de agente.

A empresa destacou uma série de integrações de parceiros. Boomi relatou 100% de precisão de roteamento de domínio e enviou 59% do tráfego para um modelo ajustado 5x mais rápido. A Cadence melhorou a eficiência em 9,9% em um caso de uso de verificação formal. A Cognition integrou o Switchyard ao Devin Desktop, alcançando um desempenho próximo da fronteira no FrontierCode Main e reduzindo o custo médio em 28%. LangChain relatou custo 74% menor em 145 tarefas multivoltas de Deep Agents, roteando apenas 7% das chamadas para um modelo de fronteira. LiteLLM está adicionando NeMo Switchyard como um plug-in à sua camada de proxy, e Kong agora oferece roteamento nativo por meio do Kong AI Gateway. Notavelmente, a Nous Research integrou o NeMo Switchyard ao Hermes para oferecer aos desenvolvedores um sistema de roteamento fácil de configurar para eficiência do agente.

Adoção da indústria e o panorama geral

Os líderes de IA de todos os setores já estão personalizando o Nemotron 3.5 Lightning para suas cargas de trabalho. CrowdStrike está aplicando-o à segurança cibernética, Harvey está usando-o para serviços jurídicos e CodeRabbit está implantando-o para revisão de código. A Lila Sciences está ajudando a melhorar as capacidades de raciocínio para tarefas de agente em ciências físicas e biológicas, enquanto a Fastino Labs personalizou o modelo e relatou precisões importantes para cargas de trabalho de desenvolvimento de software, finanças e saúde.

O lançamento destaca uma tendência mais ampla do setor: à medida que a IA agente amadurece, nenhum modelo único pode fazer tudo bem a um custo aceitável. O futuro pertence aos conjuntos – planeadores de fronteiras que coordenam frotas de trabalhadores especializados – e às ferramentas que os unem. A aposta da NVIDIA é que modelos abertos e roteamento inteligente permitirão que as empresas montem esses sistemas sem ficarem presas à pilha de um único fornecedor.

Fique à frente da IA

O Nemotron 3.5 Lightning e o NeMo Switchyard da NVIDIA sinalizam para onde a IA agente está indo: mais rápida, mais barata, mais transparente e implantável em qualquer lugar. Para acompanhar os lançamentos de modelos e ferramentas empresariais que estão remodelando o cenário, explore nossas notícias de última hora sobre IA.

Leia mais notícias sobre IA →