A medida que la inteligencia artificial pasa de chatbots de un solo turno a agentes autónomos que se ejecutan continuamente, NVIDIA está ampliando su línea de modelos abiertos para adaptarse al momento. El 11 de agosto de 2026, la compañía presentó Nemotron 3.5 Lightning, un modelo de combinación de expertos de 30 mil millones de parámetros que considera el modelo de mayor eficiencia de su clase para cargas de trabajo de IA agente de larga duración. El lanzamiento, detallado en el blog de NVIDIA por Kari Briski, llega junto con NeMo Switchyard, una biblioteca de enrutamiento de código abierto diseñada para dirigir cada tarea automáticamente al modelo más capaz y rentable. Para conocer la [cobertura de la industria de la IA] más reciente (https://aibuzzwire.news), síganos mientras la pila de IA agente toma forma.
Un modelo creado para agentes siempre activos
Los sistemas agentes modernos operan cada vez más como lo que NVIDIA describe como "sistemas de modelos" o conjuntos de modelos. Un modelo de razonamiento de frontera como Nemotron 3 Ultra o GPT-5.6 podría planificar y orquestar un flujo de trabajo, mientras que modelos especializados más pequeños manejan tareas específicas como revisión de código, uso de herramientas, monitoreo de alertas de seguridad o respuesta a preguntas de facturación. Nemotron 3.5 Lightning está diseñado específicamente para ese segundo nivel: tareas especializadas de gran volumen que impulsan a los agentes siempre activos.
Según NVIDIA, el modelo ofrece una velocidad de salida hasta 4 veces más rápida, lo que permite aproximadamente finalización de tareas agentes un 30% más rápido en comparación con otros modelos de su clase. Según se informa, los propios puntos de referencia PinchBench de NVIDIA demuestran que Nemotron 3.5 Lightning mantiene una precisión de nivel fronterizo mientras completa tareas más rápidamente que sus pares. El modelo se desarrolló con contribuciones de la Nemotron Coalition, cuyos miembros proporcionaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a avanzar en el modelo.
Debido a que es abierto y personalizable, las organizaciones pueden entrenar posteriormente Nemotron 3.5 Lightning con NVIDIA NeMo en sus propios datos de dominio, herramientas y flujos de trabajo para mejorar la precisión de las tareas especializadas. NVIDIA también está lanzando Nemotron-RL-Agentic-Terminal-Pivot, un conjunto de datos de aprendizaje por refuerzo agente utilizado para entrenar posteriormente el modelo para codificar las capacidades del agente.
Ejecutando en cualquier lugar, desde el borde hasta la nube
Uno de los puntos de venta centrales de Nemotron 3.5 Lightning es la flexibilidad de implementación. El modelo puede ejecutarse en sistemas de IA locales, incluidas las PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson, lo que permite a las organizaciones maximizar las inversiones en infraestructura existentes. También puede escalar a través de dispositivos de IA perimetrales, estaciones de trabajo NVIDIA RTX PRO, centros de datos y entornos de nube para casos de uso empresarial. Esa flexibilidad es importante para las organizaciones que manejan datos confidenciales que deben permanecer en sus instalaciones.
Al igual que con cada lanzamiento de Nemotron, NVIDIA dice que publica tantos datos y técnicas de entrenamiento como lo permite la licencia, lo que permite la trazabilidad, auditoría y entrenamiento de otros modelos. Este compromiso con la transparencia se ha convertido en un diferenciador competitivo a medida que las empresas comparan los modelos abiertos con alternativas patentadas que ofrecen menos visibilidad sobre cómo fueron construidos.
NeMo Switchyard: enrutamiento inteligente para sistemas de modelos
Si Nemotron 3.5 Lightning es el caballo de batalla, NeMo Switchyard es el despachador. La biblioteca de código abierto dirige automáticamente los mensajes al modelo más capaz y eficiente para cada paso del flujo de trabajo de un agente, según necesidades específicas. Algunos modelos son mejores para codificar, otros para razonar, algunos para tareas livianas y algunos están optimizados para ejecutarse localmente para mayor privacidad y eficiencia. Depender de un único modelo predeterminado puede significar gastar demasiado o sacrificar la calidad; Mientras tanto, administrar el enrutamiento manualmente se convierte en un trabajo de integración que puede ralentizar una implementación.
Los desarrolladores de aplicaciones de agentes pueden ajustar o modificar el enrutador con diferentes algoritmos de enrutamiento para que coincida con sus prioridades, como calidad, latencia y requisitos de costo. Los puntos de referencia internos de NVIDIA muestran que NeMo Switchyard mantiene una precisión de nivel fronterizo al tiempo que reduce el costo de finalización de tareas a casi un tercio de Opus 4.8 solamente: una sorprendente ganancia de eficiencia para las organizaciones que ejecutan una gran cantidad de tareas de agentes.
La compañía destacó una serie de integraciones de socios. Boomi informó una precisión del enrutamiento de dominio del 100 % y envió el 59 % del tráfico a un modelo ajustado 5 veces más rápido. Cadence mejoró la eficiencia en un 9,9 % en un caso de uso de verificación formal. Cognition integró Switchyard en Devin Desktop, logrando un rendimiento cercano a la frontera en FrontierCode Main y reduciendo el costo medio en un 28 %. LangChain informó un costo un 74 % menor en 145 tareas de agentes profundos de múltiples turnos al enrutar solo el 7 % de las llamadas a un modelo de frontera. LiteLLM está agregando NeMo Switchyard como complemento a su capa de proxy, y Kong ahora ofrece enrutamiento de forma nativa a través de Kong AI Gateway. En particular, Nous Research integró NeMo Switchyard en Hermes para brindar a los desarrolladores un sistema de enrutamiento fácil de configurar para la eficiencia de los agentes.
Adopción de la industria y panorama general
Los líderes de IA de todas las industrias ya están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo. CrowdStrike lo está aplicando a la ciberseguridad, Harvey lo está usando para servicios legales y CodeRabbit lo está implementando para revisión de código. Lila Sciences está ayudando a mejorar las capacidades de razonamiento para tareas de agente en las ciencias físicas y biológicas, mientras que Fastino Labs personalizó el modelo e informó precisiones líderes para cargas de trabajo de desarrollo de software, finanzas y atención médica.
El comunicado subraya una tendencia más amplia de la industria: a medida que la IA agente madura, ningún modelo puede hacerlo todo bien a un costo aceptable. El futuro pertenece a los conjuntos (planificadores de fronteras que coordinan flotas de trabajadores especializados) y a las herramientas que los unen. La apuesta de NVIDIA es que los modelos abiertos y el enrutamiento inteligente permitirán a las empresas ensamblar esos sistemas sin encerrarse en la pila de un solo proveedor.
Manténgase por delante de la IA
Nemotron 3.5 Lightning y NeMo Switchyard de NVIDIA señalan hacia dónde se dirige la IA agente: más rápida, más económica, más transparente y desplegable en cualquier lugar. Para mantenerse al día con los lanzamientos de modelos y las herramientas empresariales que están remodelando el panorama, explore nuestras noticias de última hora sobre IA.
Leer más noticias sobre IA →