Salesforce y NVIDIA anunciaron Koa el 15 de septiembre, un modelo de razonamiento que las empresas describen como el primero creado específicamente para el trabajo de gestión de relaciones con los clientes. En lugar de entrenar un modelo básico desde cero, Salesforce entrenó posteriormente el modelo Nemotron 3 Super de peso abierto de NVIDIA (una base de 120 mil millones de parámetros) en un conjunto de datos sintéticos patentado modelado en casi tres décadas de conocimiento de implementación de CRM. El modelo ahora impulsa a los agentes especializados en la plataforma Agentforce de Salesforce, y clientes piloto, incluidos Fórmula 1, Xero y UChicago Medicine, ya lo están probando.
El anuncio, realizado durante la conferencia Dreamforce de Salesforce en San Francisco, marca un cambio notable en la forma en que los proveedores de software empresarial abordan la IA. En lugar de alquilar inteligencia de laboratorios fronterizos, Salesforce construyó su propio modelo especializado y mantuvo el control de los pesos. Para obtener más contexto sobre esta historia, consulte nuestra cobertura de la industria de la IA en curso.
Cómo se construyó Koa: sin datos del cliente
Salesforce es explícito en un punto: no se utilizaron datos de clientes para entrenar a Koa. El corpus de capacitación consta enteramente de escenarios sintéticos que cubren el razonamiento, el uso de herramientas y la toma de decisiones que realizan los agentes de Agentforce en los flujos de trabajo de CRM: generar clientes potenciales, calificar oportunidades y resolver casos de servicio.
Según el anuncio conjunto, los escenarios simulan flujos de trabajo empresariales reales en más de 14 industrias, incluidas la manufactura, los servicios financieros, la atención médica y los viajes. Cada escenario empareja una persona con un conjunto de tareas, y la secuencia de acciones y llamadas a herramientas necesarias para completarlas se mapea de antemano.
Para la capacitación posterior, Salesforce aplicó un ajuste fino supervisado seguido de un aprendizaje reforzado utilizando la optimización de políticas relativas al grupo (GRPO), ejecutada en las herramientas NeMo RL, NeMo Gym y NeMo AutoModel de NVIDIA. La compañía dice que la capacitación en un conjunto específico de tareas empresariales priorizadas enseñó al modelo a alcanzar metas a través de secuencias de acciones correctas, en lugar de simplemente producir una respuesta correcta.
La investigación detrás del modelo
Un trabajo de investigación presentado a arXiv el 14 de septiembre describe el componente distintivo de Koa como un proceso de simulación a recompensa: las especificaciones del flujo de trabajo se convierten en tareas de múltiples turnos condicionadas por la persona, con recompensas vinculadas a la resolución de cada tarea mediante el uso exitoso de la herramienta. Para dominios empresariales, esas especificaciones están escritas en Agent Script, el lenguaje declarativo de Salesforce para crear agentes de Agentforce. La misma simulación y maquinaria de recompensa basada en tierra impulsaron a GRPO en los dominios de uso de herramientas públicas y empresariales.
Los autores informan que Koa mejora su base de peso abierto en los puntos de referencia de uso de herramientas públicas, razonamiento agente y CRM empresarial, con las ganancias más claras en el uso de herramientas de múltiples turnos. El modelo supera una sólida línea de base patentada mientras se mantiene por debajo de los modelos de frontera más sólidos: una brecha que Salesforce apuesta que no importa para el trabajo de CRM.
Puntos de referencia: tres veces menos errores en tareas de CRM
En el punto de referencia CRM de Salesforce (un conjunto de tareas del mundo real como actualizar una oportunidad, enrutar un caso o programar un seguimiento), la compañía dice que Koa iguala o supera el rendimiento del modelo líder en acciones de CRM con tres veces menos errores.
Esa afirmación importa menos por su número principal que por su premisa: un modelo más pequeño especializado en un dominio puede superar a los modelos de frontera de propósito general en las tareas de ese dominio. Es el mismo argumento que los defensores del peso abierto han esgrimido durante todo el año, ahora con un caso de prueba empresarial adjunto.
Límites de confianza y presión gubernamental
Salesforce dice que controla los pesos del modelo Koa y realiza post-entrenamiento e inferencia completamente dentro de su propio límite de confianza, por lo que ningún dato del cliente cruza ese límite durante la inferencia. Ese posicionamiento está dirigido directamente a las industrias reguladas.
Además de Koa, las dos empresas están incorporando modelos basados en Nemotron a Missionforce, la oferta de Salesforce centrada en el gobierno. Los modelos NVIDIA post-entrenados impulsarán Missionforce Operations, que digitaliza los flujos de trabajo gubernamentales, incluidas las adquisiciones, la gestión de proveedores y la logística, incluidas las implementaciones en redes aisladas que nunca tocan la infraestructura pública. Missionforce Operations ya está disponible de forma general en las regiones de EE. UU., y los modelos post-capacitados llegarán a clientes selectos en octubre de 2026.
Pilotos en marcha, disponibilidad general este invierno
Koa ya se utiliza dentro de Salesforce, incluido un agente de Slack que ayuda a los empleados a encontrar información y completar las tareas diarias. Se están realizando pruebas piloto para clientes con 1-800Accountant, Baxter Credit Union, Engine, Formula 1, UChicago Medicine y Xero.
Ryan Teeples, director de estrategia de 1-800Accountant, dijo que Koa permite a los agentes de la empresa razonar paso a paso a través de normas fiscales, datos financieros y documentos de clientes. En UChicago Medicine, el director de marketing, Andrew Chang, dijo que el modelo puede manejar flujos de trabajo de coordinación de varios pasos más largos, liberando a los equipos para la atención al paciente.
Se espera disponibilidad general en el invierno de 2026 en las regiones de EE. UU.
Por qué es importante
Es difícil pasar por alto el subtexto estratégico. Como señaló Techzine, Salesforce anunció su propio modelo apenas unas semanas después de ampliar su asociación con Anthropic para incorporar a Claude a sus productos. El CEO Marc Benioff enmarcó a Koa como el producto de esa experiencia acumulada: "Lo más valioso que Salesforce ha construido no es nuestra plataforma, es el conocimiento acumulado de cómo funcionan realmente los negocios empresariales. Con Koa, el conocimiento se coloca dentro del modelo mismo".
Jensen Huang de NVIDIA argumentó que los modelos abiertos de Nemotron dieron a Salesforce la base para un modelo CRM que puede razonar y actuar de forma segura. Para NVIDIA, cada empresa que entrena posteriormente a Nemotron es otro canal de distribución para su pila informática.
Koa también es un dato en una tendencia más amplia para 2026: empresas que se especializan en modelos básicos abiertos para dominios estrechos y de alto valor en lugar de esperar a que los laboratorios fronterizos envíen productos verticales. El aprendizaje por refuerzo basado en especificaciones, concluyen los autores del artículo de arXiv, ofrece una ruta práctica para lograr exactamente eso.
Si la afirmación de que hay tres veces menos errores se mantiene en producción, es de esperar que otros proveedores de software empresarial sigan el mismo camino y que los laboratorios de vanguardia argumenten, con cierta justificación, que sus próximos modelos cerrarán la brecha especializada de todos modos.
---
Manténgase a la vanguardia de la IAObtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.
Leer más noticias sobre IA →