Patronus AI, una startup que construye entornos digitales simulados para evaluar agentes autónomos de IA, ha recaudado 50 millones de dólares en una ronda de Serie B a medida que aumenta la demanda de pruebas de agentes confiables. La ronda fue liderada por Greenfield Partners con la participación de Notable Capital, Lightspeed, Datadog y Samsung, informó TechCrunch, lo que elevó la financiación total de la compañía a 70 millones de dólares.
Un nuevo problema: agentes que toman atajos Para más contexto sobre esta historia, consulta nuestra novedades de IA.
A medida que los agentes de IA evolucionan desde responder preguntas hasta ejecutar de forma autónoma tareas complejas de varios pasos, los proveedores de modelos y las nuevas empresas que construyen dichos agentes necesitan tener la seguridad de que los sistemas funcionarán de manera confiable en una amplia gama de escenarios. Los laboratorios de IA a menudo utilizan puntos de referencia para mostrar la destreza de un modelo, pero una puntuación alta en un punto de referencia orientado a agentes no prueba que una IA realmente pueda realizar correctamente trabajos del mundo real.
Esa brecha es donde se enfoca Patronus AI. Fundada en 2023 por los ex investigadores de Meta AI Anand Kannappan y Rebecca Qian, la empresa con sede en San Francisco construye lo que llama "modelos del mundo digital", réplicas de sitios web y sistemas internos en los que los agentes se someten a pruebas de estrés después del entrenamiento. Los agentes se evalúan mediante aprendizaje por refuerzo, que recompensa de forma iterativa la finalización exitosa de la tarea y penaliza los errores.
Préstamos de vehículos autónomos
La compañía compara su enfoque con la forma en que Waymo entrenó autos sin conductor, primero construyendo mundos sintéticos para probar vehículos contra peligros raros como condiciones climáticas adversas o un niño corriendo detrás de una pelota. La diferencia clave con los agentes de IA es que tienden a tomar atajos, lo que significa que no completan las tareas correctamente incluso cuando parecen tener éxito.
"Patronus es realmente bueno para detectar los ataques y asegurarse de que responsabilicen a los modelos", dijo Glenn Solomon, director general de Notable Capital. Solomon describió la demanda de los entornos simulados de la empresa como casi insaciable. Prácticamente todos los laboratorios de inteligencia artificial de vanguardia y muchas nuevas empresas emergentes son ahora clientes, y los ingresos de Patronus se han multiplicado por 15 durante el año pasado.
Ampliando más allá de las tareas verificables
Patronus actualmente ofrece sus mundos digitales simulados para ingeniería de software y finanzas, dos dominios donde los resultados son relativamente fáciles de verificar. Pero la empresa considera que esto es sólo el comienzo. "Hoy estamos muy centrados en los problemas que son verificables, los problemas que se pueden comprobar y verificar de inmediato, pero hay muchas más áreas que no son verificables o son muy difíciles de verificar", dijo Kannappan.
La ambición es construir entornos lo suficientemente sustanciales como para probar agentes en horizontes largos. "Queremos ser capaces de crear el entorno en el que se pueda operar un agente que pueda funcionar durante 10 horas, 10 días o 10 semanas", dijo Kannappan. El hecho de que los procesos sean verificables no significa que sean simples, y la capacidad de detectar a un agente fallando a mitad de un flujo de trabajo de varios días es fundamental para la propuesta de valor de la empresa.
La financiación también llega cuando la industria de la IA en general lucha por cómo medir el progreso. Las puntuaciones de referencia se han convertido en una moneda controvertida, y los críticos argumentan que los modelos pueden optimizarse para pruebas específicas del juego sin mejorar realmente en tareas reales. Los entornos simulados de Patronus ofrecen una alternativa, probando agentes en escenarios abiertos donde la única prueba de éxito es un trabajo completado correctamente en lugar de un número en una tabla de clasificación.
Para los clientes empresariales, esa distinción es importante. Un agente de codificación que aprueba un punto de referencia pero silenciosamente introduce errores en una base de código de producción, o un agente financiero que redondea las cifras incorrectamente, puede causar mucho más daño de lo que sugeriría una puntuación baja en la prueba. Al detectar esas fallas en una zona de pruebas antes de la implementación, Patronus está posicionando la evaluación como un requisito previo para la confianza, no una ocurrencia tardía.
Un enfoque distinto en un campo abarrotado
En cuanto a los rivales, Patronus cree que está compitiendo principalmente contra los equipos de evaluación internos que los laboratorios de IA ya han creado para evaluar el comportamiento de los agentes. Mientras que las empresas de datos humanos como Mercor y Surge ayudan a los creadores de modelos con el aprendizaje por refuerzo, Patronus opera de manera diferente al evaluar cómo se comportan los agentes sin ninguna participación humana, automatizando la detección de fallas que de otro modo requerirían una costosa revisión manual.
La ronda indica la confianza de los inversores en que la evaluación de los agentes se convertirá en una capa fundamental de la pila de IA. A medida que los agentes asumen un trabajo más autónomo, desde reservar viajes hasta realizar análisis financieros, las nuevas empresas capaces de demostrar que esos sistemas son confiables, antes de implementarlos, se están posicionando como guardianes indispensables de la era de la IA agente.
---
Mantente al Día con la IALas últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.
Leer más noticias de IA →


