Los puntos de referencia de IA deciden qué modelos aparecen en los titulares, y las empresas que construyen esos modelos han aprendido cómo superarlos. Una startup llamada Vals, formada en 2024, está apostando a que la industria necesita un árbitro cuyas pruebas no se puedan burlar, y los inversores acaban de respaldar esa apuesta en gran medida: Vals recaudó una Serie A de 40 millones de dólares liderada por Andreessen Horowitz el mes pasado, luego de una ronda inicial liderada por 8VC y Bloomberg Beta.

El ascenso de la empresa se produce en medio de una creciente inquietud sobre cómo se miden las capacidades de la IA y qué sucede cuando el criterio se convierte en una herramienta de marketing. Para obtener más información sobre el negocio de la IA, siga Cobertura de la industria de la IA.

Cuando los puntos de referencia se convierten en marketing

La evaluación comparativa se ha convertido en la norma de la industria para validar las capacidades de los modelos de IA y, cuando los números cambian a favor de una empresa, para demostrar la superioridad publicitaria sobre sus rivales. Buenos puntos de referencia significan buenas relaciones públicas.

El problema, según el cofundador y director ejecutivo de Vals, Rayan Krishnan, es que muchos puntos de referencia heredados se crearon para una generación anterior de modelos y las empresas han descubierto cómo optimizarlos. Cuando los materiales de prueba son públicos, se puede entrenar eficazmente a un modelo para que apruebe el examen, una práctica que la industria ha descrito de diversas formas como contaminación, sobreajuste o trampa absoluta.

"Estábamos viendo que un montón de modelos nuevos y muy capaces llegaban rápidamente al mercado, y los puntos de referencia académicos no estaban a la altura de ese avance fronterizo", dijo Krishnan en una entrevista con TechCrunch.

Pruebas privadas, tareas del mundo real

Vals adopta un enfoque diferente en dos frentes. En primer lugar, no divulga públicamente sus materiales de prueba específicos, lo que hace que sea mucho más difícil para una empresa entrenar sus modelos para el examen. En segundo lugar, en lugar de medir el conocimiento abstracto (si un modelo puede responder preguntas tipo examen de admisión), Vals evalúa cómo los modelos realizan tareas complejas en industrias específicas como el derecho, las finanzas y la codificación.

"Lo que estamos haciendo es analizar cuáles son los impactos reales de los modelos", dijo Krishnan. "¿Pueden realizar un trabajo que produzca un producto de la misma calidad que un ser humano en todos los ámbitos?"

La empresa también mide los modos de fracaso, no sólo los éxitos. Krishnan dijo que Vals pretende analizar "si estos modelos se desbocaran en el mundo, cuáles serían las implicaciones negativas", una filosofía de evaluación que trata el riesgo a la baja como un resultado mensurable en lugar de una ocurrencia tardía.

Del derecho y las finanzas a los Convenios de Ginebra y la superación personal recursiva

El alcance de las evaluaciones de Vals sigue expandiéndose más allá de sus raíces de servicios profesionales. Además de los puntos de referencia de derecho, finanzas y codificación, Krishnan dijo que la compañía ahora realiza pruebas en salud mental, ciberseguridad y bioseguridad, e incluso un punto de referencia sobre superación personal recursiva, un tema que se discute más comúnmente en los círculos de seguridad de la IA que en las suites de evaluación comerciales.

Quizás lo más sorprendente sea su trabajo sobre el derecho de los conflictos armados, donde Vals está probando cómo los modelos entienden y aplican la Convención de Ginebra. La amplitud indica de dónde proviene la demanda: no solo laboratorios que compiten por alcanzar las primeras posiciones, sino empresas e instituciones que necesitan evidencia de cómo se comportan los modelos en dominios de alto riesgo antes de implementarlos.

El modelo de negocio: pagar para realizar el examen

Las empresas pagan a Vals para que evalúe sus modelos, un acuerdo que puede parecer contradictorio. ¿Por qué una empresa pagaría por resultados que podrían avergonzarla? Krishnan compara el modelo con un estudiante que paga al College Board para realizar el SAT: una medición independiente, incluso poco halagadora, ayuda a una empresa a solucionar problemas y mejorar con el tiempo.

El mercado parece estar respondiendo. Vals dice que sus ingresos actualmente son ocho veces mayores que el año pasado, y su equipo se ha triplicado desde principios de año, pasando de ocho personas a 25. La compañía opera desde una oficina de dos pisos en Folsom Street de San Francisco, un antiguo edificio de cervecería que ahora alberga varias empresas emergentes.

Según la empresa, las evaluaciones también se están convirtiendo en factores de toma de decisiones para las empresas que compran modelos de IA, lo que otorga a los puntos de referencia un papel más cercano a la diligencia debida que al marketing.

Un fundador de 25 años con un asiento en primera fila

Krishnan, de 25 años, hizo una pasantía en Palantir y, como estudiante universitario en Stanford, trabajó para Microsoft y el conocido laboratorio de inteligencia artificial de la universidad. Dice que Vals nació al observar que la evaluación se quedó atrás de la industria que se suponía debía medir, una brecha que solo se ha ampliado a medida que nuevos modelos llegan más rápido de lo que se pueden diseñar, validar y publicar los puntos de referencia académicos.

La startup se une ahora a un grupo pequeño pero creciente de empresas que intentan institucionalizar la evaluación de la IA, un espacio que incluye esfuerzos académicos, proyectos de clasificación de código abierto e institutos de seguridad. Lo que distingue a Vals es su modelo de pruebas privadas y su enfoque en evaluaciones pagadas específicas de la industria en lugar de clasificaciones públicas.

Por qué es importante

El problema de credibilidad de la industria de la IA con los puntos de referencia está bien documentado: conjuntos de pruebas filtrados, saltos sospechosos en las tablas de clasificación y afirmaciones de marketing que superan el rendimiento en el mundo real. Si los compradores –especialmente las empresas y los gobiernos– comienzan a confiar en evaluaciones privadas basadas en tareas como la de Vals, los incentivos para los desarrolladores de modelos podrían pasar de la enseñanza a las pruebas hacia la capacidad genuina.

Esto está muy lejos de estar resuelto. Un benchmark privado todavía pide a los compradores que confíen en el árbitro, y los clientes de Vals son las mismas empresas que están siendo calificadas. Pero con una Serie A de 40 millones de dólares, un crecimiento de ingresos ocho veces mayor y una demanda que abarca desde la financiación hasta la bioseguridad, la apuesta es que la evaluación independiente se está convirtiendo en infraestructura, un servicio por el que la economía de la IA pagará independientemente de que los resultados la halaguen o no.

Manténgase por delante de la IA

¿Quién mide a los medidores? Siga el negocio de la evaluación de IA y las nuevas empresas que lo están remodelando en AI Buzz Wire, su fuente de últimas noticias sobre IA.

Lea las últimas noticias sobre IA →