Un nuevo punto de referencia desafía la forma en que la industria de la IA mide la capacidad científica, y sus primeros resultados son humillantes para los laboratorios de vanguardia. Terminal-Bench-Science 0.1, lanzado esta semana por investigadores de la Universidad de Stanford y el equipo detrás del popular punto de referencia de codificación Terminal-Bench, evalúa agentes de IA en flujos de trabajo de investigación científica reales aportados por científicos en activo, y el modelo más potente probado, Claude Opus 5 ejecutando Claude Code, completó solo el 30% de las tareas.

La página de anuncios del índice de referencia describe sin rodeos su principio rector: los científicos, no los desarrolladores de modelos o los proveedores de datos, deben establecer el estándar de capacidad científica en IA. El proyecto se construyó en colaboración con expertos en el campo de instituciones de investigación de todo el mundo y su primera versión incluye 70 tareas que abarcan las ciencias de la vida, la física, las ciencias de la Tierra, las matemáticas y la ingeniería.

En qué se diferencia de los puntos de referencia de los libros de texto

La mayoría de las evaluaciones científicas de IA evalúan los conocimientos: preguntas de opción múltiple, problemas de libros de texto, ejercicios estandarizados. En cambio, Terminal-Bench-Science mide si los agentes pueden ejecutar los flujos de trabajo técnicamente exigentes y que requieren mucho tiempo y que llenan los días de los investigadores reales: el tipo de trabajo que no aparece en ningún examen. Las tareas se ejecutan en entornos realistas y la calificación se basa en artefactos concretos: análisis, simulaciones, pruebas, códigos y productos de datos, verificados con pruebas reproducibles específicas de las tareas en lugar de modelos de evaluación o puntuaciones de opción múltiple.

Ese diseño refleja una teoría de lo que los asistentes de IA deberían hacer eventualmente por la ciencia. En lugar de reemplazar el juicio científico, argumentan los autores del punto de referencia, los agentes deberían hacerse cargo de la capa de ejecución (ejecutar los experimentos in silico, procesar los datos, verificar las pruebas) para liberar a los científicos para las partes de la investigación donde el juicio humano es más importante: definir preguntas, formular hipótesis, interpretar resultados y comunicar hallazgos.

El proyecto también se construye explícitamente como un objetivo en movimiento. Mientras que muchos puntos de referencia se publican una vez y se abandonan (el anuncio lo llama el problema de los "artículos para publicar"), Terminal-Bench-Science está diseñado como un punto de referencia continuo que evoluciona a lo largo de la frontera, con publicaciones periódicas destinadas a mantener la evaluación por delante del progreso del modelo y evitar la inflación de puntajes impulsada por la contaminación.

La primera tabla de clasificación: muy lejos de ser confiable

La tabla de clasificación v0.1, que llamó mucho la atención cuando llegó a Hacker News esta semana, muestra una fuerte caída desde la cima:

  • Claude Opus 5 (Código Claude): 30,0%
  • GPT-5,6 Sol (Códex): 22,4%
  • Claude Fábula 5 (Código Claude): 21,4%
  • Claude Opus 4.8 (Código Claude): 10,5%
  • GPT-5.6 Terra (Códice): 8,6%
  • GLM 5.3 (Código Claude): 8,1%
  • Kimi K3 (Código Claude): 7,1%
  • Grok 4.6 (Construcción de Grok): 7,1%
  • GPT-5.6 Luna (Códice): 3,3%

Los resultados sugieren que los flujos de trabajo científicos siguen siendo sustancialmente más difíciles para los agentes que la ingeniería de software, donde las puntuaciones del Terminal-Bench original y de codificación rival han aumentado rápidamente. Una tasa de resolución del 30% para el mejor sistema disponible significa que en siete de diez tareas de investigación reales, incluso un agente de primer nivel combinado con un arnés potente no logra producir un trabajo verificablemente correcto.

La distribución dentro de las familias modelo también es instructiva. La brecha entre Claude Opus 5 y Claude Opus 4.8 (casi veinte puntos) y entre las variantes GPT-5.6 Sol, Terra y Luna muestra cuánto depende la calidad de los resultados de la interacción del modelo y el arnés del agente, no solo de la inteligencia del modelo en bruto. Cada entrada con una puntuación alta utiliza un arnés de codificación agente (Claude Code, Codex, Grok Build), lo que refuerza el consenso emergente de que el andamiaje es tan decisivo como los pesos subyacentes.

Por qué los científicos construyeron su propio punto de referencia

El marco del índice de referencia conlleva un argumento institucional sutil. "Hay mucho en juego en la ciencia", afirma el anuncio, "y sus puntos de referencia deben reflejar las prioridades de la comunidad científica más que intereses externos". El proyecto ofrece a los investigadores en activo un mecanismo directo para codificar las tareas que realmente necesitan automatizar y para comparar las afirmaciones de los proveedores de "acelerar el descubrimiento científico" con un estándar verificable.

Eso es importante porque la brecha entre el marketing y la realidad tiene consecuencias reales. Si los laboratorios fronterizos afirman que sus agentes pueden acelerar la investigación mientras que evaluaciones independientes diseñadas por expertos muestran tasas de resolución de un solo dígito al 30%, las decisiones de financiación, los planes de contratación y las políticas de laboratorio basadas en esas afirmaciones heredan el error. Los puntos de referencia continuos y de propiedad de la comunidad son un correctivo: convierten afirmaciones vagas en números reproducibles.

Una señal para las instituciones de investigación

Para las universidades, los laboratorios nacionales y los equipos de I+D que evalúan cuándo implementar agentes, el punto de referencia ofrece algo que las demostraciones de los proveedores no pueden: una medición mantenida por la comunidad de dónde se encuentra realmente la línea de confiabilidad. Una tasa de resolución de entre 10 y 20 años significa que hoy en día es mejor tratar estos sistemas como asistentes que requieren revisión, no como ejecutores autónomos de procesos experimentales. Las categorías de tareas (que abarcan ciencias de la vida, físicas, terrestres, matemáticas y de ingeniería) también brindan a los especialistas del dominio una plantilla para contribuir con flujos de trabajo desde campos que los puntos de referencia genéricos pasan por alto habitualmente.

El contexto más amplio de la industria refuerza la importancia del momento. La ciencia se ha convertido en uno de los casos de uso más promocionados para la IA de vanguardia, y los laboratorios promocionan sus contribuciones al descubrimiento de materiales, la ciencia de las proteínas y las matemáticas. Esas afirmaciones son difíciles de auditar: la producción científica tarda en validarse y el entusiasmo avanza más rápido que la replicación. Un punto de referencia que califica artefactos verificables en flujos de trabajo reales brinda a las instituciones de investigación una manera de separar la capacidad demostrada del teatro de demostración y de rastrear, lanzamiento por lanzamiento, si el progreso de los agentes en la ciencia se está agravando tan rápidamente como lo está en la ingeniería de software, donde Terminal-Bench se hizo famoso por primera vez.

Para la industria de la IA, el mensaje de la versión 0.1 tiene un doble filo. La frontera está claramente avanzando (el 30% del Opus 5 supera al 10,5% del antiguo Opus 4.8), pero el techo sigue estando lejos de la confiabilidad que requieren los laboratorios reales. Los diseñadores del punto de referencia dicen que las publicaciones periódicas rastrearán exactamente qué tan rápido se cierra esa brecha. Los científicos que observan las tendencias emergentes de IA en las herramientas de investigación de agentes ahora tienen un criterio que ellos mismos construyeron.

---

Manténgase a la vanguardia de la IA

Obtenga las últimas noticias, análisis y avances en IA, todo en un solo lugar.

Leer más noticias sobre IA →