Un equipo de investigación de FAIR en Meta, la Universidad de Oxford y el University College de Londres ha introducido los modelos de preferencia de investigación (RPM) de IA, un método para decidir qué experimentos de aprendizaje automático debería ejecutar realmente un agente de investigación autónomo. En lugar de predecir la puntuación de un experimento, un RPM clasifica los candidatos no ejecutados y elige el más prometedor, un cambio que, según el equipo, aborda el verdadero cuello de botella en la investigación impulsada por la IA: el cálculo de verificación, según el informe de MarkTechPost sobre el trabajo.

La idea surge en un momento en el que los agentes de investigación ya pueden proponer, implementar y calificar sus propios experimentos. La generación de ideas es barata; la ejecución no lo es. Entrenar a un solo candidato puede consumir horas o días de tiempo de GPU, por lo que un agente inevitablemente propone muchos más experimentos de los que puede permitirse ejecutar. Qué candidatos son ejecutados es, tal como lo plantea el equipo, la verdadera palanca para el progreso de la investigación. Para los laboratorios que ven cómo aumentan sus facturas de computación, ese marco es exactamente el motivo por el que este trabajo está llamando la atención sobre los últimos desarrollos de IA en la automatización de la investigación.

Por qué la selección de experimentos es el cuello de botella

El equipo descubrió que los modelos de lenguaje no son confiables para pronosticar métricas absolutas o resultados de ejecución. Un modelo no puede observar un experimento candidato y predecir con precisión la puntuación que alcanzará. Lo que puede hacer, descubrieron los investigadores, es juzgar cuál de dos candidatos es la mejor apuesta: una comparación relativa en lugar de una predicción absoluta. Los RPM se basan enteramente en esa distinción: nunca pronostican una puntuación, solo clasifican.

El sistema se ejecuta dentro de AIRA-dojo, un andamio de búsqueda de árbol evolutivo de código abierto que genera experimentos de aprendizaje automático a través de una selección de padres codiciosos y operadores de borrador, mejora y depuración, devolviendo el nodo con la puntuación de validación más alta al final. El punto de referencia, AIRS-Bench, también es de código abierto. Tanto el andamio como el modelo de preferencia utilizan Qwen3.6-27B como columna vertebral, que según el equipo son pesos abiertos.

Cómo funciona el torneo eliminatorio

En lugar de generar un experimento secundario y ejecutarlo, el agente aplica un operador 15 veces en paralelo para producir 15 candidatos no ejecutados. Luego, el RPM los compara por pares en un torneo eliminatorio y solo se ejecuta al ganador. Cada comparación se basa en nodos de contexto recopilados mediante un recorrido en amplitud del árbol explorado, y cada candidato se muestra junto con las puntuaciones de validación de sus antepasados, por lo que el juez razona a partir del historial de búsqueda real del agente en lugar de hacerlo en el vacío.

El artículo describe dos variantes con diferentes presupuestos informáticos:

  • RPM de solo inferencia: un LLM como juez que compara los planes, el código y el historial de búsqueda de los candidatos en una sola pasada. Su mensaje se optimizó con MIPROv2 del marco DSPy y convergió en lo que el equipo llama una rúbrica de investigador principal: tolera errores reparables, recompensa la extensibilidad y penaliza las direcciones de investigación redundantes. La precisión de la comparación fuera de línea midió entre 57,7 y 59,0 por ciento.
  • RPM agente: el mismo juez más una zona de pruebas que clona el entorno del agente, incluida una única GPU H200, con herramientas limitadas a Python, Bash y una acción de envío de solución. Realiza experimentos piloto a pequeña escala y luego un modelo de retroalimentación propone el siguiente experimento más informativo o finaliza el ciclo. Los pilotos tienen un límite de 30 con un umbral de 60 segundos, y el presupuesto de tiempo restante se exagera deliberadamente (2.700 segundos reportados contra 300 reales) para que el agente no deje de optimizar antes de tiempo.

Un juez sintonizado como un investigador principal

El encuadre director-investigador es la parte silenciosamente interesante. En lugar de recompensar a los candidatos que parecen increíblemente impresionantes, la rúbrica optimizada refleja cómo un investigador experimentado clasifica las ideas: el código con errores que se puede arreglar supera al código pulido que persigue un callejón sin salida, y las instrucciones que duplican el árbol existente valen menos que las novedosas. Esa rúbrica, aprendida mediante una optimización rápida en lugar de un ajuste manual, es lo que conlleva la mejora, sugieren las ablaciones del equipo.

Resultados comparativos en AIRS-Bench

La evaluación cubrió 20 tareas tabulares y de texto público, y cada tarea se realizó durante 24 horas en un solo H200 y 10 semillas aleatorias. Fundamentalmente, la misma columna vertebral Qwen3.6-27B impulsó tanto a los operadores del experimento como al modelo de preferencia, por lo que las ganancias provienen de la capa de selección en lugar de un modelo de evaluación más sólido. Las puntuaciones promedio normalizadas:

  • Sin RPM (selección aleatoria): 0,684
  • RPM de sólo inferencia: 0,711
  • RPM agentes: 0,729
  • Oráculo de validación (techo): 0,748
  • Prueba de oráculo (techo): 0,759

La probabilidad de mejora con respecto a la selección aleatoria fue de 0,5923 para la variante de solo inferencia y de 0,5913 para la variante agente, con límites inferiores del intervalo de confianza del 95 por ciento de 0,5066 y 0,5018, por encima del umbral de 0,5 para significancia estadística, aunque el equipo es sincero en cuanto a que los márgenes son modestos en lugar de transformadores.

La eficiencia es el resultado más práctico. El RPM de solo inferencia alcanzó la puntuación final de la línea de base aleatoria de 0,684 en 14,88 horas, una aceleración de 1,61 veces, mientras que la variante agente necesitó 15,50 horas, una aceleración de 1,55 veces. Incluso teniendo en cuenta los gastos generales de la inferencia de los jueces autohospedados, las cifras ajustadas siguieron siendo favorables.

Pesos abiertos y advertencias honestas

El equipo es sincero en cuanto a que los RPM solo se pueden implementar parcialmente en la actualidad. Los componentes son abiertos (columnas vertebrales congeladas previamente entrenadas sin ajustes finos, un andamio y punto de referencia de código abierto, y modelos de columna vertebral de pesos abiertos), pero el requisito de zona de pruebas de la variante agente y su sobrecarga de experimento piloto significan que la mayoría de los laboratorios comenzarían con la versión de solo inferencia. Los investigadores también señalan que los pasos de depuración vuelven a la selección aleatoria en la variante agente porque el tiempo del piloto compite con el propio reloj del agente.

El mayor significado puede ser direccional. A medida que los agentes de investigación autónomos pasan de las demostraciones al uso diario en laboratorios industriales, el recurso escaso ya no son las ideas sino las horas de GPU y los métodos que exprimen más progreso de un presupuesto de computación fijo con el tiempo. Clasificar antes de correr es una idea simple, y los números de AIRS-Bench sugieren que es una idea que funciona lo suficientemente bien como para importar.

Manténgase a la vanguardia de la IA

Manténgase al día con las investigaciones que están dando forma a los modelos del mañana en AI Buzz Wire.

Leer más noticias sobre IA →