Un informe de campo de OpenAI y colaboradores académicos ha descubierto que los agentes de codificación de IA pueden acelerar drásticamente la modernización del software científico antiguo, reescribir herramientas en lenguajes más rápidos y reducir los tiempos de ejecución en órdenes de magnitud. El problema: los mismos agentes no pueden juzgar de manera confiable si su trabajo es científicamente correcto, y a menudo presentan códigos defectuosos con total confianza.
El informe, publicado el 1 de agosto de 2026 y documentado por The Decoder, examinó ocho estudios de casos, principalmente en biología, en los que grupos de investigación utilizaron agentes de codificación como Codex y Claude Code para rescatar, optimizar y reescribir software crítico. Para obtener informes continuos sobre las herramientas que están remodelando la ciencia y la industria, siga nuestras [últimas noticias sobre IA] (https://aibuzzwire.news).
Una crisis silenciosa en el software científico
Gran parte del software que sustenta la investigación moderna comenzó como código de soporte para un solo artículo. Pequeños equipos académicos crearon estas herramientas sin los recursos para realizar pruebas, mantenimiento u optimización adecuados. El resultado es una base frágil: programas que siguen siendo críticos para campos enteros pero que requieren una reparación constante. El informe de campo de OpenAI sugiere que los agentes de codificación de IA podrían ayudar a cerrar esa brecha de larga data.
Los proyectos abarcaron desde mantenimiento de rutina hasta reescrituras completas en lenguajes de programación modernos, y varios lograron mejoras de rendimiento llamativas.
Reconstrucción de STAR en Rust
Uno de los proyectos más ambiciosos, rustar-aligner, reconstruyó STAR desde cero en Rust. STAR es una herramienta ampliamente utilizada que asigna lecturas de secuenciación de las células a sus ubicaciones correspondientes en un genoma. El programa original contiene más de 20.000 líneas de C y C++ y ya no se mantiene activamente, aunque sigue integrado en muchas líneas de investigación.
Para verificar la reescritura, el equipo probó ambas herramientas en 10.000 lecturas de secuenciación cortas de células de levadura. Para lecturas de un solo extremo, Rustar-aligner produjo el mismo resultado que STAR en 99,815 por ciento de los casos. Para lecturas de extremos emparejados, la tasa de acuerdo fue del 99,883 por ciento. La comparación se extendió más allá de las ubicaciones mapeadas para incluir varios otros campos clave que ambos programas producen para cada lectura, y ninguna herramienta mapeó ninguna lectura que la otra no pudo mapear.
Una aceleración de 60 veces
RustQC entregó la mayor aceleración al combinar 15 herramientas de control de calidad independientes en un solo programa. En un conjunto de datos grande, el tiempo de ejecución se desplomó de 15 horas y 34 minutos a solo 14 minutos y 54 segundos, una aceleración de más de 60 veces.Otro proyecto, HelixForge, reemplazó una herramienta para generar datos genómicos sintéticos por una versión acelerada por GPU. En una prueba que utilizó datos de un donante y una sección del genoma de diez millones de pares de bases, HelixForge completó el proceso completo 59,6 veces más rápido que el BamSurgeon original, y el paso de cálculo principal por sí solo se ejecutó 98,6 veces más rápido.
En una modernización más convencional, GPT-5.5 reemplazó el proceso obsoleto de compilación e instalación de cyvcf2, una biblioteca de Python para leer datos genéticos. En la migración MHCflurry, más complicada, Claude Code y Codex alternaron entre los roles de desarrollador y revisor mientras portaban aproximadamente 10,000 líneas de código de TensorFlow a PyTorch. MHCflurry es un modelo de inmunología que predice qué objetivos reconocerán las células inmunitarias.
'Confiadamente equivocado'
El hallazgo del titular, sin embargo, fue aleccionador. En todos los estudios de caso, los agentes completaron rápidamente tareas bien definidas, pero no pudieron juzgar de manera confiable si su trabajo era científicamente correcto. Incluso cuando su código contenía errores, los sistemas a menudo lo presentaban con total confianza.
Brent Pedersen, el desarrollador de cyvcf2, captó la tensión en el informe: "Con los agentes codificadores, es bastante fácil ir rápido; por ahora, para llegar lejos en la ciencia, todavía se necesita orientación, comprensión, gusto y cuidado de expertos".
Philip Ewels, que dirigió el proyecto RustQC, fue más contundente. Describió a los agentes como "elocuentes, convincentes y confiadamente equivocados en formas que son fáciles de pasar por alto". Ewels nunca permitió que los modelos juzgaran la precisión de su propio trabajo, sino que construyó un arnés de prueba independiente para detectar sus errores.
Errores ocultos a simple vista
El estudio de caso del bayesm ilustró lo difícil que puede ser detectar estos errores. Su reescritura en Rust se ejecutó entre dos y veinte veces más rápido que el original, pero las primeras versiones de dos métodos avanzados contenían defectos sutiles. En uno, el agente invirtió un parámetro de control clave, lo que provocó que el programa utilizara el recíproco de los valores previstos. Otro error afectó al cálculo en sí. Los investigadores sólo descubrieron ambos problemas después de realizar una prueba de calibración detallada en miles de conjuntos de datos sintéticos con resultados conocidos.
El episodio subraya un cambio estructural en la forma en que los científicos pueden trabajar junto con la IA: en lugar de escribir códigos ellos mismos, su tarea central pasa a ser verificar rigurosamente los resultados, una función que exige una profunda experiencia en el dominio que los propios agentes no pueden proporcionar.
Qué significa para la ciencia
Los hallazgos llegan en un momento de intenso debate sobre cuánta autonomía se debe otorgar a los sistemas de IA en dominios de alto riesgo. Las aceleraciones son genuinamente transformadoras: una reducción de 60 veces en el tiempo de ejecución puede convertir un trabajo nocturno en una pausa para tomar café. Pero la contribución más importante del informe puede ser su honestidad acerca de los límites. Los agentes que son rápidos, fluidos y persuasivos, pero incapaces de autoevaluar la validez científica, son una herramienta poderosa sólo en manos de expertos que saben exactamente qué verificar.
Para los investigadores involucrados, la lección es clara: la IA puede reconstruir el andamiaje de la ciencia a una velocidad notable, pero el juicio humano sigue siendo una carga.
Manténgase por delante de la IA
Desde avances en investigación hasta implementaciones empresariales, el ritmo del cambio es implacable. Marque AI Buzz Wire para obtener una cobertura continua y verificada de cómo la inteligencia artificial está remodelando la ciencia, los negocios y la sociedad.
Leer más noticias sobre investigación de IA →