Um relatório de campo da OpenAI e de colaboradores acadêmicos descobriu que os agentes de codificação de IA podem acelerar drasticamente a modernização de software científico antigo, reescrevendo ferramentas em linguagens mais rápidas e reduzindo os tempos de execução em ordens de magnitude. O problema: os mesmos agentes não podem avaliar com segurança se seu trabalho é cientificamente correto, muitas vezes apresentando códigos com erros com total confiança.
O relatório, publicado em 1º de agosto de 2026 e documentado por The Decoder, examinou oito estudos de caso — principalmente em biologia — nos quais grupos de pesquisa usaram agentes de codificação como Codex e Claude Code para resgatar, otimizar e reescrever software crítico. Para relatórios contínuos sobre as ferramentas que estão remodelando a ciência e a indústria, acompanhe nossas últimas notícias sobre IA.
Uma crise silenciosa no software científico
Grande parte do software que sustenta a pesquisa moderna começou como código de suporte para um único artigo. Pequenas equipes acadêmicas construíram essas ferramentas sem recursos para testes, manutenção ou otimização adequados. O resultado é uma base frágil: programas que continuam a ser críticos para campos inteiros, mas que requerem reparações constantes. O relatório de campo da OpenAI sugere que os agentes de codificação de IA poderiam ajudar a preencher essa lacuna de longa data.
Os projetos variaram desde manutenção de rotina até reescritas completas em linguagens de programação modernas, e vários deles proporcionaram ganhos de desempenho atraentes.
Reconstruindo STAR em Rust
Um dos projetos mais ambiciosos, rustar-aligner, reconstruiu STAR do zero em Rust. STAR é uma ferramenta amplamente utilizada que mapeia leituras de sequenciamento de células para seus locais correspondentes em um genoma. O programa original contém mais de 20.000 linhas de C e C++ e não é mais mantido ativamente, embora permaneça incorporado em muitos pipelines de pesquisa.
Para verificar a reescrita, a equipe testou ambas as ferramentas em 10.000 leituras curtas de sequenciamento de células de levedura. Para leituras de extremidade única, o alinhador Rustar produziu o mesmo resultado que o STAR em 99,815 por cento dos casos. Para leituras emparelhadas, a taxa de concordância foi de 99,883 por cento. A comparação estendeu-se além dos locais mapeados para incluir vários outros campos-chave que ambos os programas produzem para cada leitura, e nenhuma ferramenta mapeou quaisquer leituras que o outro não conseguiu mapear.
Uma aceleração de 60 vezes
RustQC proporcionou a maior aceleração ao combinar 15 ferramentas separadas de controle de qualidade em um único programa. Em um grande conjunto de dados, o tempo de execução caiu de 15 horas e 34 minutos para apenas 14 minutos e 54 segundos, um aumento de mais de 60 vezes.Outro projeto, HelixForge, substituiu uma ferramenta para geração de dados genômicos sintéticos por uma versão acelerada por GPU. Em um teste usando dados de um doador e uma seção de dez milhões de pares de bases do genoma, o HelixForge completou o pipeline completo 59,6 vezes mais rápido do que o BamSurgeon original, com a etapa de computação principal sozinha sendo executada 98,6 vezes mais rápido.
Em uma modernização mais convencional, o GPT-5.5 substituiu o processo desatualizado de criação e instalação do cyvcf2, uma biblioteca Python para leitura de dados genéticos. A migração mais envolvente do MHCflurry viu Claude Code e Codex alternarem entre as funções de desenvolvedor e revisor enquanto portavam cerca de 10.000 linhas de código do TensorFlow para PyTorch. MHCflurry é um modelo imunológico que prevê quais alvos as células imunológicas reconhecerão.
'Confiantemente errado'
A descoberta da manchete, no entanto, foi preocupante. Nos estudos de caso, os agentes concluíram tarefas bem definidas rapidamente, mas não conseguiram avaliar com segurança se o seu trabalho era cientificamente correto. Mesmo quando o código continha erros, os sistemas frequentemente os apresentavam com total confiança.
Brent Pedersen, o desenvolvedor do cyvcf2, capturou a tensão no relatório: "Com agentes de codificação, é muito fácil ir rápido; por enquanto, para ir longe na ciência, ainda há necessidade de orientação especializada, compreensão, gosto e cuidado."
Philip Ewels, que liderou o projeto RustQC, foi mais direto. Ele descreveu os agentes como "eloqüentes, convincentes e confiantemente errados de maneiras fáceis de passar despercebidas". Ewels nunca permitiu que os modelos julgassem a precisão de seu próprio trabalho, em vez disso construiu um equipamento de teste independente para detectar seus erros.
Erros escondidos à vista de todos
O estudo de caso do bayesm ilustrou o quão difícil pode ser detectar esses erros. Sua reescrita do Rust foi executada entre duas e vinte vezes mais rápido que o original, mas as primeiras versões de dois métodos avançados continham defeitos sutis. Em um deles, o agente inverteu um parâmetro chave de controle, fazendo com que o programa usasse o recíproco dos valores pretendidos. Um bug separado afetou o cálculo em si. Os pesquisadores só descobriram os dois problemas depois de executar um teste de calibração detalhado em milhares de conjuntos de dados sintéticos com resultados conhecidos.
O episódio sublinha uma mudança estrutural na forma como os cientistas podem trabalhar em conjunto com a IA: em vez de escreverem eles próprios o código, a sua tarefa central passa a ser a verificação rigorosa dos resultados - uma função que exige um profundo conhecimento de domínio que os próprios agentes não podem fornecer.
O que isso significa para a ciência
As conclusões chegam num momento de intenso debate sobre quanta autonomia os sistemas de IA devem receber em domínios de alto risco. As acelerações são genuinamente transformadoras: uma redução de 60 vezes no tempo de execução pode transformar um trabalho noturno em uma pausa para o café. Mas a contribuição mais importante do relatório poderá ser a sua honestidade sobre os limites. Agentes rápidos, fluentes e persuasivos, mas incapazes de autoavaliar a validade científica, são uma ferramenta poderosa apenas nas mãos de especialistas que sabem exatamente o que verificar.
Para os investigadores envolvidos, a lição é clara: a IA pode reconstruir a estrutura da ciência a uma velocidade notável, mas o julgamento humano continua a ser um peso.
Fique à frente da IA
Desde avanços em pesquisas até implantações empresariais, o ritmo da mudança é implacável. Marque AI Buzz Wire para uma cobertura contínua e verificada de como a inteligência artificial está remodelando a ciência, os negócios e a sociedade.
Leia mais notícias sobre pesquisa de IA →