Un rapporto sul campo di OpenAI e di collaboratori accademici ha scoperto che gli agenti di codifica dell’intelligenza artificiale possono accelerare notevolmente la modernizzazione del software scientifico obsoleto, riscrivendo gli strumenti in linguaggi più veloci e riducendo drasticamente i tempi di esecuzione. Il problema: gli stessi agenti non possono giudicare in modo affidabile se il loro lavoro sia scientificamente corretto, spesso presentando codice difettoso con totale sicurezza.
Il rapporto, pubblicato il 1° agosto 2026 e documentato da The Decoder, ha esaminato otto casi di studio, principalmente di biologia, in cui gruppi di ricerca hanno utilizzato agenti di codifica come Codex e Claude Code per salvare, ottimizzare e riscrivere software critico. Per report continui sugli strumenti che rimodellano la scienza e l'industria, segui le nostre ultime notizie sull'intelligenza artificiale.
Una crisi silenziosa nel software scientifico
Gran parte del software alla base della ricerca moderna è iniziato come codice di supporto per un singolo articolo. Piccoli team accademici hanno creato questi strumenti senza le risorse per test, manutenzione o ottimizzazione adeguati. Il risultato è una base fragile: programmi che rimangono fondamentali per interi settori ma richiedono una costante riparazione. Il rapporto sul campo di OpenAI suggerisce che gli agenti di codifica AI potrebbero aiutare a colmare questo divario di lunga data.
I progetti spaziavano dalla manutenzione ordinaria alle riscritture complete nei moderni linguaggi di programmazione e molti di essi hanno prodotto notevoli miglioramenti delle prestazioni.
Ricostruire STAR in Rust
Uno dei progetti più ambiziosi, rustar-aligner, ha ricostruito STAR da zero in Rust. STAR è uno strumento ampiamente utilizzato che mappa le letture di sequenziamento dalle cellule alle posizioni corrispondenti in un genoma. Il programma originale contiene più di 20.000 righe di C e C++ e non viene più mantenuto attivamente, anche se rimane incorporato in molti percorsi di ricerca.
Per verificare la riscrittura, il team ha testato entrambi gli strumenti su 10.000 letture di sequenziamento brevi da cellule di lievito. Per le letture single-end, Rustar-aligner ha prodotto lo stesso risultato di STAR nel 99,815% dei casi. Per le letture abbinate, il tasso di concordanza è stato del 99,883%. Il confronto si è esteso oltre le posizioni mappate per includere diversi altri campi chiave che entrambi i programmi producono per ciascuna lettura e nessuno dei due strumenti ha mappato alcuna lettura che l'altro non è riuscito a mappare.
Un aumento di 60 volte
RustQC ha apportato la maggiore accelerazione combinando 15 strumenti di controllo qualità separati in un unico programma. Su un set di dati di grandi dimensioni, l'autonomia è crollata da 15 ore e 34 minuti a soli 14 minuti e 54 secondi: un aumento di oltre 60 volte.Un altro progetto, HelixForge, ha sostituito uno strumento per la generazione di dati genomici sintetici con una versione accelerata da GPU. In un test utilizzando i dati di un donatore e una sezione del genoma di dieci milioni di coppie di basi, HelixForge ha completato l'intera pipeline 59,6 volte più velocemente dell'originale BamSurgeon, con la sola fase di calcolo principale eseguita 98,6 volte più velocemente.
In una modernizzazione più convenzionale, GPT-5.5 ha sostituito il processo di compilazione e installazione obsoleto di cyvcf2, una libreria Python per la lettura di dati genetici. La migrazione più complessa di MHCflurry ha visto Claude Code e Codex alternarsi tra i ruoli di sviluppatore e revisore durante il porting di circa 10.000 righe di codice da TensorFlow a PyTorch. MHCflurry è un modello immunologico che prevede quali bersagli riconosceranno le cellule immunitarie.
'Sicuramente sbagliato'
La scoperta principale, tuttavia, è stata deludente. Nei casi di studio, gli agenti hanno completato rapidamente compiti ben definiti ma non sono stati in grado di giudicare in modo affidabile se il loro lavoro fosse scientificamente corretto. Anche quando il loro codice conteneva errori, i sistemi spesso lo presentavano con piena fiducia.
Brent Pedersen, lo sviluppatore di cyvcf2, ha catturato la tensione nel rapporto: "Con gli agenti di codifica, è abbastanza facile andare veloci; per ora, per andare lontano nella scienza, c'è ancora bisogno di guida esperta, comprensione, gusto e cura."
Philip Ewels, che ha guidato il progetto RustQC, è stato schietto. Ha descritto gli agenti come "eloquenti, convincenti e sicuramente sbagliati in modi che sono facili da non notare". Ewels non ha mai permesso ai modelli di giudicare l'accuratezza del proprio lavoro, costruendo invece un sistema di prova indipendente per individuare i loro errori.
Errori nascosti in bella vista
Il caso di studio bayesm ha illustrato quanto possa essere difficile individuare questi errori. La sua riscrittura in Rust funzionava da due a venti volte più velocemente dell'originale, ma le prime versioni dei due metodi avanzati contenevano sottili difetti. In uno, l'agente ha invertito un parametro di controllo chiave, facendo sì che il programma utilizzasse il reciproco dei valori previsti. Un bug separato ha influito sul calcolo stesso. I ricercatori hanno scoperto entrambi i problemi solo dopo aver eseguito un test di calibrazione dettagliato su migliaia di set di dati sintetici con risultati noti.
L’episodio sottolinea un cambiamento strutturale nel modo in cui gli scienziati possono lavorare a fianco dell’intelligenza artificiale: invece di scrivere codice da soli, il loro compito centrale diventa verificare rigorosamente i risultati – un ruolo che richiede competenze approfondite che gli agenti stessi non possono fornire.
Cosa significa per la scienza
I risultati arrivano in un momento di intenso dibattito su quanta autonomia dovrebbero essere garantiti i sistemi di intelligenza artificiale nei settori ad alto rischio. Le accelerazioni sono davvero trasformative: una riduzione di 60 volte dell’autonomia può trasformare un lavoro notturno in una pausa caffè. Ma il contributo più importante del rapporto potrebbe essere la sua onestà riguardo ai limiti. Gli agenti che sono veloci, fluenti e persuasivi, ma incapaci di autovalutare la validità scientifica, sono uno strumento potente solo nelle mani di esperti che sanno esattamente cosa controllare.
Per i ricercatori coinvolti, la lezione è chiara: l’intelligenza artificiale può ricostruire l’impalcatura della scienza a una velocità notevole, ma il giudizio umano rimane determinante.
Stai al passo con l'intelligenza artificiale
Dai progressi della ricerca alle implementazioni aziendali, il ritmo del cambiamento è incessante. Aggiungi ai preferiti AI Buzz Wire per una copertura continua e verificata su come l'intelligenza artificiale sta rimodellando la scienza, il business e la società.
Leggi altre notizie sulla ricerca sull'intelligenza artificiale →