Un raport de teren de la OpenAI și colaboratori academici a constatat că agenții de codare AI pot accelera dramatic modernizarea software-ului științific vechi, rescriind instrumentele în limbi mai rapide și reducând timpii de execuție cu ordine de mărime. Captura: aceiași agenți nu pot judeca în mod fiabil dacă munca lor este corectă din punct de vedere științific, prezentând adesea codul cu erori cu deplină încredere.

Raportul, publicat la 1 august 2026 și documentat de The Decoder, a examinat opt ​​studii de caz – în principal în biologie – în care grupurile de cercetare au folosit agenți de codare precum Codex și Claude Code pentru a salva, optimiza și rescrie software-ul critic. Pentru raportarea continuă cu privire la instrumentele care remodelează știința și industria, urmăriți cele mai recente știri AI.

O criză liniștită în software-ul științific

O mare parte din software-ul care stă la baza cercetării moderne a început ca cod de sprijin pentru o singură lucrare. Echipele academice mici au creat aceste instrumente fără resursele necesare pentru testarea, întreținerea sau optimizarea corespunzătoare. Rezultatul este o fundație fragilă: programe care rămân critice pentru domenii întregi, dar necesită reparații constante. Raportul de teren OpenAI sugerează că agenții de codare AI ar putea ajuta la eliminarea acestui decalaj de lungă durată.

Proiectele au variat de la întreținere de rutină la rescrieri complete în limbaje de programare moderne și câteva au oferit câștiguri de performanță atrăgătoare.

Reconstruirea STAR în Rust

Unul dintre cele mai ambițioase proiecte, rustar-aligner, a reconstruit STAR de la zero în Rust. STAR este un instrument utilizat pe scară largă care mapează secvențierea citirilor de la celule la locațiile lor corespunzătoare dintr-un genom. Programul original conține mai mult de 20.000 de linii de C și C++ și nu mai este menținut activ, chiar dacă rămâne încorporat în multe conducte de cercetare.

Pentru a verifica rescrierea, echipa a testat ambele instrumente pe 10.000 de citiri scurte de secvențiere din celulele de drojdie. Pentru citirile cu un singur capăt, rustar-aligner a produs același rezultat ca STAR în 99,815 la sută din cazuri. Pentru citirile în pereche, rata acordului a fost de 99,883 la sută. Comparația s-a extins dincolo de locațiile mapate pentru a include câteva alte câmpuri cheie pe care ambele programe le produc pentru fiecare citire și niciunul dintre instrumente nu a mapat citirile pe care celălalt nu le-a mapat.

O accelerare de 60 de ori

RustQC a oferit cea mai mare accelerare prin combinarea a 15 instrumente separate de control al calității într-un singur program. Pe un set de date mare, timpul de rulare a scăzut de la 15 ore și 34 de minute la doar 14 minute și 54 de secunde - o accelerare de peste 60 de ori.

Un alt proiect, HelixForge, a înlocuit un instrument pentru generarea de date genomice sintetice cu o versiune accelerată de GPU. Într-un test care a folosit date de la un donator și o secțiune de zece milioane de perechi de baze a genomului, HelixForge a finalizat întreaga conductă de 59,6 ori mai rapid decât BamSurgeon original, doar pasul principal de calcul rulând de 98,6 ori mai rapid.

Într-o modernizare mai convențională, GPT-5.5 a înlocuit procesul de construire și instalare învechit al cyvcf2, o bibliotecă Python pentru citirea datelor genetice. Migrarea MHCflurry mai implicată a făcut ca Claude Code și Codex să alterneze între rolurile de dezvoltator și de recenzent, în timp ce portau aproximativ 10.000 de linii de cod de la TensorFlow la PyTorch. MHCflurry este un model de imunologie care prezice care ținte vor recunoaște celulele imune.

„În mod sigur greșit”

Descoperirea titlului, însă, a fost una care să dezvolte. Pe parcursul studiilor de caz, agenții au finalizat rapid sarcini bine definite, dar nu au putut judeca în mod fiabil dacă munca lor era corectă din punct de vedere științific. Chiar și atunci când codul lor conținea erori, sistemele îl prezentau adesea cu deplină încredere.

Brent Pedersen, dezvoltatorul cyvcf2, a captat tensiunea din raport: „Cu agenții de codare, este destul de ușor să mergi repede; deocamdată, pentru a ajunge departe în știință, este încă nevoie de îndrumări, înțelegere, gust și grijă de către experți.”

Philip Ewels, care a condus proiectul RustQC, a fost mai tare. El i-a descris pe agenți ca fiind „elocvenți, convingătoare și cu încredere greșite în moduri care sunt ușor de ratat”. Ewels nu le-a permis niciodată modelelor să judece acuratețea propriei lucrări, construind în schimb un ham de testare independent pentru a-și surprinde greșelile.

Erori ascunse la vedere

Studiul de caz bayesm a ilustrat cât de greu pot fi detectate aceste erori. Rescrierea lui Rust a rulat între două și douăzeci de ori mai rapid decât originalul, dar primele versiuni ale două metode avansate conțineau defecte subtile. Într-una, agentul a inversat un parametru de control cheie, determinând programul să folosească reciproca valorilor dorite. O eroare separată a afectat calculul în sine. Cercetătorii au descoperit ambele probleme doar după ce au efectuat un test de calibrare detaliat împotriva a mii de seturi de date sintetice cu rezultate cunoscute.

Episodul subliniază o schimbare structurală în modul în care oamenii de știință pot lucra alături de AI: în loc să scrie codul ei înșiși, sarcina lor centrală devine verificarea riguroasă a rezultatelor - un rol care necesită o expertiză profundă în domeniu pe care agenții înșiși nu o pot furniza.

Ce înseamnă pentru știință

Descoperirile ajung într-un moment de dezbatere intensă cu privire la cât de multă autonomie ar trebui acordată sistemelor AI în domeniile cu mize mari. Accelerările sunt cu adevărat transformatoare - o reducere de 60 de ori a timpului de rulare poate transforma o muncă peste noapte într-o pauză de cafea. Dar cea mai importantă contribuție a raportului poate fi sinceritatea cu privire la limite. Agenții care sunt rapizi, fluenți și persuasivi, dar incapabili să auto-evalueze validitatea științifică, sunt un instrument puternic doar în mâinile experților care știu exact ce să verifice.

Pentru cercetătorii implicați, lecția este clară: AI poate reconstrui schelele științei cu o viteză remarcabilă, dar judecata umană rămâne suportabilă.

Rămâi înaintea AI

De la descoperiri în cercetare până la implementări ale întreprinderilor, ritmul schimbării este neobosit. Marcați AI Buzz Wire pentru o acoperire continuă, verificată cu fapte, a modului în care inteligența artificială remodelează știința, afacerile și societatea.

Citiți mai multe știri despre cercetarea AI →