Laporan lapangan saka OpenAI lan kolaborator akademisi nemokake manawa agen kodhe AI ​​bisa nyepetake modernisasi piranti lunak ilmiah sing wis tuwa, alat nulis maneh ing basa sing luwih cepet lan nyuda runtime kanthi urutan gedhene. Sing nyekel: agen sing padha ora bisa ngadili kanthi dipercaya manawa karyane bener kanthi ilmiah, asring menehi kode buggy kanthi yakin.

Laporan kasebut, diterbitake tanggal 1 Agustus 2026 lan didokumentasikake dening The Decoder, nliti wolung studi kasus - biasane ing biologi - ing ngendi klompok riset nggunakake agen coding kayata Codex lan Claude Code kanggo ngluwari, ngoptimalake, lan nulis ulang piranti lunak kritis. Kanggo laporan sing terus-terusan babagan alat sing nggawe maneh ilmu lan industri, tindakake [kabar AI paling anyar] (https://aibuzzwire.news).

Krisis Sepi ing Piranti Lunak Ilmiah

Akeh piranti lunak sing ndhukung riset modern diwiwiti minangka kode pendukung kanggo siji kertas. Tim akademisi cilik nggawe alat kasebut tanpa sumber daya kanggo tes, pangopènan, utawa optimalisasi sing tepat. Asil kasebut minangka dhasar sing rapuh: program sing tetep kritis kanggo kabeh lapangan nanging mbutuhake perbaikan terus-terusan. Laporan lapangan OpenAI nyaranake agen coding AI bisa mbantu nutup celah sing wis suwe.

Proyèk kasebut wiwit saka pangopènan rutin nganti nulis ulang lengkap ing basa pamrograman modern, lan sawetara asil kinerja sing apik banget.

Mbangun STAR ing Rust

Salah sawijining proyek sing luwih ambisi, rustar-aligner , dibangun maneh STAR wiwit awal ing Rust. STAR minangka alat sing akeh digunakake kanggo peta urutan maca saka sel menyang lokasi sing cocog ing genom. Program asli ngandhut luwih saka 20.000 baris C lan C ++ lan ora aktif maintained, sanajan iku tetep ditempelake ing akeh pipelines riset.

Kanggo verifikasi nulis ulang, tim nguji loro alat kasebut ing 10,000 maca urutan singkat saka sel ragi. Kanggo maca siji-mburi, rustar-aligner ngasilake asil sing padha karo STAR ing 99,815 persen kasus. Kanggo maca sing dipasangake, tingkat persetujuan yaiku 99,883 persen. Perbandingan kasebut ngluwihi lokasi sing dipetakan kanggo nyakup sawetara kolom kunci liyane sing diprodhuksi dening program kasebut kanggo saben maca, lan ora ana alat sing bisa dipetakan sing diwaca sing gagal dipetakan.

A Speedup 60-Lipat

RustQC ngirimake kacepetan paling gedhe kanthi nggabungake 15 alat kontrol kualitas sing kapisah dadi siji program. Ing set data gedhe, runtime mudhun saka 15 jam lan 34 menit dadi mung 14 menit lan 54 detik - kacepetan luwih saka 60 kaping.

Proyèk liya, HelixForge , ngganti alat kanggo ngasilake data genomik sintetik kanthi versi akselerasi GPU. Ing tes nggunakake data saka siji donor lan bagean sepuluh yuta basa pasangan genome, HelixForge ngrampungake pipa lengkap 59,6 kaping luwih cepet tinimbang BamSurgeon asli, kanthi langkah komputasi utama mlaku 98,6 kaping luwih cepet.

Ing modernisasi liyane conventional, GPT-5.5 diganti kuna mbangun lan proses instalasi saka cyvcf2 , perpustakaan Python kanggo maca data genetik. Migrasi MHCflurry sing luwih akeh ndeleng Claude Code lan Codex gantian antarane peran pangembang lan reviewer nalika ngirimake kira-kira 10.000 baris kode saka TensorFlow menyang PyTorch. MHCflurry minangka model imunologi sing prédhiksi target sel kekebalan sing bakal diakoni.

'Salah Percoyo'

Temuan judhul, Nanging, ana sing sobering. Ing studi kasus, agen ngrampungake tugas sing wis ditemtokake kanthi cepet nanging ora bisa dipercaya manawa karyane bener kanthi ilmiah. Sanajan kode kasebut ana kesalahan, sistem kasebut asring nampilake kanthi yakin.

Brent Pedersen, pangembang cyvcf2, nangkep ketegangan ing laporan kasebut: "Kanthi agen pengkodean, cukup gampang kanggo pindhah kanthi cepet; kanggo saiki, kanggo pindhah adoh ing ilmu, isih perlu bimbingan pakar, pangerten, rasa, lan perawatan."

Philip Ewels, sing mimpin proyek RustQC, blunter. Dheweke nggambarake agen kasebut minangka "loquent, mestekake, lan kanthi yakin salah kanthi cara sing gampang dilalekake." Ewels ora nate ngidini model kasebut ngadili akurasi karyane dhewe, nanging nggawe alat tes mandiri kanggo nyekel kesalahane.

Kasalahan ndhelikake ing Plain Sight

Pasinaon kasus bayesm nggambarake sepira angel kesalahan kasebut bisa ditindakake. Penulisan ulang Rust mlaku antarane rong nganti rong puluh kaping luwih cepet tinimbang asline, nanging versi pisanan saka rong cara canggih ngemot cacat subtle. Ing siji, agen ngowahi parameter kontrol tombol, nyebabake program kasebut nggunakake timbal balik saka nilai sing dituju. A bug kapisah kena pengaruh pitungan dhewe. Peneliti mung nemokake masalah kasebut sawise nglakokake tes kalibrasi sing rinci nglawan ewonan set data sintetik kanthi asil sing dingerteni.

Episode kasebut negesake owah-owahan struktural babagan cara para ilmuwan bisa kerja bareng karo AI: tinimbang nulis kode dhewe, tugas utama dadi verifikasi asil kanthi teliti - peran sing nuntut keahlian domain jero sing ora bisa diwenehake dening agen kasebut.

Apa Tegese kanggo Ilmu

Temuan kasebut tiba ing wayahe debat sing kuat babagan kepiye sistem AI otonomi sing kudu diwenehake ing domain taruhan dhuwur. Speedups bener-bener transformatif - pangurangan 60 kali lipat ing runtime bisa ngowahi proyek sewengi dadi istirahat kopi. Nanging kontribusi paling penting laporan bisa uga kejujuran babagan watesan. Agen sing cepet, lancar, lan persuasif, nanging ora bisa ngevaluasi validitas ilmiah, minangka alat sing kuat mung ing tangan para ahli sing ngerti persis apa sing kudu dipriksa.

Kanggo peneliti sing melu, piwulang kasebut jelas: AI bisa mbangun maneh scaffolding ilmu pengetahuan kanthi kecepatan sing luar biasa, nanging pangadilan manungsa tetep tanggung jawab.

Tetep Ahead saka AI

Saka terobosan riset nganti panyebaran perusahaan, owah-owahan ora mandheg. Tetenger AI Buzz Wire kanggo liputan sing dipriksa fakta babagan carane intelijen buatan mbentuk maneh ilmu, bisnis, lan masyarakat.

Waca liyane warta riset AI →