Google DeepMind și-a extins sistemul multi-agent AI Co-Scientist dintr-un generator de ipoteze într-un partener de cercetare integrat în laborator care planifică experimente, scrie cod, controlează echipamente de laborator și generează manuscrise științifice, potrivit unui raport al The Decoder publicat pe 28 august. Schmidgall și colegii.
Introdus pentru prima dată în februarie 2025 pe Gemini 2.0 cu deficiențe cunoscute în verificarea faptelor și revizuirea literaturii, Co-Scientist extins gestionează acum ceea ce cercetătorii numesc un flux de lucru de cercetare în buclă închisă. Derive ipoteze dintr-o întrebare de cercetare, creează planuri experimentale sau protocoale de laborator care pot fi citite de mașină, le execută, analizează rezultatele și le scrie - în timp ce modulele de verificare separate verifică fiecare afirmație numerică din text cu jurnalele de execuție ale codului pe care l-a generat, un atac direct asupra problemei rezultatelor fabricate care a afectat agenții de cercetare autonomi.
Lucrarea este cea mai recentă piatră de hotar în cele mai recente dezvoltări AI în jurul agenților de cercetare autonomi și unul dintre primii care cuplează un sistem bazat pe LLM la hardware-ul de laborator fizic la acest nivel.
De la ipoteze la protocoale de laborator umed
În știința materialelor, DeepMind a asociat Co-Scientist cu un cuptor semi-automat de temperatură înaltă. Sistemul a găsit o cale de sinteză mai sigură pentru un material 2D căutat, produs anterior în principal prin gravare periculoasă și a generat rețete complete de creștere adaptate cuptorului specific cu care lucra. După 25 de runde de iterație cu rafinament uman, echipa a produs structuri stratificate ale căror proprietăți seamănă cu materialul țintă - deși confirmarea definitivă a structurii atomice este încă în așteptare.
Într-un al doilea experiment, trei pelicule subțiri semiconductoare au fost sintetizate cu succes la prima încercare. Folosind Gemini 3 Deep Think pentru controlul direct al echipamentului, Co-Scientist a redus timpul de dezvoltare a rețetei de la zile la minute. Oamenii au fost încă nevoiți să încarce manual mostre și materiale precursoare, iar modul rapid a produs cristale mai mici și mai puțin uniforme decât rețetele optimizate cu atenție - o reamintire că bucla nu este încă complet operațională.
În biologie, sistemul a construit în mod autonom o conductă de analiză a imaginilor care prezice ce modele se formează coloniile de E. coli modificate genetic la diferite concentrații chimice. Predicțiile generate cu Gemini 3 Pro Image au comparat rezultate de laborator nepublicate pentru trei din cele patru caracteristici de formă. Cercetătorii notează că sistemul are doar motive între condițiile cunoscute și nu poate încă prezice comportamentul în sisteme experimentale complet noi.
Un AI autonom care proiectează un alt AI
Experimentul informatic a derulat fără nicio implicare umană dincolo de configurarea inițială. Co-Scientist a proiectat „Agent_H”, o arhitectură medicală AI care clasifică interogările primite, generează zeci de candidați de răspuns în paralel și le rafinează. După ce a corectat răspunsurile prea lungi, Agent_H a depășit șase modele de frontieră, inclusiv GPT-5 și Claude Opus 5, la standardele de sănătate.
Apoi a venit verificarea realității. Trei medici certificați de consiliu au punctat răspunsurile într-o comparație oarbă în nouă categorii, iar Agent_H a arătat un avantaj statistic semnificativ față de versiunea de bază Gemini 3.1 Pro în doar una: un risc mai mic de răspunsuri potențial dăunătoare. Evaluatorii automati de referință au corelat doar slab cu judecățile medicilor.
Acest decalaj dintre scorurile de referință și utilitatea clinică este, fără îndoială, cea mai importantă constatare a studiului. Scorurile automate ridicate, sugerează cercetătorii, nu înseamnă neapărat că un sistem oferă răspunsuri mai bune din perspectivă medicală - ridicând întrebări inconfortabile despre ceea ce măsoară de fapt criteriile AI.
Tăierea fabricării de la 46% la 4%
Modul de eșec de bază al agenților autonomi de cercetare este fabricația: atunci când un agent este recompensat pentru a produce rezultate bune, are un stimulent să le inventeze. Analizele anterioare au documentat rate de fabricație de 80 până la 100 la sută în sistemele existente.
Co-Scientist atacă problema cu două mecanisme. Sistemul este penalizat pentru conținutul fabricat sau plagiat, iar un modul de verificare separat verifică fiecare revendicare numerică cu rezultatele reale ale codului său executat. Într-un studiu dublu-orb care a implicat 30 de experți în domeniu și 450 de recenzii independente a 150 de lucrări generate autonom, rezultatele au fost severe:
- 4% dintre lucrări au fabricat rezultate cheie cu module de fiabilitate active, față de 46% fără acestea.
- Sistemul de comparație a atins 90% fabricarea rezultatelor cheie.
- Datele complet fabricate nu au apărut niciodată în rezultatele lui Co-Scientist, dar au apărut în 44% din lucrările sistemului de comparație.
- Conținutul aproape plagiat a scăzut de la 60% la 16%.
- O arhitectură de siguranță integrată a respins 98,7% din direcțiile de cercetare potențial dăunătoare.
Nu sunt gata să înlocuiască oamenii de știință
Erorile reziduale rămân. Sistemul tinde spre raportare selectivă, iar Schmidgall recunoaște că scrie „metode foarte plauzibile în lucrare care nu se potriveau cu codul său real”. Dacă rețetele din știința materialelor se transferă în alte laboratoare este o întrebare deschisă, iar rezultatele biologiei, deși promițătoare, au acoperit doar o clasă restrânsă de predicții.
Totuși, traiectoria este clară. Un sistem care a început ca generator de ipoteze în urmă cu optsprezece luni poate acum să planifice un experiment, să opereze un cuptor, să analizeze rezultatul și să redacteze un manuscris - și să documenteze, cu verificare la nivel de jurnal, atunci când propriile afirmații sunt greșite. Diferența dintre asistentul de laborator și cercetătorul autonom se micșorează, iar părțile științei care rămân încăpățânat de umane - judecata, gustul și încărcarea fizică a probelor - devin din ce în ce mai ușor de văzut tocmai pentru că restul este automatizat.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →