Google DeepMind rozšířil svůj multiagentní systém AI Co-Scientist z generátoru hypotéz na výzkumného partnera integrovaného do laboratoře, který plánuje experimenty, píše kód, řídí laboratorní vybavení a generuje vědecké rukopisy, podle zprávy The Decoder zveřejněné 28. srpna. Systém, postavený na současných modelech Gemini od Googlu, přinesl experimentálně ověřené výsledky od vedoucího vědeckého výzkumu Samuela ve třech vědních disciplínách a materiálech. Schmidgall a kolegové.

Rozšířený Co-Scientist, který byl poprvé představen v únoru 2025 na Gemini 2.0 se známými slabinami v ověřování faktů a revizi literatury, nyní provozuje to, co výzkumníci nazývají výzkumný pracovní postup s uzavřenou smyčkou. Odvozuje hypotézy z výzkumné otázky, vytváří experimentální plány nebo strojově čitelné laboratorní protokoly, provádí je, analyzuje výsledky a zapisuje je – zatímco samostatné ověřovací moduly křížově kontrolují každý numerický nárok v textu s protokoly provádění kódu, který vygeneroval, což je přímý útok na problém s umělými výsledky, který sužoval autonomní výzkumné agenty.

Tato práce je posledním milníkem v nejnovějším vývoji AI v oblasti autonomních výzkumných agentů a je jednou z prvních, která na této úrovni propojila systém založený na LLM s fyzickým laboratorním hardwarem.

Od hypotéz k protokolům mokré laboratoře

Ve vědě o materiálech DeepMind spároval Co-Scientist s poloautomatickou vysokoteplotní pecí. Systém nalezl bezpečnější cestu syntézy pro vyhledávaný 2D materiál, který se dříve vyráběl především nebezpečným leptáním, a vytvořil kompletní receptury růstu přizpůsobené konkrétní peci, se kterou pracoval. Po 25 kolech iterací s lidským zdokonalováním tým vytvořil vrstvené struktury, jejichž vlastnosti se podobají cílovému materiálu – i když definitivní potvrzení atomové struktury stále čeká.

Ve druhém experimentu byly na první pokus úspěšně syntetizovány tři polovodičové tenké vrstvy. Pomocí Gemini 3 Deep Think pro přímé ovládání zařízení zkrátil Co-Scientist dobu vývoje receptury ze dnů na minuty. Lidé stále museli načítat vzorky a prekurzorové materiály ručně a rychlý režim produkoval menší, méně rovnoměrné krystaly než pečlivě optimalizované receptury – což je připomínka, že smyčka ještě není plně uzavřena.

V biologii systém autonomně vybudoval potrubí pro analýzu obrazu, které předpovídá, jaké vzory se tvoří geneticky upravené kolonie E. coli při různých chemických koncentracích. Předpovědi generované pomocí Gemini 3 Pro Image odpovídaly nepublikovaným laboratorním výsledkům u tří ze čtyř tvarových prvků. Výzkumníci zaznamenali, že systém má pouze důvody mezi známými podmínkami a zatím nemohou předvídat chování ve zcela nových experimentálních systémech.

Autonomní AI, která navrhuje další AI

Počítačový experiment probíhal bez jakéhokoli lidského zapojení po počátečním nastavení. Co-Scientist navrhl „Agent_H“, lékařskou architekturu umělé inteligence, která klasifikuje příchozí dotazy, paralelně generuje desítky kandidátů na odpovědi a zpřesňuje je. Po korekci na příliš dlouhé odezvy Agent_H překonal šest hraničních modelů – včetně GPT-5 a Claude Opus 5 – ve zdravotních měřítcích.

Pak přišla kontrola reality. Tři atestovaní lékaři zaznamenali odpovědi v zaslepeném srovnání v devíti kategoriích a Agent_H prokázal statisticky významnou výhodu oproti základnímu Gemini 3.1 Pro pouze v jedné: nižší riziko potenciálně škodlivých odpovědí. Automatizovaní hodnotitelé benchmarků korelovali s úsudky lékařů jen slabě.

Tento rozdíl mezi srovnávacími výsledky a klinickou užitečností je pravděpodobně nejdůslednějším zjištěním studie. Výzkumníci naznačují, že vysoké automatizované skóre nemusí nutně znamenat, že systém poskytuje lepší odpovědi z lékařského hlediska – vyvolává nepříjemné otázky o tom, co měřítka AI skutečně měří.

Snížení výroby ze 46 % na 4 %

Hlavním způsobem selhání autonomních výzkumných agentů je fabrikace: když je agent odměněn za dosažení dobrých výsledků, má motivaci je vymyslet. Předchozí analýzy dokumentovaly míru výroby 80 až 100 procent ve stávajících systémech.

Co-Scientist útočí na problém dvěma mechanismy. Systém je penalizován za vymyšlený nebo plagiátový obsah a samostatný ověřovací modul křížově kontroluje každý číselný nárok proti skutečným výsledkům jeho provedeného kódu. Ve dvojitě zaslepené studii zahrnující 30 oborových expertů a 450 nezávislých recenzí 150 autonomně generovaných článků byly výsledky kruté:

  • 4 % papírů vytvořilo klíčové výsledky s aktivními moduly spolehlivosti oproti 46 % bez nich.
  • Porovnávací systém dosáhl 90 % výroby klíčových výsledků.
  • Kompletně smyšlená data se nikdy neobjevila ve výstupu Co-Scientist, ale objevila se v 44 % dokumentů srovnávacího systému.
  • Téměř plagiovaný obsah klesl z 60 % na 16 %.
  • Integrovaná bezpečnostní architektura odmítla 98,7 % potenciálně škodlivých směrů výzkumu.

Nejsme připraveni nahradit vědce

Zbývající chyby zůstávají. Systém inklinuje k selektivnímu hlášení a Schmidgall uznává, že píše „vysoce věrohodné metody v novinách, které neodpovídají jeho skutečnému kódu“. Zda se receptury vědy o materiálech přenesou do jiných laboratoří, je otevřenou otázkou a biologické výsledky, i když jsou slibné, pokrývají pouze úzkou třídu předpovědí.

Přesto je trajektorie jasná. Systém, který před osmnácti měsíci začal jako generátor hypotéz, nyní dokáže naplánovat experiment, provozovat pec, analyzovat výstup a navrhnout rukopis – a dokumentovat s ověřením na úrovni logu, když jsou jeho vlastní tvrzení nesprávná. Propast mezi laboratorním asistentem a autonomním výzkumníkem se zmenšuje a části vědy, které zůstávají tvrdošíjně lidské – úsudek, chuť a fyzické nakládání vzorků – jsou stále lépe vidět právě proto, že zbytek je automatizován.

---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →