Google DeepMind telah memperluaskan sistem AI Co-Scientist berbilang ejennya daripada penjana hipotesis menjadi rakan penyelidikan bersepadu makmal yang merancang eksperimen, menulis kod, mengawal peralatan makmal dan menjana manuskrip saintifik, menurut laporan oleh The Decoder yang diterbitkan pada 28 Ogos. Sistem itu, yang dibina pada model semasa Google, telah menyampaikan hasil yang disahkan secara eksperimen dan sains komputer, menurut pengarang sains komputer, mengikut tiga disiplin sains komputer, mengikut Samuel. Schmidgall dan rakan sekerja.

Pertama kali diperkenalkan pada Februari 2025 pada Gemini 2.0 dengan kelemahan yang diketahui dalam semakan fakta dan kajian literatur, Co-Scientist yang diperluaskan kini menjalankan apa yang penyelidik panggil aliran kerja penyelidikan gelung tertutup. Ia memperoleh hipotesis daripada soalan penyelidikan, mencipta rancangan percubaan atau protokol makmal yang boleh dibaca mesin, melaksanakannya, menganalisis keputusan dan menulisnya — manakala modul pengesahan berasingan menyemak silang setiap tuntutan berangka dalam teks terhadap log pelaksanaan kod yang dijananya, serangan langsung terhadap masalah hasil rekaan yang telah melanda ejen penyelidikan autonomi.

Kerja ini merupakan pencapaian terbaharu dalam perkembangan AI terkini di sekitar ejen penyelidikan autonomi, dan salah satu yang pertama menggabungkan sistem berasaskan LLM dengan perkakasan makmal fizikal pada tahap ini.

Daripada hipotesis kepada protokol makmal basah

Dalam sains bahan, DeepMind menggandingkan Co-Scientist dengan relau suhu tinggi separa automatik. Sistem ini menemui laluan sintesis yang lebih selamat untuk bahan 2D yang dicari yang sebelum ini dihasilkan terutamanya melalui goresan berbahaya, dan menghasilkan resipi pertumbuhan lengkap yang disesuaikan dengan relau khusus yang berfungsi dengannya. Selepas 25 pusingan lelaran dengan penghalusan manusia, pasukan menghasilkan struktur berlapis yang sifatnya menyerupai bahan sasaran — walaupun pengesahan muktamad struktur atom masih belum selesai.

Dalam percubaan kedua, tiga filem nipis semikonduktor berjaya disintesis pada percubaan pertama. Menggunakan Gemini 3 Deep Think untuk kawalan peralatan langsung, Co-Scientist memotong masa pembangunan resipi dari hari ke minit. Manusia masih perlu memuatkan sampel dan bahan prekursor secara manual, dan mod pantas menghasilkan kristal yang lebih kecil dan kurang seragam daripada resipi yang dioptimumkan dengan teliti — peringatan bahawa gelung itu belum dilepaskan sepenuhnya.

Dalam biologi, sistem secara autonomi membina saluran paip analisis imej yang meramalkan corak kejuruteraan genetik koloni E. coli terbentuk pada kepekatan kimia yang berbeza. Ramalan yang dijana dengan Imej Gemini 3 Pro memadankan hasil makmal yang tidak diterbitkan pada tiga daripada empat ciri bentuk. Para penyelidik mencatatkan sistem hanya sebab antara keadaan yang diketahui dan belum dapat meramalkan tingkah laku dalam sistem eksperimen yang sama sekali baru.

AI autonomi yang mereka bentuk AI lain

Percubaan sains komputer berjalan tanpa penglibatan manusia melebihi persediaan awal. Co-Scientist mereka bentuk "Agent_H," seni bina AI perubatan yang mengklasifikasikan pertanyaan masuk, menjana berpuluh-puluh calon respons secara selari dan memperhalusinya. Selepas membetulkan respons yang terlalu panjang, Agent_H mengatasi enam model sempadan — termasuk GPT-5 dan Claude Opus 5 — pada penanda aras kesihatan.

Kemudian datang pemeriksaan realiti. Tiga pakar perubatan yang diperakui oleh lembaga mencatatkan respons dalam perbandingan buta merentas sembilan kategori, dan Agent_H menunjukkan kelebihan ketara secara statistik berbanding garis dasar Gemini 3.1 Pro dalam hanya satu: risiko tindak balas yang berpotensi berbahaya yang lebih rendah. Penilai penanda aras automatik hanya berkorelasi lemah dengan pertimbangan doktor.

Jurang antara markah penanda aras dan kegunaan klinikal boleh dikatakan penemuan paling penting dalam kajian itu. Markah automatik yang tinggi, kata para penyelidik, tidak semestinya bermakna sistem memberikan jawapan yang lebih baik dari perspektif perubatan — menimbulkan persoalan yang tidak selesa tentang apa yang sebenarnya diukur oleh penanda aras AI.

Memotong fabrikasi daripada 46% kepada 4%

Mod kegagalan teras ejen penyelidikan autonomi ialah fabrikasi: apabila ejen diberi ganjaran untuk menghasilkan keputusan yang baik, ia mempunyai insentif untuk membuat keputusan itu. Analisis sebelumnya mendokumenkan kadar fabrikasi 80 hingga 100 peratus dalam sistem sedia ada.

Co-Scientist menyerang masalah dengan dua mekanisme. Sistem ini dihukum kerana kandungan yang direka atau diciplak, dan modul pengesahan berasingan menyemak silang setiap tuntutan berangka terhadap keputusan sebenar kod yang dilaksanakannya. Dalam kajian dua buta yang melibatkan 30 pakar domain dan 450 ulasan bebas terhadap 150 kertas yang dijana secara autonomi, keputusannya adalah nyata:

  • 4% kertas hasil rekaan utama dengan modul kebolehpercayaan aktif, berbanding 46% tanpanya.
  • Sistem perbandingan mencapai 90% fabrikasi keputusan kunci.
  • Data rekaan sepenuhnya tidak pernah muncul dalam keluaran Co-Scientist, tetapi muncul dalam 44% kertas sistem perbandingan.
  • Kandungan hampir diciplak menurun daripada 60% kepada 16%.
  • Seni bina keselamatan bersepadu menolak 98.7% arahan penyelidikan yang berpotensi berbahaya.

Tidak bersedia untuk menggantikan saintis

Kesilapan baki kekal. Sistem ini cenderung ke arah pelaporan terpilih, dan Schmidgall mengakui ia menulis "kaedah yang sangat munasabah dalam kertas yang tidak sepadan dengan kod sebenar." Sama ada resipi sains bahan dipindahkan ke makmal lain adalah persoalan terbuka, dan keputusan biologi, walaupun menjanjikan, merangkumi hanya kelas ramalan yang sempit.

Namun, trajektorinya jelas. Sistem yang bermula sebagai penjana hipotesis lapan belas bulan yang lalu kini boleh merancang percubaan, mengendalikan relau, menganalisis output dan mendraf manuskrip — dan mendokumenkan, dengan pengesahan peringkat log, apabila tuntutannya sendiri salah. Jurang antara pembantu makmal dan penyelidik autonomi semakin mengecil, dan bahagian sains yang kekal sebagai manusia berdegil — pertimbangan, rasa dan pemuatan sampel fizikal — menjadi lebih mudah untuk dilihat dengan tepat kerana selebihnya sedang diautomasikan.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →