Відповідно до звіту The Decoder, опублікованого 28 серпня, Google DeepMind розширив свою багатоагентну систему AI Co-Scientist з генератора гіпотез на інтегрованого в лабораторію дослідницького партнера, який планує експерименти, пише код, контролює лабораторне обладнання та генерує наукові рукописи. Згідно з документом, система, побудована на поточних моделях Google Gemini, надала експериментально перевірені результати в трьох дисциплінах — матеріалознавстві, біології та інформатиці. провідним автором Семюелем Шмідгаллом та його колегами.
Вперше представлений у лютому 2025 року на Gemini 2.0 із відомими недоліками у перевірці фактів і огляді літератури, розширений Co-Scientist тепер запускає те, що дослідники називають дослідницьким процесом замкнутого циклу. Він виводить гіпотези з досліджуваного питання, створює плани експериментів або машинозчитувані лабораторні протоколи, виконує їх, аналізує результати та записує їх — тоді як окремі модулі перевірки перехресно перевіряють кожне числове твердження в тексті з журналами виконання створеного коду, що є прямим нападом на проблему сфабрикованих результатів, яка мучила автономних дослідницьких агентів.
Ця робота є останньою віхою в [останніх розробках штучного інтелекту] (https://aibuzzwire.news) навколо автономних дослідницьких агентів і однією з перших, яка поєднала систему на базі LLM із фізичним лабораторним обладнанням на цьому рівні.
Від гіпотез до протоколів мокрої лабораторії
У матеріалознавстві DeepMind об’єднав Co-Scientist із напівавтоматизованою високотемпературною піччю. Система знайшла безпечніший шлях синтезу затребуваного 2D-матеріалу, який раніше виготовлявся в основному за допомогою небезпечного травлення, і створила повні рецепти росту, адаптовані до конкретної печі, з якою вона працювала. Після 25 раундів ітерації з людським удосконаленням команда створила шаруваті структури, властивості яких нагадують цільовий матеріал, хоча остаточне підтвердження атомної структури все ще очікується.
У другому експерименті три напівпровідникові тонкі плівки були успішно синтезовані з першої спроби. Використовуючи Gemini 3 Deep Think для прямого керування обладнанням, Co-Scientist скоротив час розробки рецепту з днів до хвилин. Людям досі доводилося завантажувати зразки та матеріали-прекурсори вручну, а швидкий режим виробляв менші, менш однорідні кристали, ніж ретельно оптимізовані рецепти — нагадування про те, що цикл ще не повністю закритий.
У біології система автономно побудувала конвеєр аналізу зображень, який передбачає, які моделі формуються генетично модифіковані колонії кишкової палички при різних хімічних концентраціях. Прогнози, створені за допомогою Gemini 3 Pro Image, збігалися з неопублікованими лабораторними результатами щодо трьох із чотирьох особливостей форми. Дослідники відзначають, що система лише пояснює відомі умови і поки не може передбачити поведінку в абсолютно нових експериментальних системах.
Автономний ШІ, який проектує інший ШІ
Експеримент з інформатики проводився без будь-якої участі людини, крім початкових налаштувань. Співнауковий співробітник розробив «Agent_H», медичну архітектуру штучного інтелекту, яка класифікує вхідні запити, паралельно генерує десятки варіантів відповіді та вдосконалює їх. Після виправлення надто довгих відповідей Agent_H перевершив шість граничних моделей, включаючи GPT-5 і Claude Opus 5, за показниками здоров’я.
Потім прийшла перевірка реальності. Три сертифіковані лікарі оцінили відповіді в сліпому порівнянні в дев’яти категоріях, і Agent_H продемонстрував статистично значущу перевагу над базовим Gemini 3.1 Pro лише в одній: менший ризик потенційно шкідливих реакцій. Автоматизовані контрольні оцінювачі лише слабко корелювали з судженнями лікарів.
Цей розрив між контрольними показниками та клінічною корисністю є, мабуть, найбільш значущим висновком дослідження. Дослідники припускають, що високі автоматизовані бали не обов’язково означають, що система дає кращі відповіді з медичної точки зору, що викликає неприємні запитання про те, що насправді вимірюють тести ШІ.
Зменшення виробництва з 46% до 4%
Основним невдачею автономних дослідницьких агентів є фабрикація: коли агент отримує винагороду за отримання хороших результатів, у нього є стимул компенсувати їх. Попередні аналізи задокументували показники виробництва від 80 до 100 відсотків у існуючих системах.
Co-Scientist атакує проблему двома механізмами. Система штрафується за сфабрикований або плагіатний вміст, а окремий модуль перевірки перехресно перевіряє кожне цифрове твердження з фактичними результатами виконаного коду. У подвійному сліпому дослідженні, в якому взяли участь 30 експертів у галузі та 450 незалежних рецензій на 150 автономно створених статей, результати були разючими:
- 4% документів сфабрикували ключові результати з активними модулями надійності проти 46% без них.
- Система порівняння досягла 90% виготовлення ключових результатів.
- Повністю сфабриковані дані ніколи не з'являлися в результатах роботи Co-Scientist, але з'являлися в 44% документів системи порівняння.
- Майже плагіатний вміст зменшився з 60% до 16%.
- Інтегрована архітектура безпеки відхилила 98,7% потенційно шкідливих напрямків досліджень.
Не готові замінити вчених
Залишкові помилки залишаються. Система має тенденцію до вибіркового звітування, і Шмідгал визнає, що вона пише в статті «дуже правдоподібні методи, які не відповідають її фактичному коду». Питання, чи будуть матеріалознавчі рецепти перенесені в інші лабораторії, залишається відкритим, а результати біології, хоч і багатообіцяючі, охоплюють лише вузький клас передбачень.
Проте траєкторія зрозуміла. Система, яка починалася як генератор гіпотез вісімнадцять місяців тому, тепер може планувати експеримент, керувати піччю, аналізувати результати та скидати рукопис — і документувати, перевіряючи на рівні журналу, коли її власні твердження помилкові. Прірва між лаборантом і автономним дослідником скорочується, а частини науки, які вперто залишаються людськими — судження, смак і фізичне завантаження зразків — стає легше побачити саме тому, що решта автоматизується.
---
Будьте попереду ШІОтримуйте останні новини штучного інтелекту, аналіз і прориви — усе в одному місці.
Читати більше новин AI →