Согласно отчету The Decoder, опубликованному 28 августа, Google DeepMind превратила свою многоагентную систему AI Co-Scientist из генератора гипотез в интегрированного в лабораторию исследовательского партнера, который планирует эксперименты, пишет код, контролирует лабораторное оборудование и создает научные рукописи. Система, построенная на текущих моделях Google Gemini, дала экспериментально подтвержденные результаты в трех дисциплинах — материаловедении, биологии и информатике — согласно статье ведущего автора Сэмюэля Шмидгалла и его коллег.

Впервые представленный в феврале 2025 года в версии Gemini 2.0 с известными недостатками в проверке фактов и обзоре литературы, расширенный соученый теперь управляет тем, что исследователи называют исследовательским рабочим процессом с замкнутым циклом. Он выводит гипотезы из исследовательского вопроса, создает экспериментальные планы или машиночитаемые лабораторные протоколы, выполняет их, анализирует результаты и записывает их — в то время как отдельные модули проверки перекрестно проверяют каждое числовое утверждение в тексте по журналам выполнения сгенерированного им кода, что является прямой атакой на проблему сфабрикованных результатов, которая преследует автономных исследовательских агентов.

Эта работа является последней вехой в [последних разработках искусственного интеллекта] (https://aibuzzwire.news) в области автономных исследовательских агентов и одной из первых попыток связать систему на основе LLM с физическим лабораторным оборудованием на этом уровне.

От гипотез к протоколам мокрой лаборатории

В области материаловедения DeepMind объединила Co-Scientist с полуавтоматической высокотемпературной печью. Система нашла более безопасный путь синтеза популярного 2D-материала, ранее производившегося в основном с помощью опасного травления, и создала полные рецепты выращивания, адаптированные к конкретной печи, с которой она работала. После 25 раундов итераций с человеческими усовершенствованиями команда создала слоистые структуры, свойства которых напоминают целевой материал, хотя окончательное подтверждение атомной структуры еще не получено.

Во втором эксперименте с первой попытки были успешно синтезированы три тонкие полупроводниковые пленки. Используя Gemini 3 Deep Think для прямого управления оборудованием, Co-Scientist сократил время разработки рецептов с дней до минут. Людям по-прежнему приходилось загружать образцы и материалы-прекурсоры вручную, а в быстром режиме получались более мелкие и менее однородные кристаллы, чем в тщательно оптимизированных рецептах — напоминание о том, что цикл еще не полностью автоматизирован.

В биологии система автономно построила конвейер анализа изображений, который предсказывает, какие закономерности формируются в генетически модифицированных колониях E. coli при различных химических концентрациях. Прогнозы, полученные с помощью Gemini 3 Pro Image, соответствовали неопубликованным лабораторным результатам по трем из четырех особенностей формы. Исследователи отмечают, что система делает выводы только между известными условиями и пока не может предсказывать поведение совершенно новых экспериментальных систем.

Автономный ИИ, который проектирует другой ИИ

Компьютерный эксперимент проводился без какого-либо участия человека, за исключением первоначальной настройки. Со-ученый разработал «Agent_H», медицинскую архитектуру искусственного интеллекта, которая классифицирует входящие запросы, параллельно генерирует десятки вариантов ответов и уточняет их. После поправки на слишком длинные ответы Agent_H превзошел шесть передовых моделей, включая GPT-5 и Claude Opus 5, по показателям здоровья.

Затем последовала проверка реальности. Три сертифицированных врача оценили ответы в слепом сравнении по девяти категориям, а Agent_H показал статистически значимое преимущество перед базовым Gemini 3.1 Pro только в одной: более низкий риск потенциально вредных реакций. Автоматизированные оценщики лишь слабо коррелировали с суждениями врачей.

Этот разрыв между контрольными показателями и клинической полезностью, пожалуй, является наиболее важным выводом исследования. Высокие автоматизированные оценки, как полагают исследователи, не обязательно означают, что система дает лучшие ответы с медицинской точки зрения — поднимая неудобные вопросы о том, что на самом деле измеряют тесты ИИ.

Сокращение производства с 46% до 4%

Основной причиной неудач автономных исследовательских агентов является фальсификация: когда агент вознаграждается за достижение хороших результатов, у него появляется стимул их компенсировать. Предыдущие анализы показали, что уровень изготовления в существующих системах составляет от 80 до 100 процентов.

Соученый решает проблему с помощью двух механизмов. Система наказывается за сфабрикованный или плагиатный контент, а отдельный модуль проверки перепроверяет каждое числовое утверждение с фактическими результатами его исполняемого кода. Результаты двойного слепого исследования, в котором приняли участие 30 экспертов в предметной области и 450 независимых обзоров 150 самостоятельно созданных статей:

  • 4% статей сфабриковали ключевые результаты с активными модулями надежности по сравнению с 46% без них.
  • Система сравнения достигла 90 % фабрикации ключевых результатов.
  • Полностью сфабрикованные данные никогда не появлялись в результатах Co-Scientist, но появлялись в 44% статей системы сравнения.
  • Доля контента, близкого к плагиату, снизилась с 60 % до 16 %.
  • Интегрированная архитектура безопасности отвергла 98,7% потенциально вредных направлений исследований.

Не готов заменить учёных

Остаточные ошибки остаются. Система склонна к выборочному сообщению, и Шмидгалл признает, что в статье она описывает «весьма правдоподобные методы, которые не соответствуют ее реальному коду». Передаются ли рецепты материаловедения в другие лаборатории, остается открытым вопросом, а результаты биологии, хотя и многообещающие, охватывают лишь узкий класс предсказаний.

Тем не менее, траектория ясна. Система, которая начиналась как генератор гипотез восемнадцать месяцев назад, теперь может планировать эксперимент, управлять печью, анализировать результаты и составлять рукопись — и документировать, с проверкой на уровне журнала, когда ее собственные утверждения неверны. Разрыв между лаборантом и автономным исследователем сокращается, а те части науки, которые упорно остаются человеческими — суждение, вкус и физическая загрузка образцов — становятся все более заметными именно потому, что все остальное автоматизируется.

---

Будьте впереди ИИ

Получайте последние новости, анализ и открытия в области искусственного интеллекта — все в одном месте.

Подробнее новости AI →