8월 28일 발표된 The Decoder의 보고서에 따르면 Google DeepMind는 다중 에이전트 AI Co-Scientist 시스템을 가설 생성기에서 실험을 계획하고, 코드를 작성하고, 실험실 장비를 제어하고, 과학 원고를 생성하는 실험실 통합 연구 파트너로 확장했습니다. 주저자 Samuel Schmidgall과 동료의 논문에 따르면 Google의 최신 Gemini 모델을 기반으로 구축된 이 시스템은 재료 과학, 생물학, 컴퓨터 과학의 세 가지 분야에서 실험적으로 검증된 결과를 제공했습니다.

사실 확인 및 문헌 검토의 알려진 약점과 함께 2025년 2월 Gemini 2.0에 처음 도입된 확장된 Co-Scientist는 이제 연구자들이 폐쇄 루프 연구 워크플로우라고 부르는 것을 실행합니다. 연구 질문에서 가설을 도출하고, 실험 계획이나 기계 판독 가능한 실험실 프로토콜을 생성하고, 이를 실행하고, 결과를 분석하고 기록합니다. 반면 별도의 검증 모듈은 생성된 코드의 실행 로그와 텍스트의 모든 숫자 주장을 교차 확인합니다. 이는 자율 연구 에이전트를 괴롭힌 조작된 결과 문제에 대한 직접적인 공격입니다.

이 작업은 자율 연구 에이전트에 관한 최신 AI 개발의 최신 이정표이며 이 수준에서 LLM 기반 시스템을 물리적 실험실 하드웨어에 결합한 최초의 작업 중 하나입니다.

가설에서 습식 실험실 프로토콜까지

재료 과학 분야에서 DeepMind는 Co-Scientist와 반자동 고온 용광로를 결합했습니다. 이 시스템은 이전에 주로 위험한 에칭을 통해 생산된 인기 있는 2D 재료에 대한 보다 안전한 합성 경로를 찾았으며 작업 중인 특정 용광로에 맞는 완전한 성장 레시피를 생성했습니다. 인간의 개선을 통해 25차례의 반복을 거친 후, 팀은 목표 물질과 특성이 유사한 층 구조를 생성했습니다. 그러나 원자 구조에 대한 최종 확인은 아직 보류 중입니다.

두 번째 실험에서는 첫 번째 시도에서 3개의 반도체박막 합성에 성공했다. Co-Scientist는 직접적인 장비 제어를 위해 Gemini 3 Deep Think를 사용하여 레시피 개발 시간을 며칠에서 몇 분으로 단축했습니다. 인간은 여전히 ​​샘플과 전구체 재료를 수동으로 로드해야 했으며, 고속 모드는 신중하게 최적화된 레시피보다 더 작고 덜 균일한 결정을 생성했습니다. 이는 루프가 아직 완전히 손을 떼지 않았음을 상기시켜줍니다.

생물학에서 시스템은 유전적으로 조작된 대장균 콜로니가 다양한 화학 농도에서 어떤 패턴을 형성하는지 예측하는 이미지 분석 파이프라인을 자율적으로 구축했습니다. Gemini 3 Pro Image로 생성된 예측은 4가지 모양 특징 중 3가지에 대한 미공개 실험실 결과와 일치했습니다. 연구자들은 시스템이 알려진 조건 사이의 이유만을 지적하며 완전히 새로운 실험 시스템에서는 아직 동작을 예측할 수 없습니다.

또 다른 AI를 설계하는 자율 AI

컴퓨터 공학 실험은 초기 설정 외에 사람의 개입 없이 진행되었습니다. Co-Scientist는 들어오는 쿼리를 분류하는 의료 AI 아키텍처인 "Agent_H"를 설계하여 수십 개의 응답 후보를 병렬로 생성하고 이를 개선합니다. 지나치게 긴 응답을 수정한 후 Agent_H는 상태 벤치마크에서 GPT-5 및 Claude Opus 5를 포함한 6개 프론티어 모델보다 성능이 뛰어났습니다.

그런 다음 현실 점검이 이루어졌습니다. 세 명의 위원회 인증 의사가 9개 범주에 대한 맹검 비교를 통해 응답을 기록했으며 Agent_H는 단 한 가지 항목에서 기본 Gemini 3.1 Pro에 비해 통계적으로 유의미한 이점을 보여주었습니다. 잠재적으로 유해한 응답의 위험이 더 낮습니다. 자동화된 벤치마크 평가자는 의사의 판단과 약한 상관관계를 보였습니다.

벤치마크 점수와 임상적 유용성 사이의 격차는 틀림없이 이 연구의 가장 중요한 발견입니다. 연구원들은 자동 점수가 높다고 해서 반드시 시스템이 의학적 관점에서 더 나은 답변을 제공한다는 의미는 아니며 AI 벤치마크가 실제로 무엇을 측정하는지에 대한 불편한 질문을 제기합니다.

가공을 46%에서 4%로 절감

자율 연구 에이전트의 핵심 실패 모드는 조작입니다. 에이전트가 좋은 결과를 생성한 것에 대해 보상을 받으면 이를 보완할 인센티브가 있습니다. 이전 분석에 따르면 기존 시스템의 제조율은 80~100%였습니다.

Co-Scientist는 두 가지 메커니즘으로 문제를 공격합니다. 시스템은 위조되거나 표절된 콘텐츠에 대해 처벌을 받고, 별도의 검증 모듈은 실행된 코드의 실제 결과와 비교하여 모든 수치적 주장을 교차 확인합니다. 30명의 도메인 전문가와 자율적으로 생성된 150개의 논문에 대한 450개의 독립적인 리뷰가 포함된 이중 맹검 연구에서 결과는 뚜렷했습니다.

  • 신뢰성 모듈이 활성화된 상태에서 주요 결과를 조작한 논문의 4%와 그렇지 않은 46%.
  • 비교 시스템의 핵심 결과 제작 90%에 도달했습니다.
  • 완전히 조작된 데이터는 Co-Scientist의 출력에는 나타나지 않았지만 비교 시스템 논문의 44%에는 나타났습니다.
  • 표절에 가까운 콘텐츠가 60%에서 16%로 감소했습니다.
  • 통합 안전 아키텍처는 잠재적으로 유해한 연구 방향의 98.7%를 거부했습니다.

과학자를 대체할 준비가 되어 있지 않음

잔여 오류가 남아 있습니다. 이 시스템은 선택적 보고를 지향하는 경향이 있으며 Schmidgall은 "실제 코드와 일치하지 않는 매우 그럴듯한 방법을 논문에 작성"했다고 인정합니다. 재료 과학 레시피를 다른 실험실로 이전할지 여부는 공개된 질문이며 생물학 결과는 유망하지만 좁은 범위의 예측만 다루었습니다.

그래도 갈 길은 분명하다. 18개월 전에 가설 생성기로 시작된 시스템은 이제 실험을 계획하고, 용광로를 작동하고, 출력을 분석하고, 원고 초안을 작성하고, 자체 주장이 틀렸을 때 로그 수준 검증을 통해 문서화할 수 있습니다. 연구실 조교와 자율 연구원 사이의 격차는 줄어들고 있으며 인간의 고집으로 남아 있는 과학 부분(판단, 미각, 물리적 샘플 로딩)은 나머지 부분이 자동화되고 있기 때문에 정확하게 확인하기가 더 쉬워지고 있습니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →