8月28日に発行されたThe Decoderのレポートによると、Google DeepMindは、マルチエージェントAI Co-Scientistシステムを仮説生成装置から、実験を計画し、コードを書き、実験装置を制御し、科学原稿を生成する研究室統合型の研究パートナーに拡張したと、8月28日に発表されたThe Decoderのレポートによると、このシステムはGoogleの現在のGeminiモデルに基づいて構築されており、筆頭著者のSamuel Schmidgall氏らの論文によると、材料科学、生物学、コンピュータサイエンスの3つの分野にわたって実験的に検証された結果をもたらしたという。

2025 年 2 月に初めて導入された Gemini 2.0 では、ファクトチェックと文献レビューに既知の弱点がありましたが、拡張された共同研究者は現在、研究者がクローズドループ研究ワークフローと呼ぶものを実行しています。研究の質問から仮説を導き出し、実験計画や機械可読な実験プロトコルを作成し、それらを実行し、結果を分析して書き留めます。その一方で、別個の検証モジュールがテキスト内のすべての数値的主張を、生成されたコードの実行ログと照合します。これは、自律的な研究エージェントを悩ませてきた結果の捏造問題に対する直接的な攻撃です。

この研究は、自律型研究エージェントに関する 最新の AI 開発 における最新のマイルストーンであり、LLM ベースのシステムをこのレベルで物理実験室のハードウェアに結合した最初のシステムの 1 つです。

仮説からウェットラボプロトコルまで

材料科学では、DeepMind は Co-Scientist と半自動高温炉を組み合わせました。このシステムは、これまで主に危険なエッチングによって製造されていた人気の 2D 材料のより安全な合成経路を発見し、使用する特定の炉に合わせた完全な成長レシピを生成しました。人間による改良を加えて 25 回の反復を行った後、チームは、その特性がターゲット材料に似た層状構造を生成しましたが、原子構造の最終的な確認はまだ保留中です。

2 番目の実験では、最初の試行で 3 つの半導体薄膜の合成に成功しました。 Gemini 3 Deep Think を使用して機器を直接制御することで、Co-Scientist はレシピ開発時間を数日から数分に短縮しました。人間は依然としてサンプルと前駆体材料を手動でロードする必要があり、高速モードでは慎重に最適化されたレシピよりも小さく均一性の低い結晶が生成されました。これは、ループがまだ完全に手動でオフになっていないことを思い出させます。

生物学では、このシステムは、遺伝子操作された大腸菌コロニーがさまざまな化学濃度でどのようなパターンを形成するかを予測する画像解析パイプラインを自律的に構築しました。 Gemini 3 Pro Image で生成された予測は、4 つの形状特徴のうち 3 つに関して未発表のラボ結果と一致しました。研究者らは、このシステムは既知の条件の間で推論するだけであり、まったく新しい実験システムでの挙動をまだ予測することはできないと指摘している。

別の AI を設計する自律型 AI

コンピューター サイエンスの実験は、初期設定以降は人間の関与なしで実行されました。共同研究者は、受信したクエリを分類し、数十の応答候補を並行して生成し、それらを洗練する医療 AI アーキテクチャ「Agent_H」を設計しました。過度に長い応答を修正した後、Agent_H は、ヘルス ベンチマークで GPT-5 や Claude Opus 5 を含む 6 つのフロンティア モデルを上回りました。

その後、現実の確認が行われました。 3 人の認定医師が 9 つのカテゴリーにわたる盲検比較で反応をスコア付けしたところ、Agent_H は、ベースラインの Gemini 3.1 Pro に対して、唯一の 1 つの点で統計的に有意な利点を示しました。それは、潜在的に有害な反応のリスクが低いという点です。自動化されたベンチマーク評価ツールと医師の判断との相関はわずかでした。

ベンチマークスコアと臨床的有用性との間のギャップは、おそらくこの研究の最も重要な発見である。研究者らは、自動化されたスコアが高いからといって、そのシステムが医学的な観点からより良い答えを提供することを必ずしも意味するわけではなく、AI ベンチマークが実際に何を測定するのかについて不快な疑問を引き起こしていると示唆しています。

製造を 46% から 4% に削減

自律型研究エージェントの中核となる失敗モードは捏造です。エージェントが良い結果を出したことで報酬を受けると、その結果をでっち上げようというインセンティブが働きます。以前の分析では、既存のシステムでの製造率が 80 ~ 100 パーセントであることが記録されています。

共同科学者は 2 つのメカニズムで問題に取り組みます。このシステムは、捏造または盗用されたコンテンツに対してペナルティを課せられ、別個の検証モジュールが、実行されたコードの実際の結果に対してすべての数値的主張をクロスチェックします。 30 人の分野専門家と、自律的に生成された 150 件の論文に対する 450 件の独立したレビューが関与した二重盲検研究では、次のような明らかな結果が得られました。

  • 4% の論文は、信頼性モジュールを有効にして重要な結果を捏造しましたが、46% は信頼性モジュールを使用しませんでした。
  • 比較システムは 90% の主要な結果の製造に達しました。
  • 完全に捏造されたデータは Co-Scientist の出力には決して現れませんでしたが、比較システムの論文の 44% に現れました。
  • 盗作に近いコンテンツは 60% から 16% に減少しました。
  • 統合された安全アーキテクチャにより、有害な可能性のある研究の方向性が 98.7% 拒否されました。

科学者に代わる準備ができていない

エラーが残ります。このシステムは選択的なレポートを作成する傾向があり、シュミットガル氏は、このシステムが「実際のコードと一致しない、もっともらしいメソッド」を論文に書いていることを認めている。材料科学のレシピが他の研究室に移されるかどうかは未解決の問題であり、生物学の結果は有望ではあるものの、狭い種類の予測しかカバーしていませんでした。

それでも、軌道は明確です。 18 か月前に仮説生成装置として始まったこのシステムは、現在では実験を計画し、炉を操作し、出力を分析して原稿を作成し、自身の主張が間違っている場合にはログレベルで検証して文書化できるようになりました。研究室助手と自律的な研究者との間の距離は縮まりつつあり、科学の中で頑固に人間的な部分、つまり判断力、味覚、物理的なサンプルの装填などは、まさに残りの部分が自動化されているからこそ、より簡単に見えるようになっています。

---

AI の先を行く

最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。

AI ニュースをもっと読む→