Theo một bài báo của tác giả chính Samuel Schmidgall và các đồng nghiệp, Google DeepMind đã mở rộng hệ thống Nhà đồng khoa học AI đa tác nhân của mình từ một máy tạo giả thuyết thành một đối tác nghiên cứu tích hợp trong phòng thí nghiệm nhằm lập kế hoạch thí nghiệm, viết mã, điều khiển thiết bị phòng thí nghiệm và tạo ra các bản thảo khoa học.

Được giới thiệu lần đầu tiên vào tháng 2 năm 2025 trên Gemini 2.0 với những điểm yếu đã biết trong việc kiểm tra thực tế và đánh giá tài liệu, Nhà đồng khoa học mở rộng hiện đang vận hành cái mà các nhà nghiên cứu gọi là quy trình nghiên cứu khép kín. Nó đưa ra các giả thuyết từ một câu hỏi nghiên cứu, tạo ra các kế hoạch thử nghiệm hoặc các giao thức phòng thí nghiệm có thể đọc được bằng máy, thực hiện chúng, phân tích kết quả và ghi chúng - trong khi các mô-đun xác minh riêng biệt kiểm tra chéo mọi xác nhận bằng số trong văn bản dựa trên nhật ký thực thi của mã mà nó tạo ra, một cuộc tấn công trực tiếp vào vấn đề kết quả bịa đặt đã gây khó khăn cho các tác nhân nghiên cứu tự trị.

Công việc này là cột mốc quan trọng mới nhất trong sự phát triển AI mới nhất xung quanh các cơ quan nghiên cứu tự trị và là một trong những cơ quan đầu tiên kết hợp hệ thống dựa trên LLM với phần cứng phòng thí nghiệm vật lý ở cấp độ này.

Từ giả thuyết đến quy trình phòng thí nghiệm ướt

Trong khoa học vật liệu, DeepMind kết hợp Co-Scientist với lò nhiệt độ cao bán tự động. Hệ thống đã tìm ra con đường tổng hợp an toàn hơn cho vật liệu 2D được săn đón trước đây được sản xuất chủ yếu thông qua quá trình ăn mòn nguy hiểm và tạo ra các công thức tăng trưởng hoàn chỉnh phù hợp với lò cụ thể mà nó đang làm việc. Sau 25 vòng lặp với sự sàng lọc của con người, nhóm nghiên cứu đã tạo ra các cấu trúc phân lớp có đặc tính giống với vật liệu mục tiêu – mặc dù việc xác nhận chính xác về cấu trúc nguyên tử vẫn đang chờ xử lý.

Trong thí nghiệm thứ hai, ba màng mỏng bán dẫn đã được tổng hợp thành công ở lần thử đầu tiên. Sử dụng Gemini 3 Deep Think để điều khiển thiết bị trực tiếp, Co-Scientist đã cắt giảm thời gian phát triển công thức từ vài ngày xuống còn vài phút. Con người vẫn phải tải mẫu và nguyên liệu tiền chất theo cách thủ công và chế độ nhanh tạo ra các tinh thể nhỏ hơn, kém đồng nhất hơn so với các công thức được tối ưu hóa cẩn thận – một lời nhắc nhở rằng vòng lặp vẫn chưa hoàn toàn được thực hiện.

Trong sinh học, hệ thống đã tự động xây dựng một quy trình phân tích hình ảnh để dự đoán các kiểu khuẩn lạc E. coli biến đổi gen hình thành ở các nồng độ hóa học khác nhau. Các dự đoán được tạo bằng Hình ảnh Gemini 3 Pro khớp với kết quả phòng thí nghiệm chưa được công bố trên ba trong số bốn đặc điểm hình dạng. Các nhà nghiên cứu lưu ý rằng hệ thống chỉ suy luận giữa các điều kiện đã biết và chưa thể dự đoán hành vi trong các hệ thống thí nghiệm hoàn toàn mới.

Một AI tự trị thiết kế một AI khác

Thí nghiệm khoa học máy tính được tiến hành mà không có sự tham gia của con người ngoài quá trình thiết lập ban đầu. Đồng nhà khoa học đã thiết kế "Agent_H", một kiến ​​trúc AI y tế giúp phân loại các truy vấn đến, tạo ra hàng chục ứng cử viên phản hồi song song và tinh chỉnh chúng. Sau khi sửa các phản hồi quá dài, Agent_H đã vượt trội hơn sáu mô hình biên giới — bao gồm GPT-5 và Claude Opus 5 — về điểm chuẩn sức khỏe.

Sau đó là kiểm tra thực tế. Ba bác sĩ được hội đồng chứng nhận đã chấm điểm các câu trả lời trong một so sánh mù quáng giữa chín danh mục và Agent_H cho thấy lợi thế đáng kể về mặt thống kê so với Gemini 3.1 Pro cơ bản chỉ ở một điểm: nguy cơ phản ứng có hại thấp hơn. Công cụ đánh giá điểm chuẩn tự động chỉ tương quan yếu với đánh giá của bác sĩ.

Khoảng cách giữa điểm chuẩn và tính hữu ích trên lâm sàng được cho là phát hiện có hệ quả lớn nhất của nghiên cứu. Các nhà nghiên cứu gợi ý rằng điểm số tự động cao không nhất thiết có nghĩa là hệ thống đưa ra câu trả lời tốt hơn từ góc độ y tế - đặt ra những câu hỏi khó chịu về những gì điểm chuẩn AI thực sự đo lường.

Cắt chế tạo từ 46% xuống 4%

Chế độ thất bại cốt lõi của các tác nhân nghiên cứu tự chủ là bịa đặt: khi một tác nhân được khen thưởng vì đã tạo ra kết quả tốt, nó sẽ có động cơ để bù đắp. Các phân tích trước đây ghi nhận tỷ lệ chế tạo từ 80 đến 100% trong các hệ thống hiện có.

Nhà đồng khoa học giải quyết vấn đề bằng hai cơ chế. Hệ thống bị phạt vì nội dung bịa đặt hoặc đạo văn và một mô-đun xác minh riêng biệt sẽ kiểm tra chéo mọi xác nhận bằng số đối với kết quả thực tế của mã được thực thi. Trong một nghiên cứu mù đôi với sự tham gia của 30 chuyên gia trong lĩnh vực và 450 đánh giá độc lập của 150 bài báo được tạo tự động, kết quả rất rõ ràng:

  • 4% số bài viết đã tạo ra các kết quả chính có mô-đun độ tin cậy được kích hoạt, so với 46% không có chúng.
  • Hệ thống so sánh đạt 90% chế tạo key-result.
  • Dữ liệu hoàn toàn bịa đặt chưa bao giờ xuất hiện trong kết quả đầu ra của Co-Scientist, nhưng xuất hiện trong 44% bài báo của hệ thống so sánh.
  • Nội dung gần như đạo văn giảm từ 60% xuống 16%.
  • Kiến trúc an toàn tích hợp đã loại bỏ 98,7% các hướng nghiên cứu có khả năng gây hại.

##Chưa sẵn sàng thay thế nhà khoa học

Các lỗi còn sót lại vẫn còn. Hệ thống này có xu hướng báo cáo có chọn lọc và Schmidgall thừa nhận rằng họ viết "các phương pháp rất hợp lý trong bài báo nhưng không khớp với mã thực tế của nó". Liệu các công thức nấu ăn khoa học vật liệu có được chuyển giao cho các phòng thí nghiệm khác hay không là một câu hỏi mở, và các kết quả sinh học, mặc dù đầy hứa hẹn, chỉ bao gồm một nhóm dự đoán hẹp.

Tuy nhiên, quỹ đạo là rõ ràng. Một hệ thống bắt đầu như một máy tạo giả thuyết cách đây 18 tháng giờ đây có thể lập kế hoạch thí nghiệm, vận hành lò nung, phân tích đầu ra và soạn thảo bản thảo - và ghi lại tài liệu, với xác minh cấp độ nhật ký, khi các tuyên bố của chính nó là sai. Khoảng cách giữa trợ lý phòng thí nghiệm và nhà nghiên cứu tự chủ đang thu hẹp, và các bộ phận của khoa học vẫn còn mang tính con người một cách cứng đầu - khả năng phán đoán, mùi vị và tải mẫu vật lý - đang trở nên dễ dàng nhìn thấy chính xác hơn vì phần còn lại đang được tự động hóa.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →