بر اساس گزارش The Decoder که در 28 آگوست منتشر شد، Google DeepMind سیستم هوش مصنوعی چند عامله خود را از یک تولیدکننده فرضیه به یک شریک تحقیقاتی یکپارچه در آزمایشگاه گسترش داده است که آزمایش‌ها را برنامه‌ریزی می‌کند، کد می‌نویسد، تجهیزات آزمایشگاهی را کنترل می‌کند و دست‌نوشته‌های علمی تولید می‌کند. مقاله توسط نویسنده اصلی ساموئل اشمیدگال و همکارانش.

Co-Scientist توسعه یافته برای اولین بار در فوریه 2025 در Gemini 2.0 با ضعف های شناخته شده در بررسی حقایق و بررسی ادبیات معرفی شد، اکنون چیزی را اجرا می کند که محققان آن را گردش کار تحقیقاتی حلقه بسته می نامند. فرضیه‌ها را از یک سؤال تحقیقاتی استخراج می‌کند، طرح‌های آزمایشی یا پروتکل‌های آزمایشگاهی قابل خواندن با ماشین را ایجاد می‌کند، آنها را اجرا می‌کند، نتایج را تجزیه و تحلیل می‌کند و آنها را می‌نویسد - در حالی که ماژول‌های تأیید جداگانه، هر ادعای عددی موجود در متن را در برابر گزارش‌های اجرایی کدی که تولید کرده است، بررسی می‌کنند، حمله مستقیم به مشکل نتایج ساخته‌شده که یک تحقیق خودکار را آزار می‌دهد.

این کار آخرین نقطه عطف در [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) در مورد عوامل تحقیقاتی مستقل است و یکی از اولین کارهایی است که یک سیستم مبتنی بر LLM را به سخت‌افزار آزمایشگاه فیزیکی در این سطح پیوند می‌دهد.

از فرضیه ها تا پروتکل های آزمایشگاهی مرطوب

در علم مواد، DeepMind Co-Scientist را با یک کوره نیمه خودکار با دمای بالا جفت کرد. این سیستم مسیر سنتز ایمن‌تری را برای یک ماده دو بعدی پرطرفدار که قبلاً عمدتاً از طریق اچ کردن خطرناک تولید می‌شد، پیدا کرد و دستور العمل‌های رشد کامل متناسب با کوره خاصی را که با آن کار می‌کرد تولید کرد. پس از 25 دور تکرار با پالایش انسانی، این تیم ساختارهای لایه‌ای را تولید کردند که خواص آنها شبیه ماده مورد نظر است - اگرچه تایید قطعی ساختار اتمی هنوز در انتظار است.

در آزمایش دوم، سه لایه نازک نیمه هادی در اولین تلاش با موفقیت سنتز شدند. با استفاده از Gemini 3 Deep Think برای کنترل مستقیم تجهیزات، Co-Scientist زمان تهیه دستور العمل را از روز به دقیقه کاهش داد. انسان‌ها هنوز مجبور بودند نمونه‌ها و مواد اولیه را به صورت دستی بارگیری کنند و حالت سریع کریستال‌های کوچک‌تر و یکنواخت‌تر را نسبت به دستور العمل‌های بهینه‌سازی شده تولید می‌کرد - یادآوری این که حلقه هنوز کاملاً از بین نرفته است.

در زیست شناسی، این سیستم به طور مستقل یک خط لوله تجزیه و تحلیل تصویر ایجاد کرد که پیش بینی می کند که کدام الگوهای مهندسی ژنتیکی کلنی های E. coli در غلظت های شیمیایی مختلف تشکیل می شوند. پیش‌بینی‌های ایجاد شده با Gemini 3 Pro Image با نتایج آزمایشگاهی منتشر نشده در سه مورد از چهار ویژگی شکل مطابقت داشت. محققان خاطرنشان می کنند که این سیستم فقط بین شرایط شناخته شده دلایل دارد و هنوز نمی تواند رفتار را در سیستم های آزمایشی کاملاً جدید پیش بینی کند.

یک هوش مصنوعی مستقل که هوش مصنوعی دیگری طراحی می کند

آزمایش علوم کامپیوتر بدون هیچ دخالت انسانی فراتر از تنظیمات اولیه اجرا شد. Co-Scientist "Agent_H" را طراحی کرد، یک معماری هوش مصنوعی پزشکی که پرس و جوهای دریافتی را طبقه بندی می کند، ده ها کاندید پاسخ را به طور موازی ایجاد می کند و آنها را اصلاح می کند. پس از اصلاح پاسخ‌های بسیار طولانی، Agent_H از شش مدل مرزی - از جمله GPT-5 و Claude Opus 5 - در معیارهای سلامت عملکرد بهتری داشت.

سپس بررسی واقعیت آمد. سه پزشک دارای گواهی هیئت مدیره پاسخ ها را در یک مقایسه کورکورانه در 9 دسته امتیاز دادند و Agent_H یک مزیت آماری قابل توجهی را نسبت به Gemini 3.1 Pro پایه فقط در یک مورد نشان داد: خطر کمتر پاسخ های بالقوه مضر. ارزیاب‌های معیار خودکار فقط با قضاوت‌های پزشکان ارتباط ضعیفی داشتند.

این شکاف بین امتیازات معیار و سودمندی بالینی مسلماً مهم‌ترین یافته این مطالعه است. محققان پیشنهاد می‌کنند که نمرات خودکار بالا لزوماً به این معنا نیست که یک سیستم پاسخ‌های بهتری را از دیدگاه پزشکی ارائه می‌کند - و سؤالات ناراحت‌کننده‌ای را در مورد آنچه معیارهای هوش مصنوعی واقعاً اندازه‌گیری می‌کنند، ایجاد می‌کند.

برش ساخت از 46% به 4%

حالت اصلی شکست عوامل تحقیقاتی مستقل، ساختگی است: هنگامی که یک عامل برای تولید نتایج خوب پاداش می گیرد، انگیزه ای برای جبران آنها دارد. تجزیه و تحلیل های قبلی نرخ ساخت 80 تا 100 درصد را در سیستم های موجود ثبت کردند.

Co-Scientist با دو مکانیسم به مشکل حمله می کند. این سیستم برای محتوای ساختگی یا سرقت ادبی جریمه می شود و یک ماژول تأیید جداگانه هر ادعای عددی را در برابر نتایج واقعی کد اجرا شده آن بررسی می کند. در یک مطالعه دوسوکور شامل 30 متخصص حوزه و 450 بررسی مستقل از 150 مقاله تولید شده به طور مستقل، نتایج واضح بود:

  • 4% از مقالات نتایج کلیدی را با ماژول‌های قابلیت اطمینان فعال، در مقابل 46% بدون آنها تولید کردند.
  • سیستم مقایسه به 90% ساخت نتیجه کلید رسید.
  • داده های کاملا ساخته شده هرگز در خروجی Co-Scientist ظاهر نشد، اما در 44% مقالات سیستم مقایسه نشان داده شد.
  • محتوای تقریباً سرقت ادبی از 60٪ به 16٪ کاهش یافت.
  • یک معماری ایمنی یکپارچه 98.7% جهت‌های تحقیقاتی بالقوه مضر را رد کرد.

برای جایگزینی دانشمندان آماده نیست

خطاهای باقی مانده باقی می ماند. این سیستم به سمت گزارش‌دهی انتخابی گرایش دارد و اشمیدگال تصدیق می‌کند که «روش‌های بسیار قابل قبولی در مقاله می‌نویسد که با کد واقعی آن مطابقت نداشتند». این که آیا دستور العمل های علم مواد به آزمایشگاه های دیگر منتقل می شوند یا خیر، یک سوال باز است و نتایج زیست شناسی، در عین حال امیدوارکننده، تنها طبقه محدودی از پیش بینی ها را پوشش می دهد.

با این حال، مسیر حرکت روشن است. سیستمی که هجده ماه پیش به‌عنوان یک فرضیه‌ساز آغاز شد، اکنون می‌تواند آزمایشی را برنامه‌ریزی کند، کوره‌ای را راه‌اندازی کند، خروجی‌ها را تجزیه و تحلیل کند و نسخه‌ای خطی را پیش‌نویس کند - و زمانی که ادعاهای خودش اشتباه است، با تأیید در سطح گزارش مستند کند. شکاف بین دستیار آزمایشگاه و محقق مستقل در حال کاهش است و بخش‌هایی از علم که سرسختانه انسانی باقی می‌مانند - قضاوت، ذائقه و بارگیری نمونه فیزیکی - دقیقاً به این دلیل که بقیه خودکار می‌شوند، آسان‌تر می‌شوند.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →