بر اساس گزارش The Decoder که در 28 آگوست منتشر شد، Google DeepMind سیستم هوش مصنوعی چند عامله خود را از یک تولیدکننده فرضیه به یک شریک تحقیقاتی یکپارچه در آزمایشگاه گسترش داده است که آزمایشها را برنامهریزی میکند، کد مینویسد، تجهیزات آزمایشگاهی را کنترل میکند و دستنوشتههای علمی تولید میکند. مقاله توسط نویسنده اصلی ساموئل اشمیدگال و همکارانش.
Co-Scientist توسعه یافته برای اولین بار در فوریه 2025 در Gemini 2.0 با ضعف های شناخته شده در بررسی حقایق و بررسی ادبیات معرفی شد، اکنون چیزی را اجرا می کند که محققان آن را گردش کار تحقیقاتی حلقه بسته می نامند. فرضیهها را از یک سؤال تحقیقاتی استخراج میکند، طرحهای آزمایشی یا پروتکلهای آزمایشگاهی قابل خواندن با ماشین را ایجاد میکند، آنها را اجرا میکند، نتایج را تجزیه و تحلیل میکند و آنها را مینویسد - در حالی که ماژولهای تأیید جداگانه، هر ادعای عددی موجود در متن را در برابر گزارشهای اجرایی کدی که تولید کرده است، بررسی میکنند، حمله مستقیم به مشکل نتایج ساختهشده که یک تحقیق خودکار را آزار میدهد.
این کار آخرین نقطه عطف در [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) در مورد عوامل تحقیقاتی مستقل است و یکی از اولین کارهایی است که یک سیستم مبتنی بر LLM را به سختافزار آزمایشگاه فیزیکی در این سطح پیوند میدهد.
از فرضیه ها تا پروتکل های آزمایشگاهی مرطوب
در علم مواد، DeepMind Co-Scientist را با یک کوره نیمه خودکار با دمای بالا جفت کرد. این سیستم مسیر سنتز ایمنتری را برای یک ماده دو بعدی پرطرفدار که قبلاً عمدتاً از طریق اچ کردن خطرناک تولید میشد، پیدا کرد و دستور العملهای رشد کامل متناسب با کوره خاصی را که با آن کار میکرد تولید کرد. پس از 25 دور تکرار با پالایش انسانی، این تیم ساختارهای لایهای را تولید کردند که خواص آنها شبیه ماده مورد نظر است - اگرچه تایید قطعی ساختار اتمی هنوز در انتظار است.
در آزمایش دوم، سه لایه نازک نیمه هادی در اولین تلاش با موفقیت سنتز شدند. با استفاده از Gemini 3 Deep Think برای کنترل مستقیم تجهیزات، Co-Scientist زمان تهیه دستور العمل را از روز به دقیقه کاهش داد. انسانها هنوز مجبور بودند نمونهها و مواد اولیه را به صورت دستی بارگیری کنند و حالت سریع کریستالهای کوچکتر و یکنواختتر را نسبت به دستور العملهای بهینهسازی شده تولید میکرد - یادآوری این که حلقه هنوز کاملاً از بین نرفته است.
در زیست شناسی، این سیستم به طور مستقل یک خط لوله تجزیه و تحلیل تصویر ایجاد کرد که پیش بینی می کند که کدام الگوهای مهندسی ژنتیکی کلنی های E. coli در غلظت های شیمیایی مختلف تشکیل می شوند. پیشبینیهای ایجاد شده با Gemini 3 Pro Image با نتایج آزمایشگاهی منتشر نشده در سه مورد از چهار ویژگی شکل مطابقت داشت. محققان خاطرنشان می کنند که این سیستم فقط بین شرایط شناخته شده دلایل دارد و هنوز نمی تواند رفتار را در سیستم های آزمایشی کاملاً جدید پیش بینی کند.
یک هوش مصنوعی مستقل که هوش مصنوعی دیگری طراحی می کند
آزمایش علوم کامپیوتر بدون هیچ دخالت انسانی فراتر از تنظیمات اولیه اجرا شد. Co-Scientist "Agent_H" را طراحی کرد، یک معماری هوش مصنوعی پزشکی که پرس و جوهای دریافتی را طبقه بندی می کند، ده ها کاندید پاسخ را به طور موازی ایجاد می کند و آنها را اصلاح می کند. پس از اصلاح پاسخهای بسیار طولانی، Agent_H از شش مدل مرزی - از جمله GPT-5 و Claude Opus 5 - در معیارهای سلامت عملکرد بهتری داشت.
سپس بررسی واقعیت آمد. سه پزشک دارای گواهی هیئت مدیره پاسخ ها را در یک مقایسه کورکورانه در 9 دسته امتیاز دادند و Agent_H یک مزیت آماری قابل توجهی را نسبت به Gemini 3.1 Pro پایه فقط در یک مورد نشان داد: خطر کمتر پاسخ های بالقوه مضر. ارزیابهای معیار خودکار فقط با قضاوتهای پزشکان ارتباط ضعیفی داشتند.
این شکاف بین امتیازات معیار و سودمندی بالینی مسلماً مهمترین یافته این مطالعه است. محققان پیشنهاد میکنند که نمرات خودکار بالا لزوماً به این معنا نیست که یک سیستم پاسخهای بهتری را از دیدگاه پزشکی ارائه میکند - و سؤالات ناراحتکنندهای را در مورد آنچه معیارهای هوش مصنوعی واقعاً اندازهگیری میکنند، ایجاد میکند.
برش ساخت از 46% به 4%
حالت اصلی شکست عوامل تحقیقاتی مستقل، ساختگی است: هنگامی که یک عامل برای تولید نتایج خوب پاداش می گیرد، انگیزه ای برای جبران آنها دارد. تجزیه و تحلیل های قبلی نرخ ساخت 80 تا 100 درصد را در سیستم های موجود ثبت کردند.
Co-Scientist با دو مکانیسم به مشکل حمله می کند. این سیستم برای محتوای ساختگی یا سرقت ادبی جریمه می شود و یک ماژول تأیید جداگانه هر ادعای عددی را در برابر نتایج واقعی کد اجرا شده آن بررسی می کند. در یک مطالعه دوسوکور شامل 30 متخصص حوزه و 450 بررسی مستقل از 150 مقاله تولید شده به طور مستقل، نتایج واضح بود:
- 4% از مقالات نتایج کلیدی را با ماژولهای قابلیت اطمینان فعال، در مقابل 46% بدون آنها تولید کردند.
- سیستم مقایسه به 90% ساخت نتیجه کلید رسید.
- داده های کاملا ساخته شده هرگز در خروجی Co-Scientist ظاهر نشد، اما در 44% مقالات سیستم مقایسه نشان داده شد.
- محتوای تقریباً سرقت ادبی از 60٪ به 16٪ کاهش یافت.
- یک معماری ایمنی یکپارچه 98.7% جهتهای تحقیقاتی بالقوه مضر را رد کرد.
برای جایگزینی دانشمندان آماده نیست
خطاهای باقی مانده باقی می ماند. این سیستم به سمت گزارشدهی انتخابی گرایش دارد و اشمیدگال تصدیق میکند که «روشهای بسیار قابل قبولی در مقاله مینویسد که با کد واقعی آن مطابقت نداشتند». این که آیا دستور العمل های علم مواد به آزمایشگاه های دیگر منتقل می شوند یا خیر، یک سوال باز است و نتایج زیست شناسی، در عین حال امیدوارکننده، تنها طبقه محدودی از پیش بینی ها را پوشش می دهد.
با این حال، مسیر حرکت روشن است. سیستمی که هجده ماه پیش بهعنوان یک فرضیهساز آغاز شد، اکنون میتواند آزمایشی را برنامهریزی کند، کورهای را راهاندازی کند، خروجیها را تجزیه و تحلیل کند و نسخهای خطی را پیشنویس کند - و زمانی که ادعاهای خودش اشتباه است، با تأیید در سطح گزارش مستند کند. شکاف بین دستیار آزمایشگاه و محقق مستقل در حال کاهش است و بخشهایی از علم که سرسختانه انسانی باقی میمانند - قضاوت، ذائقه و بارگیری نمونه فیزیکی - دقیقاً به این دلیل که بقیه خودکار میشوند، آسانتر میشوند.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →