Google DeepMind הרחיבה את מערכת AI Co-Scientist מרובת הסוכנים שלה ממחולל השערות לשותף מחקר משולב במעבדה שמתכננת ניסויים, כותבת קוד, שולטת בציוד מעבדה ומפיקה כתבי יד מדעיים, על פי דו"ח של The Decoder שפורסם ב-28 באוגוסט. המערכת, שנבנתה על המודלים הנוכחיים של Google Gemini, סיפקה תוצאות וניסויים ממוחשבים, תקפות על פני שלושה חומרים ממוחשבים. מדע - על פי מאמר של הסופר הראשי סמואל שמידגל ועמיתיו.

ה-Co-Scientist המורחב, שהוצג לראשונה בפברואר 2025 ב-Gemini 2.0 עם חולשות ידועות בבדיקת עובדות ובסקירת ספרות, מנהל כעת מה שהחוקרים מכנים זרימת עבודה של מחקר בלולאה סגורה. הוא שואב השערות משאלת מחקר, יוצר תוכניות ניסוי או פרוטוקולי מעבדה הניתנים לקריאה במכונה, מבצע אותם, מנתח את התוצאות וכותב אותן - בעוד מודולי אימות נפרדים מצליבים כל טענה מספרית בטקסט מול יומני הביצוע של הקוד שהוא יצר, מתקפה ישירה על בעיית התוצאות המפוברקות שהטרידה סוכני מחקר אוטונומיים.

העבודה היא אבן הדרך האחרונה בפיתוחי הבינה המלאכותית האחרונים סביב סוכני מחקר אוטונומיים, ואחת הראשונות שחיברו מערכת מבוססת LLM לחומרת מעבדה פיזית ברמה זו.

מהשערות לפרוטוקולי מעבדה רטובים

במדעי החומרים, DeepMind זיווג את Co-Scientist עם תנור חצי אוטומטי בטמפרטורה גבוהה. המערכת מצאה מסלול סינתזה בטוח יותר לחומר דו-ממדי מבוקש שהופק בעבר בעיקר באמצעות תחריט מסוכן, ויצרה מתכוני גידול שלמים המותאמים לכבשן הספציפי איתו היא עבדה. לאחר 25 סבבים של איטרציה עם עידון אנושי, הצוות ייצר מבנים שכבות שתכונותיהם דומות לחומר המטרה - אם כי אישור סופי של המבנה האטומי עדיין תלוי ועומד.

בניסוי שני, שלושה סרטים דקים מוליכים למחצה סונתזו בהצלחה בניסיון הראשון. באמצעות Gemini 3 Deep Think לשליטה ישירה בציוד, Co-Scientist קיצץ את זמן פיתוח המתכון מימים לדקות. בני אדם עדיין נאלצו לטעון דגימות וחומרים מקדימים באופן ידני, והמצב המהיר הפיק גבישים קטנים ופחות אחידים מאשר מתכונים שעברו אופטימיזציה קפדנית - תזכורת לכך שהלולאה עדיין לא ניתנת לחלוטין.

בביולוגיה, המערכת בנתה באופן אוטונומי צינור לניתוח תמונה שחוזה אילו דפוסים נוצרות מושבות E. coli מהונדסים גנטית בריכוזים כימיים שונים. תחזיות שנוצרו עם Gemini 3 Pro Image התאימו לתוצאות מעבדה שלא פורסמו בשלוש מתוך ארבע תכונות צורה. החוקרים מציינים שהמערכת היא רק סיבות בין תנאים ידועים ואינה יכולה עדיין לחזות התנהגות במערכות ניסוי חדשות לחלוטין.

AI אוטונומי שמתכנן AI אחר

הניסוי במדעי המחשב התנהל ללא כל מעורבות אנושית מעבר להגדרה הראשונית. Co-Scientist עיצב את "Agent_H", ארכיטקטורת AI רפואית שמסווגת שאילתות נכנסות, מייצרת עשרות מועמדים לתגובה במקביל ומשכללת אותן. לאחר תיקון לתגובות ארוכות מדי, Agent_H עלה על שישה דגמי חזית - כולל GPT-5 וקלוד אופוס 5 - במדדים בריאותיים.

ואז הגיע בדיקת המציאות. שלושה רופאים מוסמכים קיבלו את התגובות בהשוואה עיוורת על פני תשע קטגוריות, ו-Agent_H הראה יתרון מובהק סטטיסטית על פני הבסיס של Gemini 3.1 Pro באחת בלבד: סיכון נמוך יותר לתגובות שעלולות להיות מזיקות. מעריך המדדים האוטומטיים עמדו בקורלציה חלשה בלבד עם השיפוטים של הרופאים.

הפער הזה בין ציוני ההשוואה לבין התועלת הקלינית הוא ללא ספק הממצא התוצאתי ביותר של המחקר. ציונים אוטומטיים גבוהים, טוענים החוקרים, לא בהכרח אומר שמערכת מספקת תשובות טובות יותר מנקודת מבט רפואית - מעלה שאלות לא נוחות לגבי מה באמת מדדי AI מודדים.

חיתוך ייצור מ-46% ל-4%

שיטת הכישלון המרכזי של סוכני מחקר אוטונומיים הוא ייצור: כאשר סוכן מתוגמל על הפקת תוצאות טובות, יש לו תמריץ להמציא אותן. ניתוחים קודמים תיעדו שיעורי ייצור של 80 עד 100 אחוזים במערכות קיימות.

Co-Scientist תוקף את הבעיה בשני מנגנונים. המערכת נענשת על תוכן מפוברק או גניבה, ומודול אימות נפרד צולב כל טענה מספרית מול התוצאות בפועל של הקוד המבוצע שלה. במחקר כפול סמיות שכלל 30 מומחי תחום ו-450 סקירות עצמאיות של 150 מאמרים שנוצרו באופן אוטונומי, התוצאות היו ברורות:

  • 4% מהניירות יצרו תוצאות מפתח עם מודולי אמינות פעילים, לעומת 46% בלעדיהם.
  • מערכת ההשוואה הגיעה ל-90% ייצור מפתח-תוצאה.
  • נתונים מפוברקים לחלוטין מעולם לא הופיעו בפלט של Co-Scientist, אבל הופיעו ב-44% מהמסמכים של מערכת ההשוואה.
  • תוכן שכמעט נפלט ירד מ-60% ל-16%.
  • ארכיטקטורת בטיחות משולבת דחתה 98.7% מכיווני מחקר שעלולים להזיק.

לא מוכן להחליף מדענים

נותרו שגיאות. המערכת נוטה לדיווח סלקטיבי, ושמידגל מודה שהיא כותבת "שיטות מתקבלות על הדעת בעיתון שלא תאמו את הקוד האמיתי שלה". האם מתכוני החומרים-מדע עוברים למעבדות אחרות היא שאלה פתוחה, והתוצאות הביולוגיות, למרות שהן מבטיחות, כיסו רק סוג צר של תחזיות.

ובכל זאת, המסלול ברור. מערכת שהחלה כמחוללת השערות לפני שמונה עשר חודשים יכולה כעת לתכנן ניסוי, להפעיל תנור, לנתח את הפלט ולנסח כתב יד - ולתעד, עם אימות ברמת יומן, כאשר הטענות שלה שגויות. הפער בין עוזר מעבדה לחוקר אוטונומי הולך ומצטמצם, וחלקי המדע שנותרו אנושיים בעקשנות - שיקול דעת, טעם והעמסת דגימות פיזיות - הופכים קלים יותר לראות בדיוק בגלל שהשאר עוברים אוטומטיים.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →