אמת מידה חדשה מאתגרת את האופן שבו תעשיית הבינה המלאכותית מודדת יכולת מדעית, והתוצאות הראשונות שלה משפילות את מעבדות החזית. Terminal-Bench-Science 0.1, שהושק השבוע על ידי חוקרים מאוניברסיטת סטנפורד והצוות מאחורי מדד הקידוד הפופולרי של Terminal-Bench, מעריך סוכני בינה מלאכותית על זרימות עבודה אמיתיות של מחקר מדעי שנתרמו על ידי מדענים עובדים - והמודל החזק ביותר שנבדק, קלוד אופוס 5 שרץ דרך קוד קלוד, השלים רק 30% מהמשימות.

עמוד ההכרזה של המדד מתאר את העיקרון המנחה שלו בצורה בוטה: מדענים, לא מפתחי מודלים או ספקי נתונים, צריכים להציב את הרף ליכולת מדעית ב-AI. הפרויקט נבנה בשיתוף פעולה עם מומחי תחום ממוסדות מחקר ברחבי העולם, והשחרור הראשון שלו כולל 70 משימות בתחומי מדעי החיים, פיזיקה, מדעי כדור הארץ, מתמטיקה והנדסה.

איך זה שונה ממדדי ספרי לימוד

רוב הערכות הבינה המלאכותית המדעיות בודקות ידע: שאלות רב-ברירה, בעיות בספרי לימוד, תרגילים סטנדרטיים. Terminal-Bench-Science מודדת במקום זאת האם סוכנים יכולים לבצע את זרימות העבודה התובעניות והגוזלות זמן רב שממלאות את ימי החוקרים בפועל - סוג העבודה שלא מופיעה בשום בחינה. המשימות פועלות בסביבות מציאותיות, והדירוג מבוסס על חפצים קונקרטיים: ניתוחים, סימולציות, הוכחות, קוד ותוצרי נתונים, נבדקים באמצעות מבחנים ספציפיים למשימה הניתנים לשחזור, במקום מודלים של שופט או ניקוד רב-ברירה.

עיצוב זה משקף תיאוריה של מה שעוזרי AI צריכים לעשות בסופו של דבר עבור המדע. במקום להחליף שיקול דעת מדעי, טוענים מחברי המדד, הסוכנים צריכים להשתלט על שכבת הביצוע - הפעלת הניסויים בסיליקו, עיבוד הנתונים, בדיקת ההוכחות - כדי לשחרר מדענים לחלקי המחקר שבהם השיפוט האנושי חשוב ביותר: הגדרת שאלות, יצירת השערות, פירוש תוצאות,.

הפרויקט גם בנוי במפורש כיעד נע. כאשר מדדי מידה רבים מתפרסמים פעם אחת ונטושים - ההכרזה קוראת לזה בעיית "ניירות לפרסום" - Terminal-Bench-Science מתוכנן כמדד רציף שמתפתח לצד הגבול, עם מהדורות קבועות שנועדו לשמור על ההערכה לפני התקדמות המודל ולמנוע אינפלציית ציונים מונעת זיהום.

The Leaderboard הראשון: דרך ארוכה מאמין

ה-leaderboard v0.1, שמשך תשומת לב משמעותית כשהגיע השבוע ל-Hacker News, מראה ירידה תלולה מהפסגה:

  • קלוד אופוס 5 (קוד קלוד): 30.0%
  • GPT-5.6 Sol (קודקס): 22.4%
  • קלוד פייבל 5 (קוד קלוד): 21.4%
  • קלוד אופוס 4.8 (קוד קלוד): 10.5%
  • GPT-5.6 Terra (קודקס): 8.6%
  • GLM 5.3 (קוד קלוד): 8.1%
  • Kimi K3 (קוד קלוד): 7.1%
  • Grok 4.6 (Grok Build): 7.1%
  • GPT-5.6 לונה (קודקס): 3.3%

התוצאות מצביעות על כך שזרימות עבודה מדעיות נותרו קשות יותר לסוכנים מאשר הנדסת תוכנה, שבה מדד ה-Terminal-Bench המקורי ומדדי הקידוד המתחרים ראו את הציונים מטפסים במהירות. קצב רזולוציה של 30% עבור המערכת הזמינה הטובה ביותר פירושו שבשבע מתוך עשר משימות מחקר אמיתיות, אפילו סוכן ברמה הגבוהה ביותר יחד עם רתמה חזקה לא מצליח לייצר עבודה נכונה לאמת.

גם ההתפשטות בתוך משפחות מופת מאלפת. הפער בין קלוד אופוס 5 לקלוד אופוס 4.8 - כמעט עשרים נקודות - ובין גרסאות ה-GPT-5.6 Sol, Terra ולונה מראה עד כמה איכות התוצאה תלויה במשחק הגומלין של רתמת הדגם והסוכן, ולא באינטליגנציה הגולמית של הדגם בלבד. כל כניסה עם ניקוד גבוה משתמשת ברתמת קידוד אנטי (Claude Code, Codex, Grok Build), ומחזקת את הקונצנזוס המתגבש לפיו פיגומים מכריעים כמו המשקולות הבסיסיות.

מדוע מדענים בנו בנצ'מרק משלהם

המסגור של המדד נושא טיעון מוסדי עדין. "הסיכון במדע גבוה מדי", נכתב בהודעה, "והמדדים שלו חייבים לשקף את סדרי העדיפויות של הקהילה המדעית ולא אינטרסים חיצוניים". הפרויקט נותן לחוקרים עובדים מנגנון ישיר לקודד את המשימות שהם למעשה זקוקים להם באוטומטיות - ולהחזיק את טענות הספקים בדבר "האצת הגילוי המדעי" כנגד תקן שניתן לאמת.

זה חשוב כי לפער בין שיווק למציאות יש השלכות אמיתיות. אם מעבדות גבול טוענות שהסוכנים שלהן יכולים להאיץ את המחקר בעוד שהערכות עצמאיות מתוכננות מומחים מראות שיעורי רזולוציה חד ספרתיים עד 30%, החלטות מימון, תוכניות גיוס ומדיניות מעבדה הבנויה על תביעות אלו יורשות את השגיאה. מדדים מתמשכים בבעלות הקהילה הם תיקון אחד: הם ממירים טענות מעורפלות למספרים שניתנים לשחזור.

אות למוסדות מחקר

עבור אוניברסיטאות, מעבדות לאומיות וצוותי מחקר ופיתוח השוקלים מתי לפרוס סוכנים, המדד מציע משהו שהדגמות של ספקים לא יכולות: מדידה מתוחזקת על ידי קהילה של היכן קו האמינות למעשה יושב. שיעור רזולוציה בשנות העשרה או העשרים פירושו שהמערכות הללו מטופלות כיום כאל עוזרות הדורשות סקירה, לא כאל מבצעים אוטונומיים של צינורות ניסויים. קטגוריות המשימות - המשתרעות על מדעי החיים, הפיזיקה, כדור הארץ, המתמטיקה וההנדסה - גם נותנות למומחי תחום תבנית לתרומה של זרימות עבודה מתחומים שמדדים גנריים מתעלמים מהם באופן שגרתי.

ההקשר הרחב יותר בתעשייה מחזק מדוע העיתוי חשוב. המדע הפך לאחד ממקרי השימוש המקודמים ביותר עבור בינה מלאכותית גבולית, עם מעבדות שמציגות תרומות לגילוי חומרים, מדעי החלבונים ומתמטיקה. הטענות הללו קשות לביקורת: הפלט המדעי איטי לאימות, וההתלהבות נעה מהר יותר מאשר שכפול. אמת מידה שמדרגת חפצים הניתנים לאימות על זרימות עבודה אמיתיות, נותנת למוסדות מחקר דרך להפריד בין יכולות מוכחות לתיאטרון הדגמה - ולעקוב, שחרור אחר שחרור, האם ההתקדמות הסוכנתית במדע מתגבשת במהירות כמו בהנדסת תוכנה, שם טרמינל-בנץ' עשתה את שמו לראשונה.

עבור תעשיית הבינה המלאכותית, המסר של v0.1 הוא דו צדדי. הגבול מתקדם בבירור - 30% של אופוס 5 מתנשאים על 10.5% של אופוס 4.8 הישנים יותר - אבל התקרה נותרה רחוקה מהאמינות שמעבדות אמיתיות דורשות. מעצבי המדד טוענים כי מהדורות רגילות יעקבו בדיוק באיזו מהירות הפער הזה ייסגר. למדענים הצופים במגמות הבינה המלאכותיות בכלי מחקר סוכן יש כעת מדד שהם בנו בעצמם.

---

הישאר לפני AI

קבל את החדשות, הניתוחים ופריצות הדרך האחרונות של AI - הכל במקום אחד.

קרא עוד חדשות AI →