צוות מחקר מ-FAIR ב-Meta, אוניברסיטת אוקספורד ואוניברסיטת קולג' בלונדון הציג מודלים של העדפות מחקר בינה מלאכותית (RPMs), שיטה להחליט אילו ניסויי למידת מכונה סוכן מחקר אוטונומי צריך להריץ בפועל. במקום לחזות את הניקוד של ניסוי, RPM מדרג מועמדים שלא בוצעו ובוחר את המועמדים המבטיחים ביותר, שינוי שלדברי הצוות מתייחס לצוואר הבקבוק האמיתי במחקר מונע בינה מלאכותית: מחשוב אימות, על פי הדוח של MarkTechPost על העבודה.

הרעיון נוחת ברגע שבו סוכני מחקר כבר יכולים להציע, ליישם ולבקיע ניסויים משלהם. יצירת רעיונות זול; ביצוע לא. אימון מועמד בודד יכול לצרוך שעות עד ימים של זמן GPU, כך שסוכן מציע בהכרח הרבה יותר ניסויים ממה שהוא יכול להרשות לעצמו להפעיל. אילו מועמדים יוצאים להורג הם, כפי שהצוות ממסגר את זה, המנוף האמיתי להתקדמות המחקר. עבור מעבדות שצופים בחשבונות המחשוב שלהן מטפסים, המסגור הזה הוא בדיוק הסיבה שהעבודה הזו מושכת תשומת לב בפיתוחי הבינה המלאכותית האחרונים באוטומציה של מחקר.

מדוע בחירת הניסוי היא צוואר הבקבוק

הצוות מצא שמודלים של שפה אינם אמינים בחיזוי מדדים מוחלטים או תוצאות ביצוע. מודל לא יכול להסתכל על ניסוי מועמד ולחזות במדויק את הציון שהוא ישיג. מה שהוא יכול לעשות, מצאו החוקרים, הוא לשפוט מי מבין שני המועמדים הוא ההימור הטוב ביותר - השוואה יחסית ולא תחזית מוחלטת. RPMs בנויים לחלוטין סביב ההבחנה הזו: הם אף פעם לא חוזים ניקוד, הם רק מדרגים.

המערכת פועלת בתוך AIRA-dojo, פיגום חיפוש עצים אבולוציוני בקוד פתוח שיוצר ניסויים של למידת מכונה באמצעות בחירת הורה חמדנית ואופרטורים של Draft, Improve ו-Debug, ומחזירה את הצומת עם ציון האימות הגבוה ביותר בסוף. המדד, AIRS-Bench, הוא גם קוד פתוח. גם הפיגום וגם מודל ההעדפה משתמשים ב-Qwen3.6-27B כעמוד השדרה שלהם, שהצוות מציין שהוא משקולות פתוחות.

איך פועל טורניר הנוקאאוט

במקום ליצור ניסוי צאצא אחד ולבצע אותו, הסוכן מחיל אופרטור 15 פעמים במקביל כדי לייצר 15 מועמדים שלא בוצעו. לאחר מכן, ה-RPM משווה אותם בזוג בטורניר נוקאאוט, ורק המנצח מוצא להורג. כל השוואה מבוססת על צמתי הקשר שנאספו על ידי הליכה ברוחב ראשון של העץ שנחקר, כאשר כל מועמד מוצג לצד ציוני האימות של אבותיו, כך שהשופט מנמק מהיסטוריית החיפוש בפועל של הסוכן ולא בחלל ריק.

המאמר מתאר שתי גרסאות עם תקציבי חישוב שונים:

  • סל"ד להסקה בלבד - LLM-as-a-judge המשווה תוכניות מועמדים, קוד והיסטוריית חיפושים במעבר אחד. ההנחיה שלו עברה אופטימיזציה עם MIPROv2 ממסגרת DSPy והתכנסה למה שהצוות מכנה רובריקה של חוקר ראשי: הוא סובל באגים שניתנים לתיקון, מתגמל להרחבה ומעניש כיווני מחקר מיותרים. דיוק ההשוואה הלא מקוונת נמדד בין 57.7 ל-59.0 אחוזים.
  • Agentic RPM - אותו שופט בתוספת ארגז חול שמשבט את סביבת הסוכן, כולל H200 GPU יחיד, עם כלים מוגבלים לפיתון, Bash ופעולת פתרון הגשה. הוא מפעיל ניסויי פיילוט בקנה מידה קטן, ואז מודל משוב מציע את הניסוי הבא האינפורמטיבי ביותר או מסיים את הלולאה. הטייסים מוגבלים ל-30 עם סף של 60 שניות, ותקציב הזמן הנותר מוגזם בכוונה - 2,700 שניות מדווחות מול 300 אמיתי - כך שהסוכן לא מפסיק לבצע אופטימיזציה מוקדם.

שופט מכוון כמו חוקר ראשי

המסגור של המנהל-חוקר הוא החלק המעניין בשקט. במקום לתגמל מועמדים שנראים מרשימים בצורה מקסימלית, הרובריקה האופטימלית משקפת את האופן שבו חוקר מנוסה בודק רעיונות: קוד באגי שניתן לתקן מנצח קוד מלוטש בחיפוש אחר מבוי סתום, וכיוונים שמשכפלים את העץ הקיים שווים פחות מאשר חדשים. רובריקה זו, שנלמדת באמצעות אופטימיזציה מהירה ולא כוונון ידני, היא זו שנושאת את השיפור, כך עולה מהאבלציות של הצוות.

תוצאות בנצ'מרק ב-AIRS-Bench

ההערכה כיסתה 20 משימות טקסט ציבוריות ומשימות טבלה, כאשר כל משימה ניתנה 24 שעות על H200 בודד ו-10 זרעים אקראיים. באופן מכריע, אותו עמוד שדרה Qwen3.6-27B הניע גם את מפעילי הניסוי וגם את מודל ההעדפה, כך שהרווחים מגיעים משכבת ​​הבחירה ולא ממודל שופט חזק יותר. הציונים המנורמלים הממוצעים:

  • ללא סל"ד (בחירה אקראית): 0.684
  • סל"ד להסקה בלבד: 0.711
  • סל"ד סוכן: 0.729
  • אורקל אימות (תקרה): 0.748
  • אורקל מבחן (תקרה): 0.759

ההסתברות לשיפור בהשוואה לבחירה אקראית הייתה 0.5923 עבור הגרסה הניתנת להסקה בלבד ו-0.5913 עבור הסוכנת, עם רווחי סמך של 95 אחוזים תחתונים של 0.5066 ו-0.5018 - מעל רף 0.5 למובהקות סטטיסטית, למרות שהצוות הוא מתון בשוליים.

יעילות היא התוצאה המעשית יותר. הסל"ד המבוסס על מסקנות בלבד הגיע לציון הסופי של קו הבסיס האקראי של 0.684 תוך 14.88 שעות, מהירות של פי 1.61, בעוד שהגרסה הסוכנת נזקקה ל-15.50 שעות, מהירות של פי 1.55. אפילו בהתייחס לתקורה של מסקנות שופטים באירוח עצמי, המספרים המתואמים נותרו חיוביים.

משקולות פתוחות ואזהרות כנות

הצוות יודע מראש ש-RPM ניתנים לפריסה חלקית כיום. הרכיבים פתוחים - עמודי שדרה מאומנים מראש קפואים ללא כוונון עדין, פיגום ובנצ'מרק בקוד פתוח, ודגמי עמוד שדרה בעלי משקלים פתוחים - אבל דרישת ארגז החול של הגרסה הסוכן ותקורה של ניסוי הפיילוט שלו פירושם שרוב המעבדות יתחילו עם הגרסה המבוססת על מסקנות בלבד. החוקרים מציינים גם ששלבי ניפוי באגים חוזרים לבחירה אקראית בגרסה הסוכן מכיוון שזמן הטייס מתחרה בשעון של הסוכן עצמו.

המשמעות הגדולה יותר עשויה להיות כיוונית. כאשר סוכני מחקר אוטונומיים עוברים מהדגמות לשימוש יומיומי במעבדות תעשייתיות, המשאב הדל הוא כבר לא רעיונות אלא שעות GPU, ושיטות שסוחטות יותר התקדמות ממתחם תקציב מחשוב קבוע לאורך זמן. דירוג לפני ריצה הוא רעיון פשוט, והמספרים של AIRS-Bench מצביעים על כך שזה רעיון שעובד מספיק טוב כדי לשנות.

הישאר לפני AI

התעדכן במחקר שמעצב את הדגמים של מחר ב-AI Buzz Wire.

קרא עוד חדשות AI →