חוקרי Nvidia בנו מערכת סוכנים שדחפה את קלוד אופוס 5 של Anthropic לציון מושלם של 100% ב-ARC-AGI-3, אחד ממדדי החשיבה האינטראקטיביים התובעניים ביותר בבינה מלאכותית - תוך שימוש באותו מודל שמקבל ציונים של 30% כשהוא פועל בכוחות עצמו. התוצאה, שפורסמה ביום שישי בבלוג הטכני של Nvidia, היא העדות החזקה ביותר עד כה לכך שהתוכנה העוטפת מודל חזיתי חשובה לא פחות מהדגם עצמו. לכל מי שעוקב אחר התפתחויות הבינה המלאכותיות האחרונות, זה מסמן שינוי במקום בו בעצם חי היתרון התחרותי בבינה מלאכותית.
המערכת נקראת AVO, קיצור של Agentic Variation Operators, והיא הגישה של Nvidia על ארכיטקטורה כללית עבור סוכנים אוטונומיים ארוכי אופק - AI שיכול להישאר במשימה במשך שעות או ימים במקום לענות על הנחיה אחת. בסט הציבורי ARC-AGI-3, AVO רשמה ציון של 100.00 RHAE בכל 25 סביבות המשחק, והשלימה את כל 183 הרמות ב-6,624 פעולות סביבתיות תוך שימוש בקלוד אופוס 5 כמודל הקצה שלו.
מה ה-ARC-AGI-3 בודק בעצם
ARC-AGI-3 הוא מדד נימוק אינטראקטיבי שנוצר על ידי קרן ARC Prize. סוכן נפל לסביבות לא מוכרות, דמויות משחק, ללא הוראות, ללא כללים מוצהרים וללא מטרה מוצהרת. עליו לחקור באמצעות ניסוי וטעייה, להסיק כיצד הסביבה פועלת, להבין מה המשמעות של "זכייה", ולאחר מכן לפעול ביעילות מספיק כדי להתקדם ברמות קשות יותר ויותר.
מדד הניקוד של הבנצ'מרק, Relative Human Action Efficiency (RHAE), משלב את השלמת המשימה עם כמה מעט פעולות שהסוכן מבזבז ביחס לשחקנים אנושיים הראשונים. זה הופך אותו למבחן אכזרי של אוטונומיה מתמשכת: הסוכן חייב לזכור את מה שלמד, להתאושש מטעויות ולתקצב את פעולותיו בקפידה לאורך ריצה שלמה.
מספר הכותרת של Nvidia מקבל הקשר מהשוואה. VISTA, רתמה קודמת לאינטראקציה ישירה שהשתמשה גם בקלוד אופוס 5, השלימה את אותן 183 רמות ציבוריות ב-7,542 פעולות סביבתיות. AVO היה צריך בערך 12% פחות פעולות כדי לסיים את העבודה, לפי הפוסט בבלוג של Nvidia.
מגרעיני GPU למשחקים לא ידועים
AVO לא נבנה עבור פאזלים. Nvidia הדגימה לראשונה את הארכיטקטורה של אופטימיזציה של ליבת GPU, תחום שבו שינויי קוד קטנים יכולים לשבור נכונות, התנהגות זיכרון ותפוקה בדרכים בלתי צפויות. במחקר אחד של ליבת תשומת לב, AVO רץ ברציפות במשך שבעה ימים, חקר יותר מ-500 כיווני אופטימיזציה, וביצע 40 גרסאות ליבה. במערכות NVIDIA DGX B200, גרעיני הקשב הרב-ראשים שהתקבלו עלו על cuDNN ב-3.5% ו-FlashAttention-4 ב-10.5%. לאחר מכן הסוכן התאים את הליבה המפותחת שלו לתשומת לב בשאילתות מקובצות תוך כ-30 דקות של עבודה אוטונומית נוספת.
אותה לולאת ליבה - בדיקה, תכנון, יישום, בדיקה, הערכה - הופנתה אז אל ARC-AGI-3 כשרק ממשק המשימות השתנה. שני מנגנונים נישאים. הראשון הוא זיכרון מתמשך, המאחסן יישומים קודמים, תוצאות הערכה, תפוקות מהדר ופרופילים והיגיון מצטבר, כך שהסוכן יכול לחזור ממצבו הנוכחי במקום לבנות מחדש את ההקשר מאפס. השני הוא מפקח, סוכן שני שצופה במסלול הכללי ומתערב כשההתקדמות נעצרת.
המפקח הוא פריצת הדרך
TechCrunch, שראיינה את אדל אל חלאק מ-Nvidia, סגן נשיא למוצר ביחידת ה-AI של החברה, הדגישה את המפקח כמרכיב החשוב ביותר. "זה כמעט מתנהג כמו מנכ"ל לדחוף את הסוכן כשהוא יוצא מהכיוון או מתחיל לחקור נתיב שעלול להוביל למבוי סתום, או לחקור מחדש נתיב שצעד בו בעבר", אמר אל חלאק לפרסום.
פער הביצועים הוא בולט. הבדיקה של Nvidia גילתה שקלוד אופוס 5 ללא רתמה מתוחכמת הצליח לציון של 30% ב-ARC-AGI-3 - התוצאה הטובה ביותר מבין הדגמים החשופים שנבדקו, אך לא קרובה לריצה מלאה. הדגמים של OpenAI קיבלו ציון של פחות מ-10% במדד, והחברה פרסמה מחקר משלה בחודש שעבר שהראה כי התאמה של שתי הגדרות רתמה בלבד שילשה את הציונים שלה. שום תצורה לדגם בלבד לא התקרבה ל-100% שהשיגה AVO.
יש לציין כי תצורת ה-AVO רצה במודאליות של טקסט בלבד: כל תצפית סופקה כרשת טקסט מדויקת בגודל 64x64, ללא תמונות או אסימוני תמונה שנשלחו לדגם. כוח ההיגיון הגיע מהלולאה סביב המודל, לא מתפיסה מולטי-מודאלית.
מדוע התעשייה מהמרת על רתמות
הממצא נוחת בתוך גל של עדויות לכך שתשתית סוכנים, לא יכולת מודל גולמי, היא צוואר הבקבוק הנוכחי עבור AI אוטונומי. Databricks פרסם ביולי מחקר בנצ'מרק שהראה שהרתמה משפיעה באופן דרמטי הן על הביצועים והן על העלות. "אתה יכול לבחור את אותו דגם אבל רתמות שונות, ואתה מקבל עלות משמעותית יותר אם אתה משתמש ברתמה הלא נכונה", אמר מנכ"ל Databricks Ali Ghodsi ל-TechCrunch. "זה עצמו יכול פי 2 מהעלות שלך."
אל חלאק סיגר את הטיעון הרחב יותר של Nvidia במונחים של פתיחות. "אנחנו מאמינים שיש לנו ערימת סוכנים פתוחה - שבה יש לך שליטה על הרתמה, על פני התשתית, על פני זמן הריצה - זה מה שנדרש לנו כדי להוביל את המערכת האקולוגית קדימה ובטוחה", אמר. ל-Nvidia יש חלקים פתוחים של טכנולוגיית רתמה תחת המותג NeMo שלה, ומחקר ה-AVO מתועד במאמר על arXiv.
אמת מידה עם היסטוריה
ARC-AGI-3 הפך לנקודת הבזק ביריבות בין מעבדות הגבול. OpenAI טענה בעבר לתוצאות חזקות עבור מודל ה-GPT-5.6 Sol שלה במדד, תוך בדיקה של הגדרות ההערכה שבהן נעשה שימוש. התוצאה של Nvidia עוקפת את הוויכוח הזה במובן אחד - היא לא טוענת לדגם חכם יותר, אלא רק סוכן מהונדס טוב יותר סביב דגם קיים.
המסר למפתחים ולארגונים הבונים מוצרים סוכנים הוא ישיר: בחירת הדגמים עדיין חשובה, אבל עיצוב המערכת מחליט כעת אם מודל גבול מספק תוצאות גבוליות. כפי שמנסחת זאת Nvidia, הערכת מודל אינה זהה להערכת סוכן - וטבלאות המדדים של 2026 מתגמלות יותר ויותר את המהנדסים שבונים את הפיגומים.
הישאר לפני AI
ארכיטקטורות סוכנים נעות מהר יותר מאי פעם, והפער בין רתמה טובה לרעה נמדדת כעת בנקודות אמת מידה ובדולרים אמיתיים. עקוב אחר AI Buzz Wire לסיקור יומי מאומת מקור של מחקר בינה מלאכותית, בנצ'מרקים והשקות מוצרים.
קרא עוד חדשות מחקר AI →