מעבדת בינה מלאכותית מבוזרת, Prime Intellect, פרסמה תוצאות של ניסוי בקנה מידה גדול שבודק עד כמה דגמי הבינה המלאכותית הגבולית של היום יכולים לבצע מחקר למידת מכונה אוטונומית - והטובים שבהם התקרבו להפליא להתאמה לשיא העולם האנושי במדד קהילתי מפורסם.

הפרויקט, שזכה לכינוי NanoGPT Speedrun Frontier ופורסם ב-22 באוגוסט, כלל 153 ריצות אוטונומיות על פני 18 דגמי חזית המנסים את speedrun אופטימיזציית nanoGPT - תחרות שבה חוקרים מחפשים את הדרך היעילה ביותר לאמן מודל שפה קטן ליעד איכות קבוע. הסיפור טיפס במהירות לעמוד הראשון של האקר ניוז, שם הוא גרר עשרות הערות שהתלבטו מה התוצאות אומרות על היכולת של AI לגילוי מדעי אמיתי. For more context on this story, see our ongoing breaking AI news.

מה ה-NanoGPT Speedrun בעצם

המדד מגיע מהמאגר המודד-nanogpt שמתוחזק על ידי קלר ג'ורדן ורשימה ארוכה של תורמים מהקהילה. האתגר פשוט להטעות: שימוש ב-8 NVIDIA H100 GPUs, אמן מודל שפה שמגיע לאובדן צולב אנטרופיה של 3.28 בערכת האימות של FineWeb - רמת הביצועים שהגיעה לשכפול GPT-2 המקורי של Andrej Karpathy לאחר 45 דקות - מהר ככל האפשר.

באמצעות מאות תרומות מהקהילה במהלך השנתיים האחרונות, השיא האנושי ירד מתחת ל-75 שניות ולפחות מ-400 מיליון אסימוני אימון, שיפור של יותר מפי 30 לעומת המתכון המקורי. הפתרונות המנצחים נקראים כמו קטלוג של הנדסת ML מודרנית: ה-Muon Optimizer, הטמעות סיבוביות עם QK-Norm, הפעלות בריבוע ReLU, קוונטיזציה של FP8 על קשב ומעברי MLP, Flash Attention 3 עם דפוסי חלונות הזזה ועשרות טכניקות אחרות מוערמות זו על גבי זו.

הבדיקה של Prime Intellect השתמשה במסלול האופטימיזציה של ה-benchmark, אשר - לפי התיעוד של המאגר - ממזער את מספר שלבי האימון הדרושים כדי להגיע לאובדן היעד, בכפוף לארכיטקטורה, מערך נתונים וגודל אצווה קבועים, עם תקציב בלתי מוגבל למעשה של שעון קיר. זה הופך אותו למבחן טהור של גילוי אלגוריתמים ולא מהירות חומרה גולמית.

איך הניסוי עבד

כל אחד מ-18 המודלים קיבל את המשימה באופן אוטונומי: להציע שינויים במתכון האימון, להריץ ניסויים, לבדוק את התוצאות ולבצע חזרה - עם סקריפט אימות קבוע וזרעים אקראיים קבועים המבטיחים שהשיפור הנטען הוא אמיתי ולא ריצה מזל. כפי שסיכם זאת מגיבים של האקר ניוז, המודלים התבקשו לחקור כיצד לשפר את ההכשרה של מודל קטן, לנסות שוב ושוב שינויים, לבדוק אותם ולהשתמש בתוצאות כדי להחליט מה לנסות אחר כך.

המודלים עבדו באמצעות מגוון רתמות סוכנים - כולל claude-code, קודקס של OpenAI, kimi-code, grok-cli, qwen-code ו-prime-agent של Prime Intellect עצמו - והצוות עקב אחר צריכת האסימונים של כל ריצה, ספירת הניסויים, קריאות הכלים וזמן הסוכן שחלף. בסך הכל, הניסוי צרך מאות מיליוני אסימונים לכל דגם מוביל ומיליארדים על פני הרשת המלאה.

The Leaderboard: Fable 5 Leads the Pack

תוצאת הכותרת: המודל שזוהה כ-Fable 5, עובר דרך רתמת הקוד של קלאוד, סגר 81.7 אחוז מהפער בין המתכון הבסיסי לשיא האנושי, עם התוצאה המאומתת הטובה ביותר של 2,726 במדד ה-Leaderboard. ההגעה לשם לקחה 8.7 ימים של זמן סוכן מצטבר, בערך 800 מיליון אסימונים, 811 ניסויים וכ-3,000 קריאות לכלים.

את חבילת הרודפים הוביל Opus 5, שסגר 53.6 אחוז מהפער, ואחריו מקרוב Kimi K3 עם 52.2 אחוזים כשהם מונעים על ידי רתמת ה-prime-agent של Prime Intellect (ו-45.8 אחוזים באמצעות קימי-קוד). Opus 4.8 הצליח 39.4 אחוזים, כמה גרסאות GPT-5.6 נחתו בין 11 ל-36 אחוזים בערך, Sonnet 5 נסגר ב-26.8 אחוזים, ו-Grok 4.5 ו-Qwen3.8 Max כל אחד הגיע לכ-24.6 אחוזים.

בהמשך, DeepSeek V4 Pro סגר 12.3 אחוז מהפער, GPT-5.5 הגיע ל-8.1 אחוזים, וה-Kimi K2.7 הישנה יותר סיימה ב-7.2 אחוזים. יש לציין שדגם אחד ששוחרר לאחרונה - GLM 5.3 - עדיין פעל בזמן הפרסום ללא רשומה מאומתת עדיין, תזכורת לכך שהמדד מעניש דגמים שאינם יכולים לאמת באופן אמין את השיפורים שלהם.

למה זה חשוב

מדדים דומים לעניין הזה מכיוון שהם מודדים משהו שמקודד לוחות הישגים לא יכול: היכולת להפעיל לולאת מחקר אמיתית - השערה, ניסוי, ניתוח, עדכון - לאורך ימים ולא דקות. היכולת הזו היא הבסיס לתחום המתפתח של מחקר בינה מלאכותית אוטונומית, שבו המשימה של סוכנים לא לכתוב קוד לפי מפרט אלא לגלות דברים שאיש לא הראה להם.

ההתפשטות בתוצאות היא כשלעצמה אינפורמטיבית. כמעט כל מודל בניסוי מצא את אותם רעיונות מנצחים הליבה, על פי כתבת הפרויקט - מה שהפריד בין הריצות הטובות ביותר היה מה שהניסוי משאיר אחריו: סוכנים חזקים יותר שמרו אותות חלשים בתוצאות רועשות מספיק זמן כדי לאמת אותם, והבינו טוב יותר את הנתונים הניסויים שלהם.

אזהרות מהקהילה

מגיבים של האקר ניוז העלו נקודות מתודולוגיות הוגנות. הגדרות המאמץ והרתמות היו מגוונות בין הדגמים - Fable 5 רץ על הגדרת חשיבה גבוהה בעוד Opus 5 רץ על מקסימום - והחשבון של 153 ריצות על פני 18 דגמים מרמז על דגמים מסוימים שקיבלו יותר ניסיונות מאחרים. האם הדירוג של הדגם משקף את יכולת המחקר הגולמית שלו או את איכות הרתמה שלו נותרה שאלה פתוחה.

ובכל זאת, כיוון הנסיעה ברור. כאשר לידיים האנושיות המהירות ביותר נדרשו שנים של מאמץ קולקטיבי כדי להגיע לשיא הנוכחי, הסוכנים האוטונומיים הטובים ביותר סוגרים כעת את רוב הפער הזה תוך קצת יותר משבוע של זמן חישוב. השאלה הבאה - האם דגם כלשהו יכול לסגור את 18.3 האחוזים הנותרים - עשויה להיענות מוקדם מהצפוי.

למידע נוסף על אמות המידה והמחקר המעצב את חזית הבינה המלאכותית, עקוב אחר הסיקור המתמשך של AI Buzz Wire.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →