ה-GPT-6 Astra של OpenAI פרסמה תוצאות מתקדמות ב-ARC-AGI-3, רף ההיגיון המופשט שנועד למדוד אינטליגנציה סוכן, על פי תוצאות שפורסמו ביום רביעי על ידי קרן פרס ARC. המודל קיבל ציון של 62.7% בסט החצי-פרטי של המדד תחת הרתמה הסטנדרטית של הקרן, ו-99.9% כאשר הוערך עם רתמת ספק מתאם המשמרת את מצב ההיגיון הפנימי של המודל בין בקשות.
התוצאות נחתו יום אחד לאחר ש-OpenAI החלה את ההשקה המבוגרת של Astra, מודל הדגל שהחברה הגדירה כתחילתו של עידן חדש. לקוראים שמנסים לשמור על ציון בזמן שרף מדד הסחר של מעבדות הגבול נושף, עמוד הפיתוחים האחרונים של AI עוקב אחר כל מהדורה חשובה בזמן שהיא מתרחשת.
שתי רתמות, שני ציונים שונים מאוד
הפער בין שני מספרי הכותרות של אסטרה הוא הפרט החשוב ביותר בדוח. פרס ARC מעריך סוכנים תחת רתמות שונות, וכל אחד משנה את מה שהדגם רשאי לעשות בהקשר שלו.
תחת הרתמה הסטנדרטית, דגם יכול לשאת פתקים שהוא בוחר לשמור בזמן שהוא עובד דרך הסביבה. עם ההגדרה הזו, אסטרה במאמץ החשיבה המקסימלי השיגה ציון של 62.7%, בעלות כוללת של $26,098 עבור ריצת ההערכה. בקצה הנגדי, הפעלת אותה רתמה כשההיגיון כבוי הפיק רק 35.2% בעוד שעלה יותר - 49,791 דולר - מכיוון שהדגם נזקק להרבה יותר פעולות כדי להתקדם.
רתמת מתאם הספק נדיבה יותר: היא משמרת את מצב ההיגיון האטום של הדגם בין בקשות ומשתמשת בדחיסה לשיחות ארוכות יותר, ומאפשרת לאסטרה לעשות שימוש חוזר בעבודה קודמת. תחת הרתמה הזו, אסטרה השיגה 99.9% במאמץ חשיבה גבוה עבור $18,817, ו-98.6% במאמץ מרבי עבור $17,332. אפילו הגדרת ההנמקה הנמוכה ביותר הגיעה ל-96.7%.
במילים אחרות, ההבדל בין ציון חלקי לכמעט מושלם אינו יכולת גולמית בלבד - זה כמה ממצב העבודה של המודל שורד בין צעדים.
מכות בני אדם על יעילות פעולה
ARC-AGI-3 בנוי סביב סביבות משחק חדשות, מופשטות ומבוססות תורות. סוכנים חייבים לחקור ללא הוראות, להסיק כיצד העולם פועל, לזהות מטרות מתגמולים דלים ולתכנן פעולות מרובות שלבים. הסביבות מכוילות כך שבני אדם יכולים לפתור 100% מהן, מה שהופך את הביצועים האנושיים לקו הבסיס שעליו מודד המדד.
אסטרה לא רק פתרה את רוב הרמות - היא פתרה אותן ביעילות. לפי פרס ARC, המודל השתמש בפחות פעולות מהממוצע של האדם שנבדק ב-96% מהרמות, ועלה על קו הבסיס האנושי ביעילות הפעולה בכל הסט.
הכלכלה של ההשוואה היא חמורה. משתתפי מבחן אנושיים קיבלו תשלום של $115 לכל הפעלה של 90 דקות בתוספת $5 לכל משחק שהושלם, והסתכם בכ-$12.78 לכל ניסיון משחק. ריצת הערכה מלאה של אסטרה עולה חמש ספרות, תלוי בתצורה. אבל פרס ARC ציין קמט מנוגד לאינטואיציה: מאמצי חשיבה גבוהים יותר בדרך כלל עולים פחות, מכיוון שאסטרה פתרה משחקים בפחות פעולות, והפחיתה את המספר הכולל של קריאות מודל ואסימונים שנשרפים בכל ריצה.
מודל שבונה את השפה שלו
מעבר לציונים, פרס ARC הדגיש התנהגות איכותית שהצוות צפה בה. אסטרה הפכה בעקביות סביבות לא מוכרות לדגמי עולם סימבוליים קומפקטיים - המייצגת את מכניקת המשחק ככללים לוגיים, ופיתחה קיצור ספציפי לתחום שלה כדי לעקוב אחר מצב ולתכנן פעולות.
זו בדיוק המיומנות ש-ARC-AGI-3 תוכנן לחקור. היכן שדורות קודמים של המדד בדקו חשיבה קולחת על פני דפוסים חדשים, הדור השלישי בודק האם סוכן יכול לחקור, לדגמן, להגדיר יעדים ולבצע תוכניות בסביבות שמעולם לא ראה - המרכיבים ב- ARC Prize רשימות כמו חקר, מודלים, קביעת יעדים ותכנון וביצוע.
הרקע של עידן AGI
תוצאות ההשוואה הגיעו על רקע רטוריקה מקסימלית של OpenAI עצמה. בתדרוך עיתונאים לפני ההשקה ביום חמישי, נשיא החברה, גרג ברוקמן, אמר שזה "לא מופרך להרגיש שאנחנו עכשיו בעידן AGI", תוך שהוא מפסיק להכריז רשמית, על פי סיקור ההשקה של The New Stack. הוא תיאר את AGI כ"מושג שליחות או מושג רוחני" ולא כטריגר חוזי.
חוקר OpenAI, איידן קלארק, אמר כי Astra הייתה מסלול ההדרכה הגדול ביותר של החברה עד כה - הראשון שהוכשר מראש על יותר מ-100,000 GPUs באתר Stargate בטקסס - ומהדורת OpenAI הראשונה שבה דגמים קודמים מילאו תפקיד משמעותי בפיקוח על תהליך ההדרכה. הגישה נשארת בשלבים: ההשקה מתחילה עם לקוחות ארגוניים בתוכנית Daybreak, כאשר זמינות Plus, Pro, Business ו-Enterprise בתוספת גישת API ו-AWS מובטחת בימים הקרובים.
הכוכבית על הניקוד
זהירות מתחייבת בכמה מישורים. ביצועי ה-ARC-AGI-3 של אסטרה תלויים במידה רבה בתצורת הרתמה, כפי שמראים שני מספרי הכותרות, ורתמות מותאמות אישית המשמרות את מצב הדגם היו נקודת מחלוקת חוזרת במחלוקות בנצ'מרק. הניתוח של ה-New Stack של ההשקה ציין כי אסטרה "מפרסמת רווחים גדולים במשימות מיוחדות, אבל היא מגיעה במחיר גבוה ואינה מובילה בבירור את חבילת הקידוד" - תזכורת לכך שמדדים של חידות אפקטיביות ועומסי עבודה מסחריים יומיומיים מודדים דברים שונים.
פרס ARC עצמו ממסגר את התרגיל כמדידת "הפער השיורי" בין AI ו-AGI הנוכחי, ומגדיר את AGI כיכולת לרכוש כל מיומנות שאדם יכול, ביעילות כפי שאדם יכול. ציון כמעט מושלם בתנאים נוחים אינו סוגר את הפער הזה בעצמו. ובמחיר של 17,000 עד 50,000 דולר לכל הערכה, רק מעבדות בעלות משאבים טובים יכולות להרשות לעצמן להפעיל את המדד בקנה מידה כזה - אם כי נתוני העלות של פרס ARC מראים שהנמקה חכמה יותר יכולה למעשה לכווץ את החשבון.
למה זה חשוב
יעילות פעולה היא ציר השוואה חדש באמת. מודל שפותר כל רמה אבל מבזבז אלפי שיחות על כך הוא פחות שימושי - ויקר יותר - מזה שמתנהג כמו אסטרה כאן: לחקור בכוונה, לדחוס את מה שהיא לומדת ולפעול לפיו. לא משנה מה מסיקים לגבי הדיון ב-AGI, נתוני פרס ARC מראים שסוכני גבולות מתאימים כעת לבני אדם לא רק אם הם יכולים לפתור בעיות חדשות, אלא לגבי האופן שבו הם פותרים אותן מבחינה כלכלית.
הישאר לפני AI
כל תוצאת אמת מידה, השקת מודל ודיון בנושא בטיחות, נבדקה בזמן שהם מתרחשים - קרא עוד חדשות AI →
