Jev, "מודל ההחלטה" הלא-LLM של הסטארט-אפ TypeSafe AI, השלים את Pokémon Red - נלחם בדרכו מ-Pallet Town להיכל התהילה תוך 37 שעות ו-40 דקות של משחק בעלות חישוב כוללת של כ-$1.65, לפי אתר האינטרנט של הפרויקט.
ההרצה, שנבנתה על ידי המפתח כריסטיאן מאת'יזן, הועברה בשידור חי עם אסימונים ועלויות שהוצגו בקוד פתוח ב-GitHub. זה עלה לעמוד הראשון של האקר ניוז בסוף השבוע, גרר מאות הצבעות בעד ודיון ער על מה שהוא אומר על עתידם של סוכני AI. ה-Tom's Hardware סיקרה את ההישג, וציינה שמנוע ללא LLM הצליח במקום שבו צ'אטבוטים מסורתיים נתקעו במשך חודשים - ושקלוד אופוס 5 אימן את הדגם דרך המבוי הסתום שלו.
הריצה לפי המספרים
הנתונים הסטטיסטיים מהמעקב של הפרויקט עצמו מראים עד כמה ריצה זו הייתה יוצאת דופן עבור מערכת AI:
- זמן כולל: 37 שעות, 40 דקות
- החלטות שהתקבלו: 16,150
- אסימוני קלט: בערך 39.2 מיליון
- עלות ג'ב כוללת: כ-$1.65
- זמן החלטה טיפוסי: 0.4 שניות
- מתנגדים נלחמו: כ-1,660
- מגבונים לצוות: 16
- עלית ארבע ניסיונות: 15
- הקטע הקשה ביותר: דרך הניצחון
צוות היכל התהילה האחרון: צ'אריזארד ברמה 83, בגיבוי גרוולר (62), נידוקווין (45), בידריל (44), האנטר (39) ופרימאפ (29).
הכלכלה היא הכותרת. 16,000 החלטות בפחות ממחיר הקפה הם ניגוד בולט לסוכני משחק מבוססי LLM, שיכולים לצרוב עשרות דולרים באסימונים במהלך הפעלות ארוכות. Mathiesen אמר שהוא בחר בפוקימון לאחר שהגיע למסקנה ש-Jev יכול להחליט במהירות, אבל עדיין לא מספיק מהר כדי לשחק את Doom.
מדוע Pokémon Red קשה עבור AI
Pokémon Red הפך למבחן לא סביר עבור AI סוכן. הקלאסיקה של Game Boy משנת 1996 דורשת תכנון לטווח ארוך: טחינה של רמות, ניהול מסיבה של שש, ניווט במערות דמויי מבוך ללא מפה, וחזרה לאחור כאשר פריט מפתח הוחמצה. סוכני מודל שפה הסתובבו באופן היסטורי במעגלים, נתקעו במערות ושרפו תקציבים אדירים על פעולות מיותרות.
Jev נוקט בגישה שונה מהותית. במקום לייצר טקסט, המודל מחזיר החלטות מכוילות ישירות - AI עיצוב מסוג TypeSafe שיווקה כאלטרנטיבה "System One" לחשיבה מכוונת וכבדה בשפה של דגמים גדולים. לפי הסיקור הקודם של Tom's Hardware על הדגם, החברה טוענת ש-Jev מהיר יותר פי 193 בערך ופי 445 זול יותר מחלופות LLM במשימות החלטה.
הקאץ', הודה היזם, הוא ש-Jev היה זקוק לעזרה. לפי החומרה של טום, קלוד אופוס 5 הדריך את מודל ההחלטות דרך המבוי הסתום שלו - גישה היברידית שבה מודל שפה גדול מספק הדרכה אסטרטגית בעוד שהמודל המהיר והזול מבצע אלפי החלטות אינדיבידואליות. בעמוד הפרויקט מציינים בעוולה שג'ב "ידע לאן ללכת הלאה כי היה לו מדריך".
מה זה אומר עבור סוכני AI
התוצאה היא נקודת נתונים בטענה הולכת וגוברת לפיה עתידם של סוכני בינה מלאכותית אינו מודל ענק אחד שעושה הכל, אלא חלוקת עבודה: מודלים מהירים, זולים ומתמחים המטפלים בהחלטות בתדירות גבוהה, כאשר מודלים של חשיבה איטיים יותר נכנסים פנימה רק כשהמצב נעשה מעורפל.
עבור רובוטיקה, משחקים ומערכות בקרה בזמן אמת - תחומים שבהם ההחלטות חייבות להגיע תוך אלפיות שניות ותקציבים נמדדים בסנטים - הארכיטקטורה הזו מושכת. רובוט מחסן, NPC משחק משחקים, או מערכת מסחר לא יכולים להרשות לעצמם נסיעה הלוך ושוב בסגנון GPT של 2 שניות לכל מיקרו פעולה.
הספקנים ב-Hacker News הצביעו על אזהרות הריצה: המשחק בן עשרות שנים ומתועד ביסודיות, מודל האימון עשה את המשימות הכבדות האסטרטגיות, ו-15 ניסיונות Elite Four מרמזים על הרבה ניסוי וטעייה. אלו נקודות הוגנות - אבל הן מחמיצות את האות המעניין יותר. 16,000 החלטות טובות ב-0.0001$ כל אחת היא בדיוק פרופיל העלות שסוכנים אוטונומיים צריכים אם הם אי פעם יפעלו בקנה מידה.
TypeSafe AI, שהוקמה על ידי חוקר לשעבר של OpenAI RLHF, מיקמה את Jev כהשלמה למודלים של שפה ולא כתחליף. פרויקט הפוקימון - קוד, זרם ופירוט עלויות כולם ציבוריים - הוא ההדגמה החיה ביותר עד כה של מה שמערכת החלטה ראשונה יכולה לעשות.
קוד המקור המלא זמין ב-GitHub, וניתן לצפות בריצה שהושלמה ב-YouTube, כולל כל מחיקה ב-Victory Road.
הישאר לפני AIעקוב אחר AI Buzz Wire לפיתוחי הבינה המלאכותית האחרונים.
קרא עוד חדשות AI →