פרויקט חדש בקוד פתוח מושך תשומת לב להתמודדות עם אחת מהמגבלות העיקשות של למידת מכונה: בניית מודל שפה שלא מפסיק ללמוד. הפרויקט, שנקרא mini-AGI, מתאר את עצמו כמודל שפה ברמת בייט לומד מתמשך שמרכיב את הארכיטקטורה שלו, מתאמן מאפס על GPU יחיד עם 8GB של VRAM, וממשיך ללמוד מכל מה שהוא קורא.
הפרויקט הופיע ב-Hacker News במהלך סוף השבוע, שם הוא טיפס להרבה יותר ממאה נקודות, והמאגר שלו ב-GitHub שוחרר תחת רישיון MIT. על פי README של הפרויקט, המטרה היא להדגים שלמידה מתמדת מזרם נתונים בודד - ללא שכחה קטסטרופלית - אפשרית אפילו בחומרה צנועה ברמת הצרכן. For more context on this story, see our ongoing latest AI developments.
משקלים בדיסק, לא ב-VRAM
הטריק המרכזי מאחורי mini-AGI הוא ערכת ניהול זיכרון לא שגרתית. במקום להחזיק את כל פרמטרי הדגם בזיכרון ה-GPU, המערכת מאחסנת את משקלה כקבצים רגילים בדיסק ומדפדת אותם על גבי הכרטיס הגרפי לפי הצורך.
לבחירת העיצוב הזו יש השלכה משמעותית: ספירת הפרמטרים של הדגם מוגבלת על ידי שטח דיסק פנוי ולא על ידי VRAM. ה-README קובע כי המודל יכול להצמיח קיבולת חדשה תוך כדי אימון כאשר הוא קצר, ולגזום קיבולת ששום דבר לא מבקש. האימון וההסקה עוברים בדיוק באותו נתיב קוד, כך שאין משטר כוונון עדין נפרד ואין מודל בסיס קפוא - קריאה והדרכה הם, במילות הפרויקט, אותו אירוע.
המערכת מכוונת למחשב או לפטופ עם GPU של לפחות 8GB VRAM, חומרה שמפתחים רבים כבר מחזיקים.
מדוע קשה ללמוד מתמשך
רוב דגמי השפה הזמינים כיום עוקבים אחר אותו מחזור חיים: מעבדה מכשירה דגם, מקפיאה אותו ושולחת אותו. משתמשים יכולים לכוונן את הקצוות, אבל משקלי הבסיס לעולם לא משתנים שוב. סעיף המוטיבציה של הפרויקט טוען שזה הופך כל דגם בבעלות אישית ל"דגם של מישהו אחר עם שכבה דקה שלך מלמעלה" - כזה שמפסיק ללמוד ביום שבו הוא נשלח.
המכשול הוא מכשול ידוע בחקר למידת מכונה: שכחה קטסטרופלית, הנטייה של רשתות עצביות לדרוס ידע שנלמד בעבר כשהיא מאומנת על נתונים חדשים. מודל שלומד ללא הרף מזרם מידע יומיומי משפיל בדרך כלל את כל מה שידע קודם לכן.
ה-README מתאר את האילוצים שעיצבו את העיצוב. הדגם צריך להתאים ל-8GB של VRAM - לא עם קוונטיזציה, מכיוון שהאימונים דורשים שיפועים ומצב אופטימיזציה שמוסיפים בערך פי שלושה מהזיכרון של המשקולות עצמם. ועליו לא לשכוח, להחזיק במה שהוא כבר למד תוך כדי קליטת חומר חדש מזרם בלתי פוסק של טקסט.
מודל ברמת בתים שבונה את עצמו
mini-AGI פועל ברמת הבתים ולא על אסימונים, קורא זרם של תווים נתח אחד בכל פעם ולוקח צעד שיפוע על כל נתח. הפרויקט גם אומר שהמודל "מרכיב את הארכיטקטורה שלו", ומבדיל אותו ממודלים קונבנציונליים שהמבנה שלהם קבוע על ידי יוצריהם לפני תחילת ההכשרה.
הגישה היא ניסיונית בכוונה. זוהי הדגמה בקנה מידה קטן של משטר אימונים, לא אתגר למערכות גבול.
אזהרות חשובות
מחבר הפרויקט מפורש לגבי המצב הנוכחי של המערכת. במילים של ה-README עצמו, מיני-AGI הוא "דגם קטן ברמת צעצוע", ולקוראים אסור לצפות ליכולות ברמת גבול. מטרת התרגיל היא להראות שלמידה מתמדת מזרם נתונים בודד ללא שכחה קטסטרופלית אפשרית בכלל - ואפשרית בחומרה שכמעט כל אחד יכול לגשת אליה.
משקלי הדגם טרם פורסמו. ריצת האימון עדיין משלימה את המעבר הראשון שלה על הקורפוס ממנו הוא לומד, והמחבר אומר שהמשקולות ישוחררו ברגע שהמעבר הזה יושלם, שבקצב הנוכחי הוא בעוד כמה שבועות. עד אז, משקיפים יכולים לבדוק דוגמאות מההיסטוריה של ריצת ההדרכה בדף הפרויקט כדי לראות כיצד המודל השתפר במהלך הקריאה.
למה זה חשוב
אם הגישה מחזיקה מעמד כאשר המודל מתרחב לגדלים בעלי יכולת גבוהה יותר, היא מצביעה על סוג אחר של בעלות בינה מלאכותית: מודלים אישיים שחיים על המחשב שלך, ממשיכים ללמוד מהמסמכים והנתונים שאתה מזין אותם, ולעולם לא יקפאו את משקלם לפי לוח הזמנים של השחרור של הספק.
הפרויקט הוא גם תזכורת לכך שלא כל העבודה המעניינת ב-AI מתרחשת בחזית. עם GPU יחיד לצרכן, שטח דיסק רגיל ורישיון MIT, מיני-AGI מנסה לענות על שאלה שמעבדות גדולות עקפו אותה במידה רבה - האם ניתן לבנות מודל שילמד את הדרך שבה אנשים לומדים: ברציפות, מכל מה שהיא נתקלת בה.
הקוד והתיעוד זמינים ב-GitHub לכל מי שיש לו חומרה תואמת שרוצה לעקוב אחריו, לפרוק את הפרויקט או להמשיך לאמן את הדגם כראות עיניו.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →