מה קורה כשמודל שפה גדול אף פעם לא רואה חומר מעבר לכיתה ה'? צוות של שבעה חוקרים ענה על השאלה הזו פשוטו כמשמעו: הם בנו את LittleLearner, LLM של 5 מיליארד פרמטרים שהוכשר מאפס על קורפוס שסונן לתוכנית הלימודים של בית הספר היסודי בארה"ב, ולאחר מכן בדקו האם משהו - יותר פרמטרים, יותר לאחר אימון, הנחיה חכמה יותר - יכול לדחוף את הנתונים של המודל לפני מה שהוא לימד אותו לפני. התשובה, כך הם מדווחים, היא לא.

המאמר, "LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure", הוגש ל-arXiv ב-13 באוגוסט על ידי Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell ו-Wieland Brendel. עד ה-16 באוגוסט זה היה נושא לדיון ב-Hacker News בעלייה מהירה עם יותר מ-200 הצבעות בעד, כאשר חוקרים ומתרגלים התלבטו מה המשמעות של ההנחה המועדפת על התעשייה - שאחרי אימון יכולים להעלות יכולות יש מאין. זה בדיוק סוג הניסוי הזהיר והמנוגד שאנו צופים לו ב[סיקור מחקר AI] שלנו (https://aibuzzwire.news).

ארגז חול עם גבול ידע

לימודי LLM מודרניים מאומנים בעצם על כל דבר, מה שהופך את זה כמעט לבלתי אפשרי לדעת אם מיומנות שהוכחה נלמדת באמת במהלך האימון או רק התקבלה על ידי ההנחיה הנכונה. הפתרון של הצוות היה להגביל את חלוקת האימונים עצמה. החל מ-FineWeb-Edu, הם זיקקו קורפוס של 88 מיליארד אסימונים - שזכה לכינוי LittleCurriculum - באמצעות צינור סינון בן חמישה שלבים המותאם לסטנדרטים Common Core עבור גן ילדים עד כיתה 5. מושגים, עובדות ואוצר מילים שנלמדו מעל כיתה 5 לא נכללו במפורש.

בקורפוס זה הם אימנו מודלים בשלושה קנה מידה (פרמטרים 0.6B, 1.3B ו-5B) מאפס, כל אחד נשלח לצד מודל בקרה מותאם מאומן על נתונים לא מסוננים עם אותו ארכיטקטורה ותקציב סמלי. התוצאה היא מודל שוטף מספיק להערכה פתוחה - אתה יכול לשוחח עם גרסת 5B מתארחת בדפדפן - ובכל זאת יש לו גבול ידע חד וניתן לפרש: אם זה לא היה בתוכנית הלימודים היסודית, המודל מעולם לא ראה את זה.

גיוס, לא רכישה

ממצא הליבה בוטה: ערכת הכלים הסטנדרטית להפיכת מודלים לחכמים יותר הגדילה את מה ש-LittleLearner כבר ידעה, אבל אף אחת מהן לא שיפרה באופן משמעותי את הביצועים מחוץ לתחום.

קנה מידה שיפר את הדיוק בתוך הידע המבוקר של המודל והתרחב באופן צנוע לאורך אותו מסלול למידה, אך עשה מעט לבעיות הדורשות יכולות מעבר לחומר כיתה 5. אחרי אימון עם GRPO - שיטת החיזוק שמאחורי חלק גדול מהתנופה של מודל החשיבה - חיזקה משמעותית את יכולות K-5 בהיקף, אך לא הצליחה להתאושש מעבר ליכולות K-5 אפילו כשהיא מאומנת עם נתונים מחוץ לתחום. ולמידה בהקשר, הקסם היומיומי של דחיסת ידע בהנחיה, עזר למודל להשתמש במה שיש לו אך לא פתח חשיבה חדשה מעבר לגבול.

מסנן הקדם-אימון, בקיצור, קובע את תקרת היכולת האפקטיבית. המחברים ממסגרים את התוצאה כעדות להבחנה שהתחום מטשטש כל הזמן: לאחר אימון והנחיה מעוררים; אימון מקדים רוכש.

בקרות נקיות, מחסומים ציבוריים

המתודולוגיה היא שנותנת לטענות את כוחן. מכיוון שכל דגם LittleLearner נשלח עם בקרה לא מסוננת מותאמת - אותה ארכיטקטורה, אותה ספירת אסימונים, אותו מתכון אימון - הצוות יכול לייחס כל הבדל התנהגותי למסנן תכנית הלימודים בלבד. מומחי מתמטיקה שעברו הכשרה לאחר ההכשרה ב-Benchmark MathCAMPS מאפשרים לחוקרים לדרג את הביצועים לפי כיתה בית ספרית, להתחקות בדיוק היכן מסתיימת היכולת בתחום. ובניגוד לרוב עיתוני הגבול, הכל פומבי: הקורפוס, הבסיס והמחסומים שלאחר ההכשרה בכל שלושת הסולמות ב-HuggingFace, והדגמת צ'אט מתארחת, כך שצוותים עצמאיים יכולים לחקור את הגבול בעצמם.

הפתיחות הזו מלבה את הדיון ב-Hacker News. מגיבים בחנו את ההתנהגות של המודל המתארח בקצה הידע שלו - בין אם הוא נמנע, מנחש או הוזה כשהוא נדחף מעבר לכיתה 5 - ומתווכחים על ההשלכות: חלקם קוראים את התוצאות כחדשות רעות להייפ של מודל חשיבה, אחרים מציינים שנתוני אימון מקדים בקנה מידה אינטרנט מכיל הרבה יותר ממושגים של בית ספר יסודי, כך שמודלים עם תקרות גבוהות יותר תואמים למודלים גבוהים יותר. מחברי המאמר עצמם נזהרים בנקודה זו: הטענה שלהם היא על מה שההתערבויות הסטנדרטיות לא יכלו לעשות עבור מודל עם השכלה ידועה ומבוקרת, לא תחזית ישירה לגבי מעבדות גבול.

למה זה חשוב מעבר לכיתה

הניסוי מדבר ישירות לוויכוחים חיים ב-AI. מעבדות בינה מלאכותית מוציאות מיליארדים על משטרי פוסט אימון בהתבסס על הרעיון שלמידת חיזוק יכולה לדחוף מודל בסיסי הרבה מעבר ליכולותיו הגולמיות. LittleLearner מציע שהרווחים הללו עשויים לחיות ברובם בתוך - ולהיות מוגבלים על ידי - מה שנתוני ההכשרה תומכים. זהו טיעון לדאגה הרבה יותר לאיסוף נתונים, ולהתייחס לטענות על יכולות "המתעוררות" לאחר אימון בספקנות.

המהדורה היא גם מכשיר מחקר אמיתי, לא רק מאמר. הצוות פרסם את LittleCurriculum ואת כל מחסומי המודל בגלוי, ודף הפרויקט משרטט את הניסויים שארגז החול מאפשר: האם RL באמת יכול ליצור יכולת במקום לתגמל אותה, באיזו יעילות מדגם לומד מושג חדש באמת כמו מספרים שליליים כאשר הוא מוצג, והאם מכונות וילדים זקוקים לחשיפה דומה - או עושים טעויות דומות - כאשר לומד שברים.

עבור תחום שרק לעתים רחוקות מקבל בקרות נקיות, מודל עם השכלה שצוינה במפורש הוא מתנה נדירה. ולכל השאר, זו תזכורת שכדאי להצמיד מעל השולחן: אף דוגמנית - או אדם - לא יכול לנמק את דרכו לצאת ממה שמעולם לא לימדו אותו.

הישאר לפני AI

סיקור בדרגת ביקורת עמיתים של המחקר המעצב מחדש AI, מועבר מדי יום. הוסף סימניה למרכז שלנו עבור הפיתוחים האחרונים של AI.

קרא עוד חדשות AI →