צוות NeMo של NVIDIA הוציא את Molt, מסגרת PyTorch יליד חיזוק סוכן עם יעד עיצובי יוצא דופן: בסיס קוד קטן מספיק כדי שחוקר יוכל להחזיק אותו בראשו - ועוזר קידוד AI יכול לקרוא ולנמק אותו בשלמותו. השחרור נוחת כאשר RL הסוכן הופך למתכון הדומיננטי ללמד מודלים להשתמש בכלים, לכתוב קוד ולנווט בסביבות, וזהו אחד מכמה פרויקטי תשתית המעצבים מחדש את האופן שבו סוכני חזית מאומנים. אנו מכסים את השינויים האלה ב[חדשות הבינה המלאכותיות] שלנו (https://aibuzzwire.news).

נבנה לקריאה, לא רק לרוץ

כפי שמדווח MarkTechPost, Molt מודד בערך 8.6K שורות של קוד RL, שנספרו על ידי מעקב אחר גרף הייבוא מנקודת הכניסה של כל מסגרת RL. אותה שיטה מספקת בערך 62K קווים עבור verl, 25K עבור סליים ו-7.2K עבור OpenRLHF. הקומפקטיות המכוונת הזו היא הפיצ'ר המרכזי של הפרויקט: מחקר RL סוכן הוא שינוי אלגוריתם מתמיד - אומדנים חדשים, שלבי צנרת חדשים, תוכניות השקה חדשות - ובמסגרות מיינסטרים כל שינוי עובר דרך שכבות של טריינר, דבק עורפי מבוזר ודבק. מולט שואף להסיר את החיכוך הזה.

המסגרת היא מורשית Apache 2.0 ונשלחת עם קודי השקה, סקריפטים של Slurm ומיכל נבנה מראש. עם זאת, ל-NVIDIA ברור שמאמר המחקר הנלווה מציב את Molt כתשתית מחקר ולא כשירות הדרכה לייצור, והחומרה היא שומר הסף האמיתי. המתכונים שנשלחו מניחים 2 צמתים של 8 H100 GPUs, מפוצלים 8 לאימון ו-8 להפעלה. זה מציב אותו בהישג יד של מעבדות חזיתיות וצמודות לגבולות, סטארטאפים ממומנים היטב העוסקים לאחר הכשרה, קבוצות מחקר בינה מלאכותית ארגונית וקבוצות אקדמיות עם גישה מרובה צמתים H100 או H200.

מורכב, לא מזולג

הארכיטקטורה של מולט מרכיבה שלושה כלים קיימים מבלי לסלק אף אחד מהם, כך ששיפורים במעלה הזרם מגיעים כסיכת מיכל ולא כבסיס כואב. הוא משתמש ב-Ray עבור מיקום ותורים אסינכרוניים, vLLM עבור השקה, ו-NVIDIA AutoModel עם FSDP2 לאימון. זמן הריצה מורכב ממאגר סוכנים, קבוצה של מנועי vLLM מאחורי נתב בקשות ושחקן מדיניות יחיד שניתן לאמן. בריכת זרימה שומרת על קבוצות מהירות בטיסה כך שהמנועים לעולם לא מתרוקנים בזמן שהשחקן מתאמן.

תכונה הנקראת השקה חלקית היא מרכזית ליעילות. כאשר המדיניות מתעדכנת, מולט משהה את המנועים, משדר את הרסיסים המעודכנים של השחקן דרך NCCL ישירות לכל מנוע, ומחדש את הבקשות שנשמרו במקום לזרוק אותן. זה מונע את הדפוס הבזבזני של זריקת השקות שנמצאות בתהליך בכל פעם שהדגם משתנה.

מודול אחד, שני טפסי סוכן

ריצת RL ב-Molt שמה למודול Python יחיד שמייצא AgentRunner, וכל השאר - כולל פונקציית התגמול - הוא קוד רגיל. המסגרת תומכת בשתי צורות. עם Env, המסגרת היא הבעלים של לולאת ה-LLM בתוך `step()` מיושר לגימנסיה, אשר מתאימה לדפוס למידה-חיזוק המוכר. עם ChatAgent, המשתמש הוא הבעלים של הלולאה דרך מניות OpenAI או Anthropic SDK, מה שהופך את זה לפשוט לעטוף סוכן קיים.

כדי לגשר על שניהם, מולט משיק שרת loopback שמדבר את שני פרוטוקולי החוט, וכל בקשה מפוענחת בצד השרת לצבירה אחת מדויקת. כאשר סוכן בעל אופק ארוך דוחס את ההקשר שלו ומשכתב מחדש את הקידומת - פעולה נפוצה עבור סוכנים שפועלים בסיבובים רבים - השרת אוטם את הקטע הנוכחי ופותח אחד חדש באופן אוטומטי. זהו סוג של פרטי אינסטלציה שקובעים אם ריצת RL אגנטית נכונה בפועל או סתם נראית נכונה.

שלושה משתנה תקינות

העיצוב של מולט מאורגן סביב שלושה איורי נכונות המטפלים בכשלים העדינים של אימון סוכן אסינכרוני. זהות אסימון פירושה מזהי אסימון מדוגמים מגדירים את המסלול, לא תמליל שאוזן מחדש - חשוב כי תפירת טקסט חזרה לאסימונים יכולה לשנות את הנתונים בשקט. סמנטיקה של גרסת מדיניות מבטיחה שאסימונים שניתנים לאימון ישמרו על הסתברויות יומן ההתנהגות-מדיניות שלהם, עם שימוש אסינכרוני מתוקן לכל אסימון מאחורי שער ברמת רצף. עקביות קדימה דורשת שמנוע ההפעלה והשחקן האימון יסכימו על סמנטיקה של המודל.

הנתון האחרון הזה חשוב ביותר עבור מדיניות תערובת של מומחים (MoE), שנפוצה יותר ויותר. נתבי ההשקה וההדרכה בוחרים מומחים באופן עצמאי, והבדלים מספריים קטנים יכולים להפוך את הבחירות המובילות, וליצור אי התאמה בין מה שנדגם לבין מה שמתאמן עליו. Molt מטפל בזה עם השקה חוזרת של ניתוב: vLLM מחזירה את מזהי המומחה לכל אסימון שלה, והעברת האימון קדימה משחזרת את החלטות הניתוב המדויקות האלה במקום לגזור אותן מחדש.

למה זה מיועד

המתכונים ומקרי השימוש שנשלחו מצביעים על המקום שבו NVIDIA מצפה ש-Molt יאומץ: סוכני שימוש בכלים מרובי פניות, סוכני ביצוע קוד, סביבות שפת חזון (המסגרת כוללת מתכון geo3k שנשלח), לולאות תגמול של LLM-as-judge וזיקוק לפי מדיניות על מודל סטודנט קטן יותר. אלו הם בדיוק עומסי העבודה שהניעו את הזינוק ב-RL הסוכן ברחבי התעשייה, וכל אחד מהם ידוע לשמצה בקושי להגיע ממש תחת תנאי ההפצה החלקית, הדגימה הא-סינכרית שהכשרה אמיתית כופה.

האות הרחב יותר הוא ש-NVIDIA משקיעה לא רק במעבדי ה-GPU שמכשירים סוכנים, אלא בערימת התוכנה שבה משתמשים החוקרים לבנייתם. על ידי שמירה על בסיס הקוד קטן וקריא - ועיצובו באופן מפורש כך שעוזר קידוד בינה מלאכותית יוכל לשנות אותו - Molt משקף הימור שהעתיד של כלי RL סוכן יפותח יחד עם המודלים המשתמשים בו.

הישאר לפני AI

למידע נוסף על המסגרות המעצבות מחדש את האופן שבו סוכני גבול מאומנים, עקוב אחר המרכז שלנו עבור הפיתוחים האחרונים של AI.

קרא עוד חדשות AI →