עיצוב קטן-אך רחב של מומחים
על פי פירוט מפורט ב-MarkTechPost, Instella-MoE-16B-A3B הוא דגם MoE מפענח בלבד עם 16 מיליארד פרמטרים בסך הכל שמפעיל רק 2.8 מיליארד לכל אסימון. כל אחת מ-27 השכבות שלה משתמשת ב-2 מומחים משותפים בתוספת 6 מומחים מנותבים שנבחרו מתוך מאגר של 64, עם גודל נסתר של 2048, 16 ראשי קשב ואוצר מילים של 128,896 אסימונים. מטרת חיזוי מרובה אסימונים משמשת הן במהלך אימון קדם והן באמצע האימון.
אותה ארכיטקטורה דלילה - שבה חלק זעיר מהרשת "מתעורר" עבור כל אסימון - היא אותו היגיון יעילות מאחורי הדגמים הפתוחים הזולים להפעלה שעיצבו מחדש את השוק בשנה האחרונה. AMD אימנה את הדגם על 7.1 טריליון אסימונים שנלקחו מגוף פתוח כולל Nemotron-CC-v2, MegaMath, FineMath, RefineCode ו-TxT360, ולאחר מכן ריצה שלב אימון באמצע על Dolma3 Dolmino 100B על פני שלוש גרסאות נתונים שמוזגו לפי ממוצע משקל. שלב ארוך הקשר מותח את החלון מ-4K ל-64K אסימונים באמצעות YaRN.
שני חידושים ברמת מערכות
המהדורה נושאת שתי אפשרויות מבניות ש-AMD מדגישה כמנצחת הנדסה משמעותית. הראשון הוא Gated Multi-head Latent Attention (Gated MLA), המוסיף שער פלט נלמד קל משקל ל-Multi-head Latent Attention. הקרנה ליניארית ייעודית גוזרת שער מותנה בקלט שמופעל באופן כפול לפני הקרנת הפלט.
השנייה, FarSkip-Collective, היא סכימת קישוריות המעבירה הפעלות מיושנות וחלקיות לשכבות ה-MoE ותשומת הלב, וחופפת תקשורת מקבילה של מומחה עם חישוב. AMD מדווחת על עלייה של 12.7% לפני אימון ועד 39.2% הפחתה בזמן עד האסימון הראשון בהגשה עם מקביליות מומחים. עבור חברה שמציגה את החומרה שלה על מחיר-ביצועים, אלה בדיוק המספרים שהקונה רוצה לראות.
אמות מידה חזקות למודל פתוח לחלוטין
בנקודת הבידוק הבסיסית, Instella-MoE עומד על ממוצע של 76.7 על פני הערכות, אשר AMD מכנה התוצאה החזקה ביותר מבין דגמים פתוחים לחלוטין. זה שם אותו לפני Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1), ו- OLMoE-1B-7B (61.9), אם כי הוא עדיין עקבי אחרי Qwen3.5-4B-Base (79.5). הוא מוביל ב-WinoGrande עם ציון של 86.5 ו-65.7 ב-HumanEval+. עבור משימות ארוכות הקשר, הממוצע הוא 41.5 ב-HELMET ו-79.4 ב-RULER.
לאחר אימון מחדד את הדגם עוד יותר. הציונים הממוצעים מטפסים מ-71.58 לאחר כוונון עדין מפוקח ל-72.67 לאחר DPO ו-73.22 בתצורת "Think", כשהם מנצחים את Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47) ו-Qwen3.5-4B (69.73). לפי ההוראות, IFEval עולה מ-77.08 ל-83.70.
המתכון שלאחר האימון בולט בעצמו. לאחר SFT על תערובות Dolci-Think-SFT-7B ו-Nemotron, AMD מפעילה DPO עם עדכוני הטיית נתב ואובדן איזון עומסים עזר מושבת כדי למנוע השפלה. לאחר מכן למידת החיזוק ממשיכה בתוך מסגרת המיילים של AMD: 1,400 שלבים של RLVR בעקבות הוראה, ולאחר מכן זיקוק על-פי מדיניות מרובה מורים שמקפל את הרווח חזרה פנימה מבלי להקריב את ביצועי המתמטיקה או הקוד.
תפיסת הרישוי
יש אזהרה שחשובה למשתמשים מסחריים. משקלי הדגם נשלחים תחת רישיון ResearchRAIL, המגביל את השימוש למטרות אקדמיות ומחקריות בלבד, כך ש-Instella-MoE אינו מודל נפתח לפריסות ייצור. עם זאת, בסיס הקוד של ההדרכה הוא מורשה MIT, וזה ללא ספק הנכס הרב יותר לשימוש חוזר - הוא נותן למעבדות אחרות תוכנית קונקרטית לאימון על סיליקון AMD.
AMD פרסמה את המשקולות המלאות מכל שלב אימון, תערובות הנתונים, תצורות האימון וקוד ההסקה על פני אוסף Hugging Face, מאגר GitHub והבלוג ROCm שלה. רמת הפתיחות הזו - אימון שלב אחר שלב, לא רק מחסום אחרון - היא מה שמבדיל בין שחרור "פתוח לחלוטין" לבין שחרור טיפוסי במשקל פתוח.
למה זה חשוב מעבר למדדים
הסאבטקסט של המהדורה הוא תחרות חומרה. המערכת האקולוגית של Nvidia ו-GPUs בדרגת H100 היו מצע ברירת המחדל לאימון מודלים חזיתיים, והמאתגרים בילו שנים בניסיון להוכיח שהמאיצים שלהם יכולים להתמודד עם ערימת האימונים המלאה. Instella-MoE הוא חפץ אמין שקו ה-Instinct של AMD - שכבר נפרס בקנה מידה על ידי מכשירי היפר-scalers ומעבדות לאומיות - יכול לעשות יותר מאשר עומסי עבודה. אם AMD יכולה להמשיך לייצר דגמים פתוחים תחרותיים המאומנים על החומרה שלה, זה מחזק את המקרה עבור קונים המעוניינים לשבור את האחיזה של Nvidia בשוק מחשוב הבינה המלאכותית.
עבור החוקרים, הערעור הוא השקיפות. מהדורות פתוחות לחלוטין שמתעדות את תמהיל הנתונים, את תערובת האמצע, אסטרטגיית הזיקוק ותוכנית הלימודים של RL נותרו נדירות, והן מאפשרות לקהילה לבדוק ולשחזר טענות במקום לקבל את מילה של מעבדה. Instella-MoE מצטרף לסגל קטן אך הולך וגדל - כולל הדגמים הקודמים של Instella הצפופים של AMD - שדוחף את הסטנדרט הזה קדימה.
הישאר לפני AI
רוצה סוג זה של סיקור טכני עמוק בזמן שהוא קורה? הוסף סימניה למרכז שלנו עבור הפיתוחים האחרונים של AI ולעולם אל תחמיצו מהדורה.
קרא עוד חדשות AI →

