طراحی کوچک اما گسترده با ترکیبی از متخصصان
بر اساس تفصیلی در MarkTechPost، Instella-MoE-16B-A3B یک مدل MoE فقط رمزگشا با 16 میلیارد کل پارامتر است که تنها 2.8 میلیارد در هر توکن فعال می کند. هر یک از 27 لایه آن از 2 متخصص مشترک به اضافه 6 متخصص مسیریابی انتخاب شده از مجموعه 64، با اندازه پنهان 2048، 16 سر توجه و واژگان 128896 توکن استفاده می کند. هدف پیشبینی چند نشانهای در هر دو مرحله قبل از تمرین و در اواسط تمرین استفاده میشود.
این معماری پراکنده - جایی که یک تکه کوچک از شبکه برای هر توکن "بیدار می شود" - همان منطق کارایی پشت مدل های باز ارزان برای اجرا است که بازار را در سال گذشته تغییر داده است. AMD این مدل را بر روی 7.1 تریلیون توکن برگرفته از مجموعه های باز از جمله Nemotron-CC-v2، MegaMath، FineMath، RefineCode و TxT360 آموزش داد، سپس یک مرحله آموزشی میانی را در Dolma3 Dolmino 100B در سه نوع داده با وزن بیشتر اجرا کرد. یک مرحله با زمینه طولانی با استفاده از YaRN پنجره را از 4K به 64K توکن گسترش می دهد.
دو نوآوری در سطح سیستم
این نسخه دارای دو انتخاب ساختاری است که AMD به عنوان برنده مهندسی معنادار برجسته می کند. اولین مورد توجه پنهان چند سر دروازه ای (Gated MLA) است که یک دروازه خروجی سبک وزن به توجه نهفته چند سر اضافه می کند. یک طرح خطی اختصاصی یک دروازه شرطی ورودی استخراج می کند که قبل از طرح ریزی خروجی به صورت ضربی اعمال می شود.
دومی، FarSkip-Collective، یک طرح اتصال است که فعالسازیهای منسوخ و جزئی را به لایههای MOE و توجه منتقل میکند، و ارتباطات موازی متخصص با محاسبات همپوشانی دارند. AMD یک 12.7٪ افزایش سرعت قبل از تمرین و تا 39.2٪ کاهش در زمان تا اولین توکن را هنگام ارائه با موازی کاری خبره گزارش می کند. برای شرکتی که سخت افزار خود را بر اساس قیمت-عملکرد ارائه می دهد، اینها دقیقاً اعدادی هستند که یک خریدار می خواهد ببیند.
معیارهای قوی برای یک مدل کاملا باز
در نقطه بازرسی پایه، Instella-MoE به طور میانگین 76.7 در ارزیابی ها است که AMD آن را قوی ترین نتیجه در بین مدل های کاملاً باز می نامد. این آن را از Moonlight-16B-A3B (76.2)، SmolLM3-3B-Base (70.5)، OLMo-3-7B (70.1) و OLMoE-1B-7B (61.9) جلوتر قرار می دهد، اگرچه همچنان از Qwen3.5-4B-Base (79.5) عقب است. در WinoGrande با امتیاز 86.5 پیشتاز است و در HumanEval+ امتیاز 65.7 را دارد. برای کارهای طولانی مدت، میانگین 41.5 در HELMET و 79.4 در RULER است.
پس از آموزش مدل را بیشتر تیز می کند. میانگین نمرات از 71.58 پس از تنظیم دقیق به 72.67 پس از DPO و 73.22 در پیکربندی "Think" صعود می کند که Olmo3-7B-Think (71.97)، Gemma-4-E4B Think (70.47) و Qwen3-7.7.3. با پیروی از دستورالعمل، IFEval از 77.08 به 83.70 افزایش می یابد.
دستور العمل بعد از آموزش خود قابل توجه است. پس از SFT در مخلوطهای Dolci-Think-SFT-7B و Nemotron، AMD DPO را با بهروزرسانیهای سوگیری روتر و از دست دادن تعادل بار کمکی غیرفعال میکند تا از تخریب جلوگیری کند. سپس یادگیری تقویتی در چارچوب Miles AMD ادامه مییابد: 1400 مرحله RLVR که دستورالعملها را دنبال میکند، و به دنبال آن تقطیر روی خط مشی چند معلمی که سود را بدون کاهش عملکرد ریاضی یا کد باز میگرداند.
گرفتن مجوز
یک هشدار وجود دارد که برای کاربران تجاری مهم است. وزن مدل تحت مجوز ResearchRAIL ارسال می شود، که استفاده را فقط برای اهداف آکادمیک و تحقیقاتی محدود می کند، بنابراین Instella-MoE یک مدل حذفی برای استقرار تولید نیست. با این حال، پایگاه کد آموزشی دارای مجوز MIT است، و مسلماً این دارایی قابل استفاده مجددتر است - به آزمایشگاه های دیگر طرحی مشخص برای آموزش روی سیلیکون AMD می دهد.
AMD وزنهای کامل هر مرحله آموزشی، ترکیب دادهها، تنظیمات آموزشی و کد استنتاج را در مجموعه Hugging Face، یک مخزن GitHub و وبلاگ ROCm خود منتشر کرده است. این سطح از باز بودن - مرحله به مرحله آموزش، نه فقط یک نقطه بازرسی نهایی - چیزی است که یک انتشار "کاملا باز" را از یک نسخه با وزن باز معمولی متمایز می کند.
چرا این فراتر از معیارها مهم است
زیرمتن انتشار، رقابت سخت افزاری است. اکوسیستم CUDA انویدیا و پردازندههای گرافیکی کلاس H100 بستر پیشفرض برای آموزش مدلهای مرزی بودهاند، و رقبای سالها تلاش کردهاند تا ثابت کنند شتابدهندههایشان میتوانند پشته آموزشی کامل را اداره کنند. Instella-MoE مصنوع معتبری است که خط Instinct AMD - که قبلاً در مقیاس بزرگ توسط hyperscalers و آزمایشگاههای ملی مستقر شده است - میتواند بیش از حجم کاری استنتاج انجام دهد. اگر AMD بتواند به تولید مدلهای باز رقابتی که بر روی سختافزار خود آموزش داده شدهاند ادامه دهد، این موضوع برای خریدارانی که به دنبال شکستن سلطه انویدیا در بازار محاسبات هوش مصنوعی هستند، تقویت میشود.
برای محققان، جذابیت شفافیت است. نسخههای کاملاً باز که ترکیب دادهها، ترکیب میان دورههای آموزشی، استراتژی تقطیر و برنامه درسی RL را مستند میکنند، نادر باقی میمانند، و به جامعه اجازه میدهند که ادعاها را بررسی و بازتولید کند نه اینکه حرف آزمایشگاه را قبول کند. Instella-MoE به فهرست کوچک اما رو به رشدی میپیوندد - از جمله مدلهای متراکم قبلی خود AMD - این استاندارد را به جلو میبرد.
از هوش مصنوعی جلوتر بمانید
آیا این نوع پوشش فنی عمیق را می خواهید؟ مرکز ما را برای آخرین تحولات هوش مصنوعی علامت گذاری کنید و هرگز نسخه ای را از دست ندهید.
اخبار هوش مصنوعی را بیشتر بخوانید →

