AMD Instella-MoE-16B-A3B را منتشر کرده است، یک مدل زبان کاملاً باز ترکیبی از متخصصان (MoE) که از ابتدا با پردازنده‌های گرافیکی Instinct MI300X و MI325X خود آموزش داده شده است. این نسخه به همان اندازه که در مورد نرم افزار است، بیانیه ای در مورد سیلیکون است: با انتشار هر مرحله آموزشی، ترکیب داده ها و پیکربندی، AMD نشان می دهد که شتاب دهنده های مرکز داده آن می توانند مدل های باز کلاس مرزی را از انتها به انتها بسازند - قلمرو Nvidia مدت هاست که بر آن تسلط داشته است. این یکی از حرکت‌های برجسته‌تر در مسابقه وزن آزاد است که ما در [اخبار فوری هوش مصنوعی] (https://aibuzzwire.news) دنبال می‌کنیم.

طراحی کوچک اما گسترده با ترکیبی از متخصصان

بر اساس تفصیلی در MarkTechPost، Instella-MoE-16B-A3B یک مدل MoE فقط رمزگشا با 16 میلیارد کل پارامتر است که تنها 2.8 میلیارد در هر توکن فعال می کند. هر یک از 27 لایه آن از 2 متخصص مشترک به اضافه 6 متخصص مسیریابی انتخاب شده از مجموعه 64، با اندازه پنهان 2048، 16 سر توجه و واژگان 128896 توکن استفاده می کند. هدف پیش‌بینی چند نشانه‌ای در هر دو مرحله قبل از تمرین و در اواسط تمرین استفاده می‌شود.

این معماری پراکنده - جایی که یک تکه کوچک از شبکه برای هر توکن "بیدار می شود" - همان منطق کارایی پشت مدل های باز ارزان برای اجرا است که بازار را در سال گذشته تغییر داده است. AMD این مدل را بر روی 7.1 تریلیون توکن برگرفته از مجموعه های باز از جمله Nemotron-CC-v2، MegaMath، FineMath، RefineCode و TxT360 آموزش داد، سپس یک مرحله آموزشی میانی را در Dolma3 Dolmino 100B در سه نوع داده با وزن بیشتر اجرا کرد. یک مرحله با زمینه طولانی با استفاده از YaRN پنجره را از 4K به 64K توکن گسترش می دهد.

دو نوآوری در سطح سیستم

این نسخه دارای دو انتخاب ساختاری است که AMD به عنوان برنده مهندسی معنادار برجسته می کند. اولین مورد توجه پنهان چند سر دروازه ای (Gated MLA) است که یک دروازه خروجی سبک وزن به توجه نهفته چند سر اضافه می کند. یک طرح خطی اختصاصی یک دروازه شرطی ورودی استخراج می کند که قبل از طرح ریزی خروجی به صورت ضربی اعمال می شود.

دومی، FarSkip-Collective، یک طرح اتصال است که فعال‌سازی‌های منسوخ و جزئی را به لایه‌های MOE و توجه منتقل می‌کند، و ارتباطات موازی متخصص با محاسبات همپوشانی دارند. AMD یک 12.7٪ افزایش سرعت قبل از تمرین و تا 39.2٪ کاهش در زمان تا اولین توکن را هنگام ارائه با موازی کاری خبره گزارش می کند. برای شرکتی که سخت افزار خود را بر اساس قیمت-عملکرد ارائه می دهد، اینها دقیقاً اعدادی هستند که یک خریدار می خواهد ببیند.

معیارهای قوی برای یک مدل کاملا باز

در نقطه بازرسی پایه، Instella-MoE به طور میانگین 76.7 در ارزیابی ها است که AMD آن را قوی ترین نتیجه در بین مدل های کاملاً باز می نامد. این آن را از Moonlight-16B-A3B (76.2)، SmolLM3-3B-Base (70.5)، OLMo-3-7B (70.1) و OLMoE-1B-7B (61.9) جلوتر قرار می دهد، اگرچه همچنان از Qwen3.5-4B-Base (79.5) عقب است. در WinoGrande با امتیاز 86.5 پیشتاز است و در HumanEval+ امتیاز 65.7 را دارد. برای کارهای طولانی مدت، میانگین 41.5 در HELMET و 79.4 در RULER است.

پس از آموزش مدل را بیشتر تیز می کند. میانگین نمرات از 71.58 پس از تنظیم دقیق به 72.67 پس از DPO و 73.22 در پیکربندی "Think" صعود می کند که Olmo3-7B-Think (71.97)، Gemma-4-E4B Think (70.47) و Qwen3-7.7.3. با پیروی از دستورالعمل، IFEval از 77.08 به 83.70 افزایش می یابد.

دستور العمل بعد از آموزش خود قابل توجه است. پس از SFT در مخلوط‌های Dolci-Think-SFT-7B و Nemotron، AMD DPO را با به‌روزرسانی‌های سوگیری روتر و از دست دادن تعادل بار کمکی غیرفعال می‌کند تا از تخریب جلوگیری کند. سپس یادگیری تقویتی در چارچوب Miles AMD ادامه می‌یابد: 1400 مرحله RLVR که دستورالعمل‌ها را دنبال می‌کند، و به دنبال آن تقطیر روی خط مشی چند معلمی که سود را بدون کاهش عملکرد ریاضی یا کد باز می‌گرداند.

گرفتن مجوز

یک هشدار وجود دارد که برای کاربران تجاری مهم است. وزن مدل تحت مجوز ResearchRAIL ارسال می شود، که استفاده را فقط برای اهداف آکادمیک و تحقیقاتی محدود می کند، بنابراین Instella-MoE یک مدل حذفی برای استقرار تولید نیست. با این حال، پایگاه کد آموزشی دارای مجوز MIT است، و مسلماً این دارایی قابل استفاده مجددتر است - به آزمایشگاه های دیگر طرحی مشخص برای آموزش روی سیلیکون AMD می دهد.

AMD وزن‌های کامل هر مرحله آموزشی، ترکیب داده‌ها، تنظیمات آموزشی و کد استنتاج را در مجموعه Hugging Face، یک مخزن GitHub و وبلاگ ROCm خود منتشر کرده است. این سطح از باز بودن - مرحله به مرحله آموزش، نه فقط یک نقطه بازرسی نهایی - چیزی است که یک انتشار "کاملا باز" را از یک نسخه با وزن باز معمولی متمایز می کند.

چرا این فراتر از معیارها مهم است

زیرمتن انتشار، رقابت سخت افزاری است. اکوسیستم CUDA انویدیا و پردازنده‌های گرافیکی کلاس H100 بستر پیش‌فرض برای آموزش مدل‌های مرزی بوده‌اند، و رقبای سال‌ها تلاش کرده‌اند تا ثابت کنند شتاب‌دهنده‌هایشان می‌توانند پشته آموزشی کامل را اداره کنند. Instella-MoE مصنوع معتبری است که خط Instinct AMD - که قبلاً در مقیاس بزرگ توسط hyperscalers و آزمایشگاه‌های ملی مستقر شده است - می‌تواند بیش از حجم کاری استنتاج انجام دهد. اگر AMD بتواند به تولید مدل‌های باز رقابتی که بر روی سخت‌افزار خود آموزش داده شده‌اند ادامه دهد، این موضوع برای خریدارانی که به دنبال شکستن سلطه انویدیا در بازار محاسبات هوش مصنوعی هستند، تقویت می‌شود.

برای محققان، جذابیت شفافیت است. نسخه‌های کاملاً باز که ترکیب داده‌ها، ترکیب میان دوره‌های آموزشی، استراتژی تقطیر و برنامه درسی RL را مستند می‌کنند، نادر باقی می‌مانند، و به جامعه اجازه می‌دهند که ادعاها را بررسی و بازتولید کند نه اینکه حرف آزمایشگاه را قبول کند. Instella-MoE به فهرست کوچک اما رو به رشدی می‌پیوندد - از جمله مدل‌های متراکم قبلی خود AMD - این استاندارد را به جلو می‌برد.

از هوش مصنوعی جلوتر بمانید

آیا این نوع پوشش فنی عمیق را می خواهید؟ مرکز ما را برای آخرین تحولات هوش مصنوعی علامت گذاری کنید و هرگز نسخه ای را از دست ندهید.

اخبار هوش مصنوعی را بیشتر بخوانید →