أصدرت شركة AMD Instella-MoE-16B-A3B، وهو نموذج لغة مفتوح بالكامل لمزيج من الخبراء (MoE) تم تدريبه من الصفر بمفرده وحدات معالجة الرسوميات Instinct MI300X وMI325X. يمثل الإصدار بيانًا عن السيليكون بقدر ما يتعلق بالبرمجيات: من خلال نشر كل مرحلة تدريب، وخليط البيانات، والتكوين، تثبت AMD أن مسرعات مراكز البيانات الخاصة بها يمكنها بناء نماذج مفتوحة من الدرجة الأولى من البداية إلى النهاية - وهي المنطقة التي سيطرت عليها Nvidia منذ فترة طويلة. إنها إحدى الحركات الأكثر وضوحًا في سباق الوزن المفتوح الذي نتتبعه في أخبار الذكاء الاصطناعي العاجلة.

تصميم صغير ولكن واسع النطاق يجمع بين الخبراء

وفقًا للتحليل التفصيلي في MarkTechPost، فإن Instella-MoE-16B-A3B هو نموذج MoE لوحدة فك التشفير فقط مع 16 مليار معلمة إجمالية تنشط 2.8 مليار فقط لكل رمز. تستخدم كل طبقة من طبقاتها الـ 27 خبيرين مشتركين بالإضافة إلى 6 خبراء موجهين تم اختيارهم من مجموعة مكونة من 64 ، بحجم مخفي يبلغ 2048، و16 رأس انتباه، ومفردات مكونة من 128,896 رمزًا. يتم استخدام هدف التنبؤ بالرموز المتعددة أثناء التدريب المسبق وفي منتصف التدريب.

هذه البنية المتناثرة - حيث "تستيقظ" شريحة صغيرة من الشبكة لكل رمز مميز - هي نفس منطق الكفاءة وراء النماذج المفتوحة الرخيصة التشغيل التي أعادت تشكيل السوق خلال العام الماضي. قامت AMD بتدريب النموذج على 7.1 تريليون رمز مستمدة من مجموعات مفتوحة بما في ذلك Nemotron-CC-v2 وMegaMath وFineMath وRefineCode وTxT360، ثم أجرت مرحلة منتصف التدريب على Dolma3 Dolmino 100B عبر ثلاثة متغيرات للبيانات تم دمجها بواسطة متوسط ​​الوزن. تعمل مرحلة السياق الطويل على تمديد النافذة من 4K إلى 64 ألف رمز باستخدام YaRN.

ابتكاران على مستوى النظام

يحمل الإصدار خيارين هيكليين تبرزهما AMD باعتبارهما انتصارات هندسية ذات مغزى. الأول هو الانتباه الكامن متعدد الرؤوس (Gated MLA)، الذي يضيف بوابة إخراج تعلمية خفيفة الوزن إلى الانتباه الكامن متعدد الرؤوس. يشتق الإسقاط الخطي المخصص بوابة مكيفة للإدخال يتم تطبيقها بشكل مضاعف قبل إسقاط الإخراج.

والثاني، FarSkip-Collective، هو مخطط اتصال يمرر عمليات التنشيط القديمة والجزئية إلى وزارة التربية والتعليم وطبقات الاهتمام، مما يتداخل مع التواصل المتوازي بين الخبراء والحسابات. أبلغت AMD عن 12.7% تسريع ما قبل التدريب وما يصل إلى 39.2% انخفاض في الوقت اللازم لأول رمز مميز عند الخدمة بتوازي الخبراء. بالنسبة لشركة تروج لأجهزتها على أساس السعر والأداء، فهذه هي بالضبط الأرقام التي يرغب المشتري في رؤيتها.

معايير قوية لنموذج مفتوح بالكامل

على نقطة التفتيش الأساسية، يبلغ متوسط Instella-MoE 76.7 عبر التقييمات، والتي تسميها AMD أقوى نتيجة بين النماذج المفتوحة بالكامل. وهذا يضعه في المقدمة على Moonlight-16B-A3B (76.2)، وSmolLM3-3B-Base (70.5)، وOLMo-3-7B (70.1)، وOLMoE-1B-7B (61.9)، على الرغم من أنه لا يزال يتخلف عن Qwen3.5-4B-Base (79.5). يتقدم على WinoGrande بدرجة 86.5 وينشر 65.7 على HumanEval+. بالنسبة للمهام ذات السياق الطويل، يبلغ متوسطها 41.5 على الخوذة و79.4 على المسطرة.

ما بعد التدريب يزيد من حدة النموذج. ارتفع متوسط ​​الدرجات من 71.58 بعد الضبط الدقيق تحت الإشراف إلى 72.67 بعد DPO و73.22 في تكوين "Think"، متغلبًا على Olmo3-7B-Think (71.97)، وGemma-4-E4B Think (70.47)، وQwen3.5-4B (69.73). عند اتباع التعليمات، ترتفع قيمة IFEval من 77.08 إلى 83.70.

وصفة ما بعد التدريب هي في حد ذاتها ملحوظة. بعد SFT على خلائط Dolci-Think-SFT-7B وNemotron، تقوم AMD بتشغيل DPO مع تحديثات انحياز جهاز التوجيه وتعطيل فقدان موازنة التحميل الإضافي لتجنب التدهور. يتم بعد ذلك مواصلة التعلم المعزز داخل إطار عمل Miles الخاص بـ AMD: 1400 خطوة من RLVR لمتابعة التعليمات، متبوعة بـ التقطير حسب السياسة للمعلمين المتعددين الذي يؤدي إلى تقليص المكاسب مرة أخرى دون التضحية بأداء الرياضيات أو التعليمات البرمجية.

مشكلة الترخيص

هناك تحذير مهم للمستخدمين التجاريين. يتم شحن أوزان النموذج بموجب ترخيص ResearchRAIL، الذي يقيد الاستخدام للأغراض الأكاديمية والبحثية فقط، لذا فإن Instella-MoE ليس نموذجًا مباشرًا لعمليات نشر الإنتاج. ومع ذلك، فإن قاعدة التعليمات البرمجية للتدريب مرخصة من معهد ماساتشوستس للتكنولوجيا، ويمكن القول إن هذا هو الأصل الأكثر قابلية لإعادة الاستخدام - فهو يمنح المختبرات الأخرى مخططًا ملموسًا للتدريب على معالج AMD silicon.

قامت AMD بنشر الأوزان الكاملة من كل مرحلة تدريب، ومزيج البيانات، وتكوينات التدريب، وكود الاستدلال عبر مجموعة Hugging Face، ومستودع GitHub، ومدونة ROCm الخاصة بها. هذا المستوى من الانفتاح - مرحلة التدريب بمرحلة التدريب، وليس مجرد نقطة تفتيش نهائية - هو ما يميز الإصدار "المفتوح بالكامل" عن الإصدار النموذجي ذو الوزن المفتوح.

لماذا يهم هذا الأمر خارج نطاق المعايير؟

المعنى الفرعي للإصدار هو منافسة الأجهزة. كان نظام CUDA البيئي من Nvidia ووحدات معالجة الرسوميات من فئة H100 بمثابة الركيزة الافتراضية للتدريب على النماذج الحدودية، وقد أمضى المنافسون سنوات في محاولة إثبات قدرة مسرعاتهم على التعامل مع حزمة التدريب الكاملة. إن Instella-MoE عبارة عن قطعة أثرية ذات مصداقية يمكن لخط AMD's Instinct - الذي تم نشره بالفعل على نطاق واسع بواسطة المقياس الفائق والمختبرات الوطنية - أن يفعل أكثر من مجرد استنتاج أعباء العمل. إذا تمكنت AMD من الاستمرار في إنتاج نماذج مفتوحة تنافسية مدربة على أجهزتها الخاصة، فهذا سيعزز حالة المشترين الذين يتطلعون إلى كسر قبضة Nvidia على سوق حوسبة الذكاء الاصطناعي.

بالنسبة للباحثين، فإن عامل الجذب هو الشفافية. تظل الإصدارات المفتوحة بالكامل التي توثق مزيج البيانات، ومزيج التدريب المتوسط، واستراتيجية التقطير، ومنهج RL نادرة، وتسمح للمجتمع بتدقيق المطالبات وإعادة إنتاجها بدلاً من أخذ كلمة المختبر على محمل الجد. تنضم Instella-MoE إلى قائمة صغيرة ولكنها متنامية - بما في ذلك نماذج Instella الكثيفة السابقة من AMD - مما يدفع هذا المعيار إلى الأمام.

البقاء في صدارة الذكاء الاصطناعي

هل تريد هذا النوع من التغطية الفنية العميقة فور حدوثها؟ قم بوضع إشارة مرجعية على مركزنا للاطلاع على أحدث تطورات الذكاء الاصطناعي ولا يفوتك أي إصدار أبدًا.

اقرأ المزيد من أخبار الذكاء الاصطناعي →