AMD ได้เปิดตัว Instella-MoE-16B-A3B ซึ่งเป็นโมเดลภาษา Mixture-of-Experts (MoE) แบบเปิดเต็มรูปแบบที่ได้รับการฝึกอบรมตั้งแต่ต้นด้วยตัวมันเอง Instinct MI300X และ MI325X GPUs การเปิดตัวครั้งนี้เป็นการกล่าวถึงซิลิคอนพอๆ กับที่เป็นเรื่องเกี่ยวกับซอฟต์แวร์ ด้วยการเผยแพร่ทุกขั้นตอนการฝึกอบรม การผสมข้อมูล และการกำหนดค่า AMD กำลังแสดงให้เห็นว่าตัวเร่งศูนย์ข้อมูลของตนสามารถสร้างโมเดลเปิดระดับแนวหน้าตั้งแต่ต้นจนจบ ซึ่งเป็นดินแดนที่ Nvidia ครอบงำมายาวนาน นี่เป็นหนึ่งในการเคลื่อนไหวที่ชัดเจนมากขึ้นในการแข่งขันรุ่นเปิดที่เราติดตามใน [ข่าว AI ด่วน] (https://aibuzzwire.news)

การออกแบบโดยผู้เชี่ยวชาญที่มีขนาดเล็กแต่กว้าง

ตามรายละเอียดใน MarkTechPost Instella-MoE-16B-A3B เป็นรุ่น MoE ที่ใช้ตัวถอดรหัสเท่านั้น โดยมี พารามิเตอร์ทั้งหมด 16 พันล้านพารามิเตอร์ที่เปิดใช้งานเพียง 2.8 พันล้านต่อโทเค็น แต่ละเลเยอร์ทั้ง 27 เลเยอร์ใช้ ผู้เชี่ยวชาญที่ใช้ร่วมกัน 2 คน บวกกับผู้เชี่ยวชาญที่กำหนดเส้นทาง 6 คน ที่เลือกจากกลุ่ม 64 โดยมีขนาดซ่อนอยู่ที่ 2048 หัวความสนใจ 16 หัว และคำศัพท์ 128,896 โทเค็น วัตถุประสงค์ การทำนายโทเค็นหลายโทเค็น ถูกใช้ระหว่างทั้งก่อนการฝึกและการฝึกกลางคัน

สถาปัตยกรรมที่กระจัดกระจายนั้น — โดยที่ส่วนเล็กๆ ของเครือข่าย “ตื่น” สำหรับแต่ละโทเค็น — เป็นตรรกะด้านประสิทธิภาพแบบเดียวกันที่อยู่เบื้องหลังโมเดลแบบเปิดราคาถูกที่ดำเนินการซึ่งได้เปลี่ยนโฉมหน้าตลาดในปีที่ผ่านมา AMD ฝึกฝนโมเดลนี้ด้วย 7.1 ล้านล้านโทเค็น ที่ดึงมาจากคลังข้อมูลแบบเปิด รวมถึง Nemotron-CC-v2, MegaMath, FineMath, RefineCode และ TxT360 จากนั้นจึงดำเนินการระยะการฝึกกลางบน Dolma3 Dolmino 100B ผ่านตัวแปรข้อมูลสามตัวที่ผสานเข้าด้วยกันโดยการเฉลี่ยน้ำหนัก ขั้นตอนบริบทแบบยาวจะขยายหน้าต่างจากโทเค็น 4K ถึง 64K โดยใช้ YaRN

สองนวัตกรรมระดับระบบ

การเปิดตัวครั้งนี้มีตัวเลือกเชิงโครงสร้างสองแบบที่ AMD เน้นย้ำถึงชัยชนะด้านวิศวกรรมที่มีความหมาย อย่างแรกคือ Gated Multi-head Latent Attention (Gated MLA) ซึ่งเพิ่มเกตเอาท์พุตแบบเรียนรู้น้ำหนักเบาให้กับ Multi-head Latent Attention การฉายภาพเชิงเส้นเฉพาะได้มาจากเกทที่มีเงื่อนไขอินพุตซึ่งนำไปใช้แบบทวีคูณก่อนการฉายภาพเอาท์พุต

ประการที่สอง FarSkip-Collective คือแผนการเชื่อมต่อที่ส่งการเปิดใช้งานที่ล้าสมัยและบางส่วนไปยังชั้น MoE และชั้นความสนใจ ซึ่งซ้อนทับการสื่อสารระหว่างผู้เชี่ยวชาญกับการคำนวณ AMD รายงาน การเร่งความเร็วก่อนการฝึก 12.7% และลดเวลาในการใช้โทเค็นแรกได้ถึง 39.2% เมื่อให้บริการพร้อมกับการทำงานแบบขนานของผู้เชี่ยวชาญ สำหรับบริษัทที่เสนอฮาร์ดแวร์โดยคำนึงถึงประสิทธิภาพด้านราคา นั่นเป็นตัวเลขที่ผู้ซื้อต้องการเห็น

เกณฑ์มาตรฐานที่แข็งแกร่งสำหรับโมเดลแบบเปิดเต็มรูปแบบ

จากจุดตรวจสอบพื้นฐาน Instella-MoE เฉลี่ย 76.7 ในการประเมิน ซึ่ง AMD เรียกว่าเป็นผลลัพธ์ที่แข็งแกร่งที่สุดในบรรดาโมเดลที่เปิดเต็มรูปแบบ ซึ่งนำหน้า Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) และ OLMoE-1B-7B (61.9) แม้ว่าจะยังคงติดตาม Qwen3.5-4B-Base (79.5) ก็ตาม เป็นผู้นำใน WinoGrande ด้วยคะแนน 86.5 และโพสต์ 65.7 ใน HumanEval+ สำหรับงานที่มีบริบทยาว ค่าเฉลี่ยจะอยู่ที่ 41.5 สำหรับ HELMET และ 79.4 สำหรับ RULER

หลังการฝึกอบรมทำให้โมเดลมีความคมชัดยิ่งขึ้น คะแนนเฉลี่ยเพิ่มขึ้นจาก 71.58 หลังจากการปรับแต่งแบบละเอียดภายใต้การดูแล เป็น 72.67 หลังจาก DPO และ 73.22 ในการกำหนดค่า "Think" เอาชนะ Olmo3-7B-Think (71.97), Gemma-4-E4B Think (70.47) และ Qwen3.5-4B (69.73) ตามคำสั่ง IFEval เพิ่มขึ้นจาก 77.08 เป็น 83.70

สูตรหลังการฝึกมีความโดดเด่นในตัวมันเอง หลังจาก SFT บนส่วนผสม Dolci-Think-SFT-7B และ Nemotron แล้ว AMD จะรัน DPO พร้อมการอัปเดตไบแอสของเราเตอร์และปิดใช้งานการสูญเสียสมดุลโหลดเสริมเพื่อหลีกเลี่ยงการเสื่อมสภาพ จากนั้นการเรียนรู้แบบเสริมกำลังจะดำเนินการภายใน Miles Framework ของ AMD: 1,400 ขั้นตอนของการสอนตาม RLVR ตามด้วย การกลั่นกรองตามนโยบายสำหรับผู้สอนหลายราย ซึ่งจะพับส่วนที่ได้รับกลับคืนมาโดยไม่กระทบต่อประสิทธิภาพของคณิตศาสตร์หรือโค้ด

การจับลิขสิทธิ์

มีข้อแม้ที่สำคัญสำหรับผู้ใช้เชิงพาณิชย์ น้ำหนักโมเดลจัดส่งภายใต้ ใบอนุญาต ResearchRAIL ซึ่งจำกัดการใช้งานเพื่อวัตถุประสงค์ทางวิชาการและการวิจัยเท่านั้น ดังนั้น Instella-MoE จึงไม่ใช่โมเดลแบบดรอปอินสำหรับการใช้งานจริง อย่างไรก็ตาม โค้ดเบสการฝึกอบรมนั้น ได้รับอนุญาตจาก MIT และนั่นอาจเป็นสินทรัพย์ที่สามารถนำมาใช้ซ้ำได้มากกว่า — ช่วยให้แล็บอื่นๆ มีพิมพ์เขียวที่เป็นรูปธรรมสำหรับการฝึกอบรมเกี่ยวกับ AMD ซิลิคอน

AMD ได้เผยแพร่น้ำหนักฉบับเต็มจากทุกขั้นตอนการฝึกอบรม การผสมข้อมูล การกำหนดค่าการฝึกอบรม และโค้ดอนุมานสำหรับคอลเลกชัน Hugging Face, พื้นที่เก็บข้อมูล GitHub และบล็อก ROCm ระดับของการเปิดกว้างนั้น — การฝึกอบรมทีละขั้นตอน ไม่ใช่แค่จุดตรวจสอบขั้นสุดท้าย — เป็นสิ่งที่ทำให้การเปิดตัวแบบ "เปิดเต็มที่" แตกต่างจากรุ่นเปิดแบบทั่วไป

เหตุใดจึงมีความสำคัญเกินกว่าเกณฑ์มาตรฐาน

ข้อความย่อยของการเปิดตัวคือการแข่งขันด้านฮาร์ดแวร์ ระบบนิเวศ CUDA ของ Nvidia และ GPU ระดับ H100 เป็นสารตั้งต้นเริ่มต้นสำหรับการฝึกโมเดลชายแดน และผู้ท้าชิงใช้เวลาหลายปีในการพยายามพิสูจน์ว่าตัวเร่งความเร็วของตนสามารถรองรับสแต็กการฝึกเต็มรูปแบบได้ Instella-MoE เป็นสิ่งประดิษฐ์ที่น่าเชื่อถือซึ่งกลุ่มผลิตภัณฑ์ Instinct ของ AMD ซึ่งใช้งานแล้วในวงกว้างโดยไฮเปอร์สเกลเลอร์และห้องปฏิบัติการระดับชาติ สามารถทำได้มากกว่าปริมาณงานการอนุมาน หาก AMD สามารถผลิตโมเดลแบบเปิดที่สามารถแข่งขันได้ซึ่งได้รับการฝึกฝนบนฮาร์ดแวร์ของตัวเอง มันจะเสริมความแข็งแกร่งให้กับกรณีสำหรับผู้ซื้อที่ต้องการทำลายการยึดครองของ Nvidia ในตลาดคอมพิวเตอร์ AI

สำหรับนักวิจัย การอุทธรณ์คือความโปร่งใส การเผยแพร่แบบเปิดเต็มรูปแบบที่บันทึกการผสมข้อมูล การผสมผสานการฝึกอบรมในช่วงกลาง กลยุทธ์การกลั่น และหลักสูตร RL ยังคงพบไม่บ่อยนัก และปล่อยให้ชุมชนตรวจสอบและทำซ้ำคำกล่าวอ้าง แทนที่จะรับฟังคำพูดของห้องปฏิบัติการ Instella-MoE เข้าร่วมกลุ่มเล็กๆ แต่กำลังเติบโต ซึ่งรวมถึงรุ่น Instella หนาแน่นรุ่นก่อนๆ ของ AMD เองด้วย ซึ่งช่วยผลักดันมาตรฐานดังกล่าวไปข้างหน้า

ก้าวนำหน้า AI

ต้องการความครอบคลุมทางเทคนิคเชิงลึกเช่นนี้หรือไม่? คั่นหน้าศูนย์กลางของเราสำหรับ การพัฒนา AI ล่าสุด และไม่พลาดข่าวประชาสัมพันธ์

อ่านข่าว AI เพิ่มเติม →