小而广泛的专家混合设计
根据 MarkTechPost 中的详细细分,Instella-MoE-16B-A3B 是一个仅解码器的 MoE 模型,具有160 亿个总参数,每个代币仅激活 28 亿个。它的 27 层中的每一层都使用2 个共享专家加上从 64 个专家池中选出的 6 个路由专家,隐藏大小为 2048、16 个注意力头和 128,896 个令牌词汇表。在预训练和训练中期都使用 多令牌预测 目标。
这种稀疏的架构——网络的一小部分为每个代币“醒来”——与过去一年重塑市场的廉价运行开放模型背后的效率逻辑相同。 AMD 使用来自开放语料库(包括 Nemotron-CC-v2、MegaMath、FineMath、RefineCode 和 TxT360)的 7.1 万亿代币 来训练模型,然后在 Dolma3 Dolmino 100B 上跨通过权重平均合并的三个数据变体运行中期训练阶段。长上下文阶段使用 YaRN 将窗口从 4K 扩展到 64K 令牌。
两项系统级创新
该版本包含两个结构选择,AMD 强调这些选择是有意义的工程胜利。第一个是门控多头潜在注意力(Gated MLA),它为多头潜在注意力添加了一个轻量级的学习输出门。专用的线性投影导出一个输入条件门,该门在输出投影之前乘法应用。
第二个,FarSkip-Collective,是一种连接方案,它将过时的和部分激活传递到 MoE 和注意层,将专家并行通信与计算重叠。 AMD 报告称,在使用专家并行服务时,预训练速度提升了 12.7%,并且第一个令牌的时间缩短了 39.2%。对于一家以性价比为重点推销硬件的公司来说,这些正是买家希望看到的数字。
完全开放模型的强大基准
在基础检查点上,Instella-MoE 的评估平均成绩为 76.7,AMD 称其为完全开放模型中最强的结果。这使其领先于 Moonlight-16B-A3B (76.2)、SmolLM3-3B-Base (70.5)、OLMo-3-7B (70.1) 和 OLMoE-1B-7B (61.9),但仍落后于 Qwen3.5-4B-Base (79.5)。它在 WinoGrande 上得分为 86.5,在 HumanEval+ 上得分为 65.7。对于长上下文任务,HELMET 上的平均得分为 41.5,RULER 上的平均得分为 79.4。
训练后进一步强化模型。平均得分从监督微调后的 71.58 攀升至 DPO 后的 72.67 分和“Think”配置中的 73.22 分,击败了 Olmo3-7B-Think (71.97)、Gemma-4-E4B Think (70.47) 和 Qwen3.5-4B (69.73)。在执行指令时,IFEval 从 77.08 上升至 83.70。
训练后的配方本身就值得注意。在 Dolci-Think-SFT-7B 和 Nemotron 混合物上执行 SFT 后,AMD 运行 DPO,同时更新路由器偏差并禁用辅助负载平衡损耗以避免性能下降。然后,强化学习在 AMD 的 Miles 框架 中进行:1,400 个指令遵循 RLVR 的步骤,然后是 多教师按策略蒸馏,在不牺牲数学或代码性能的情况下将增益折回。
许可问题
对于商业用户来说,有一个重要的警告。该模型权重根据 ResearchRAIL 许可证发布,该许可证仅限于学术和研究目的,因此 Instella-MoE 不是用于生产部署的直接模型。然而,训练代码库已获得 MIT 许可,这可以说是更可重用的资产 - 它为其他实验室提供了在 AMD 芯片上进行训练的具体蓝图。
AMD 已在 Hugging Face 集合、GitHub 存储库及其 ROCm 博客中发布了每个训练阶段的完整权重、数据混合、训练配置和推理代码。这种开放程度——逐个训练阶段,而不仅仅是最终检查点——是“完全开放”版本与典型的开放重量版本的区别。
为什么这比基准更重要
此次发布的潜台词是硬件竞争。 Nvidia 的 CUDA 生态系统和 H100 级 GPU 一直是前沿模型训练的默认基础,挑战者花了数年时间试图证明他们的加速器可以处理完整的训练堆栈。 Instella-MoE 是一个可靠的产品,AMD 的 Instinct 系列(已被超大规模企业和国家实验室大规模部署)可以做的不仅仅是推理工作负载。如果 AMD 能够继续生产在自己的硬件上训练的有竞争力的开放模型,那么对于希望打破 Nvidia 对人工智能计算市场控制的买家来说,它就更有理由了。
对于研究人员来说,吸引力在于透明度。记录数据混合、训练中期混合、蒸馏策略和强化学习课程的完全开放版本仍然很少,它们让社区审核和重现声明,而不是相信实验室的说法。 Instella-MoE 加入了一个规模虽小但不断增长的名单,其中包括 AMD 自己的早期 Instella 密集型号,推动该标准向前发展。
保持人工智能领先地位
想要这种深入的技术报道吗?为我们的 最新人工智能发展 中心添加书签,不错过任何发布。
阅读更多人工智能新闻 →

