德国研究机构和人工智能公司组成的联盟发布了开放语言模型 Soofi S 30B-A3B,该项目称该模型在完全开放的模型中在英语和德语基准测试中取得了最高分。该版本由德国国家人工智能协会 KI Bundesverband 协调,是首批完全在德国电信位于慕尼黑的工业人工智能云上训练的大型语言模型之一,并被定位为欧洲主权替代品,以取代占主导地位的美国和中国开放权重版本。对于跟踪最新人工智能发展的开发人员来说,此次发布的显着意义不是原始规模,而是架构中的不同寻常的效率和语言重点。

只有 32 亿个有效参数的混合设计

Soofi S 是一个混合专家 (MoE) 模型,总共有 316 亿个参数,但每个生成的代币仅激活约 32 亿个参数。这使得其计算成本比传统的 300 亿参数密集模型更接近 30 亿参数模型,这种设计选择旨在保持推理足够便宜,以便在欧洲基础设施上运行,而不依赖海外云提供商。

该架构借鉴了 Nvidia 的 Nemotron 3 Nano,以混合布局将 Mamba-2 层与标准注意力层相结合。根据该项目的预训练报告,该​​模型的 52 层中只有 6 层维护键值 (KV) 缓存,即存储先前用于注意力计算的标记的内存结构。在传统的转换器中,缓存随着上下文长度线性增长,并成为长上下文推理期间的主要瓶颈。

实际回报体现在吞吐量上。在具有 32 个并行请求的 40,000 个令牌的上下文长度下,Soofi S 每个 GPU 每秒生成的令牌大约是 14 至 240 亿参数范围内的密集模型的八倍。虽然传统模型的生成速度随着上下文的增长而急剧下降,但 Soofi S 从 4,000 个令牌一直到 256,000 个令牌几乎保持不变。该联盟测量中唯一可比较的型号是阿里巴巴的Qwen3.5 35B-A3B,它也采用混合架构。

接受德语培训,但不牺牲英语

对德语的刻意关注是该项目的核心。在第一个训练阶段,德语占数据组合的 7.2%;在第二阶段,这一比例上升至 15.3%。相比之下,在 Nvidia 的 Nemotron 参考配方中,所有非英语语言加起来仅占训练组合的 5% 左右。

数据源包括来自 HPLT 语料库的德语网络文本、公开许可的 German Commons 语料库、FinePDFs 和 FineWiki 的德语部分,以及商业许可的 Genios 档案,其中包含来自 916 种德国出版物的 1.93 亿篇报纸文章。机器翻译和合成生成的德语文本使这一组合更加完善。

该模型在三个训练阶段处理了大约 27 万亿个令牌:第一阶段处理了大约 20 万亿个广泛网络、代码、数学和特定领域文本的令牌;第二阶段处理了大约 20 万亿个令牌。第二个阶段大约有 6 万亿个更高质量的代币;第三阶段较短,使用长达一百万个标记的文档扩展上下文窗口。

基准结果:德语和英语领先,数学较弱

据该联盟称,在对其他 16 个开放模型的评估中,Soofi S 在德语和英语的总分上领先于所有完全开放模型。其中包括来自艾伦人工智能研究所的 OLMo 3 32B 以及来自苏黎世联邦理工学院和洛桑联邦理工学院的 Apertus 70B。与所有欧洲主权基准相比,该模型在该套件中的所有德国基准上都领先,有时领先两位数。

在代码任务上,Soofi S 在 HumanEval 上得分为 73.8%,在 MBPP 上得分为 70.2,在德国 MBPP 变体上得分为 84.2——这是开源同行中最好的结果。在针对德国特定区域知识的 INCLUDE-DE 测试中,Soofi S 以 61.2 分与较大的 Qwen3.5 35B-A3B 并列第一。与 Nemotron 基准相比,德语加权数据配方将语言能力提高了 15.1 分,将 GPQA-Diamond 科学基准提高了 9.6 分,且不影响英语表现。

存在明显的弱点。在德国数学竞赛(Minerva MATH-DE)中,Soofi S 获得了 56 分,远远落后于 Qwen3.5 35B-A3B 的 76.5 分和 Gemma 3 27B 的 65.6 分。它还落后于 NaturalQuestions 中的开放事实检索,该团队将其归因于只有大约 30 亿个活动参数,因此存储的世界知识比密集的 27B 模型要少。 RULER 长上下文测试暴露了另一个差距:当模型必须从长文本中提取频繁出现的单词时,超过 32,000 个标记,其命中率下降至 3% 左右,而类似的 Nemotron 模型仍能达到 60% 至 64%。

在慕尼黑使用 512 个 Nvidia B200 GPU 进行训练

该训练于 2026 年 3 月至 5 月期间在慕尼黑德国电信工业人工智能云上的多达 512 个 Nvidia B200 GPU 上进行,总计约 253,000 个 GPU 小时。据报道,该设施完全依靠可再生能源运行,用艾斯巴赫运河的水进行冷却,并将废热输送到周围的图彻帕克社区。 Soofi S 是在该基础设施上进行的首批主要训练之一。

该模型背后的联盟由德国联邦经济事务和能源部资助,作为欧洲 IPCEI-CIS 计划的一部分。参与者包括弗劳恩霍夫研究所 IAIS 和 IIS、德国人工智能研究中心 (DFKI)、达姆施塔特工业大学、维尔茨堡大学、L3S 研究中心、柏林应用科学大学以及人工智能公司 Ellamind 和 Merantix Momentum。

关于“过度训练”的争论

发布后不久,批评者认为 Soofi S 受到 Google DeepMind 于 2022 年发布的经典 Chinchilla 缩放法则标准的严重过度训练,该法则建议每个参数 20 个令牌的粗略最佳点。 Soofi S 拥有 27 万亿个代币和大约 300 亿个参数,每个参数有数百个代币;仅计算 32 亿个活跃参数,该比率就达到了数千个。

该项目技术领导成员 Michael Fromm 反驳了这一批评,认为这些规则不会延续到 MoE 架构中。弗洛姆说:“新的研究表明,密集模型的旧缩放法则不再适用于 MoE 架构。”他指出,个别专家会从大型高质量数据集中重复查看相同文档中受益。作为比较,他提到了 Nvidia,该公司已经在多达 25 万亿个代币上训练了自己的模型。

哪些内容被发布,哪些内容没有发布

研究人员正在发布模型权重以及选定的中间检查点、完整的训练和评估代码以及列出原始代币计数、纪元数和每个来源的有效贡献的详细数据清单。据该团队称,这意味着 Soofi S 符合开源倡议的开源 AI 定义 1.0。

欧洲开放数据定义的更严格提案要求每个训练代币都可以自由分发,但该提案并未得到满足,因为混合数据中的 1.3% 来自商业许可的 Genios 语料库。报告称,大约 99% 的训练数据仍然可以独立重建。该模型发布的确切许可在发布时尚未最终确定。

该联盟目前正在寻找下一阶段的行业合作伙伴,以在涉及技术文档、代码生成和基于代理的系统的应用程序中测试 Soofi S。有关开放权重模型发布、主权 AI 基础设施和欧洲 AI 生态系统的更多信息,请关注此处发布的 AI 行业报道

在开源人工智能领域保持领先地位

美国、中国和现在欧洲的实验室几乎每周都会发布开放重量版本,最大的专有模型和最好的开放替代品之间的差距不断缩小。请关注人工智能突发新闻 和基准分析,了解完整情况。

阅读更多 AI 模型报道 →