德国人工智能公司 Aleph Alpha 发布了 Kolibri,这是一种针对德语和英语从头开始构建的开放式专家混合语言模型。该模型总共包含 781 亿个参数,但每个代币仅激活其中 34.6 亿个参数(约占 4.4%),并在 Hugging Face 上的 Apache 2.0 许可证下发布。它接受最多 1,048,576 个上下文标记,并允许用户设置每个请求的推理工作量。对于跟踪开放权重生态系统的读者来说,这与我们的最新人工智能发展 一起出现。

此次发布是对 Aleph Alpha 市场定位的深思熟虑的声明:在公共管理、工业和航空航天等受监管领域进行主权部署,在这些领域,准确了解模型在哪里训练、使用哪些数据以及在哪个法律框架下进行训练并不是可有可无的,而是采购要求。

Kolibri 到底是什么

Kolibri,在技术材料中被称为 Kolibri-1,是一款英德双语 MoE 转换器,Aleph Alpha 表示它是由德国团队端到端开发的。根据该公司的技术研究报告,该团队控制了整个流程——数据、架构、培训基础设施、培训后和评估——而不是从另一个实验室的检查点开始。

培训在位于德国和芬兰的基础设施上进行。设计过程明确旨在遵守欧盟通用人工智能实践准则、欧盟人工智能法案和 GDPR,Aleph Alpha 是该准则的签署者。该公司表示,其数据管道会在训练前对个人数据进行编辑,这一细节直接针对无法合法地将公民数据输入来源不明的模型的公共部门买家。

它在单个 GPU 上运行

可部署性显然是一个设计约束,而不是事后的想法。 FP8 检查点的大小约为 78GB,在单个 NVIDIA B200、B300 或 H200 上运行,或者在两个 H100 SXM5 GPU 上运行,通过带有专用 Kolibri 推理和工具调用解析器的 vLLM 提供服务。对于 780 亿个参数的模型来说,这是一个适度的硬件占用空间,也是稀疏 MoE 设计的直接回报:每个令牌只有 34.6 亿个活动参数,推理成本跟踪活动参数计数而不是总数。

稀疏专家和混合注意力

在引擎盖下,Kolibri 堆叠了 50 个变压器块,模型宽度为 2,560。每个 MoE 层都使用 sigmoid 路由器对所有 384 个路由专家进行评分,将每个令牌发送到前 6 个专家,并始终与他们一起运行 1 个共享专家。专家负载使用两种按字母顺序排列的技术进行平衡——精确分位数平衡和负载错误注入——这可以防止路由器将所有流量集中到少数专家身上。

注意力是架构变得更有趣的地方。 Kolibri 使用具有 48 个查询头和 4 个 KV 头的分组查询注意力,但层并不统一:每五个块使用完全注意力而不使用位置编码,而其他 40 个块使用 RoPE 对 512 个前面的标记使用滑动窗口注意力。实际结果是内存效率——滑动窗口层拥有固定大小的 KV 缓存,因此 50 个层中只有 10 个随着上下文长度而增长。在匹配计算中,Aleph Alpha 报告称,混合设计支持的序列比同等的全注意力模型长四倍。这就是这种规模的模型如何在没有外来基础设施的情况下声称拥有一百万个令牌的上下文窗口。

为德语构建的分词器

大多数前沿标记化器将德语视为事后的想法,将其长复合词分割成片段,从而增加了标记数量和有效成本。 Aleph Alpha 直接用 UniBPE 解决了这个问题,UniBPE 是一个 128,000 个标记的词汇表,它以 BPE 的方式构建合并,但通过 Unigram 损失对每个合并进行评分。

数字说明了这一点。在德语文本中,Kolibri 的标记生成器每个标记达到 4.90 个字节,而 GPT-5 标记生成器为 4.35 个字节,这意味着德语网络文本上的标记减少了 11.2%。在英语方面,Kolibri 实际上也领先,每个标记为 4.58 字节,而 GPT-5 为 4.67。对于通过代币付款的企业客户来说,这是对每个德语工作负载的直接折扣。

前沿规模的培训

Kolibri 背后的培训非常丰富。预训练覆盖了 768 个 NVIDIA B200 GPU 上的 20 万亿个令牌,随后是 65,536 个令牌序列长度的 3.44 万亿个中间训练令牌。然后,管道经过监督微调和强化学习阶段,生成最终的遵循指令、具有推理能力的模型。该公司发布了一份涵盖该过程的技术研究报告,这对于欧洲实验室来说是不寻常的披露水平,并且明确旨在与受监管的客户建立信任。

这对欧洲人工智能发展意味着什么

Kolibri 进入的市场中,美国和中国实验室的公开发布占据主导地位,而欧洲各国政府对数字主权的呼声也越来越高。 Aleph Alpha 的赌注是,该市场的一部分——政府部门、国防相关行业、关键基础设施——将为一种模型买单,这种模型不仅是开放式的,而且在数据处理、培训地点和法律地位方面都是欧洲可验证的。

这一赌注是否有回报取决于该版本尚未回答的问题:Kolibri 如何在标准评估中与前沿开放模型进行基准测试,以及围绕它形成工具生态系统的速度有多快。该版本确实表明,欧盟内部现已存在全栈、前沿的培训能力,并有与之相匹配的文书工作。对于受 GDPR 和 AI 法案约束的组织来说,这种组合可能比排行榜位置更重要。

---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →