中国人工智能实验室Moonshot AI于2026年7月16日推出了Kimi K3,发布了所谓的“世界上第一个开放3T级模型”——一个2.8万亿参数的系统,缩小了与Anthropic和OpenAI最强大的专有模型的差距。此次发布立即成为今年讨论最多的人工智能发布之一,登上了《黑客新闻》的榜首,并引起了路透社、彭博社和《纽约时报》的报道。

对于更广泛的 AI 行业报道,Kimi K3 很重要,因为它将开放权重模型的前沿大幅推高,同时引发了关于可免费下载的系统是否可以与封闭模型相媲美的新辩论。 Moonshot 表示完整的模型重量将于 2026 年 7 月 27 日发布。

2.8 万亿参数的开放模型

根据 Moonshot 的技术公告,Kimi K3 是一个 2.8 万亿参数的模型,基于两个架构更新构建,该公司称之为 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes)。它采用专家混合 (MoE) 设计,对于任何给定代币,仅激活 896 个专家中的 16 个,并与 Moonshot 描述的稳定 LatentMoE 框架配对。该公司声称,与之前的 Kimi K2 型号相比,这些变化使整体扩展效率提高了大约 2.5 倍。

该模型还配备了原生视觉功能和一百万个令牌上下文窗口。分析师 Simon Willison 在他的博客上写道,Kimi K3 从 DeepSeek 的 1.6 万亿参数 v4 Pro 中夺得了开放尺寸桂冠——是之前的 1 万亿参数 Kimi K2.6 的“两倍多”。

Moonshot 将此次发布视为持续扩展的最新举措,并表示在过去 12 个月中有 9 个月,其模型已经设定了开放模型尺寸的上限。

基准比较如何

Moonshot 自己的评估套件将 Kimi K3 的整体性能仅落后于两个专有系统——Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol——而它的性能始终优于其他测试模型,包括 Claude Opus 4.8 和 GPT-5.5。第三方分析广泛追踪这些说法。

独立评估服务Artificial Analysis报告称,在其私人长期知识工作基准测试中,Kimi K3的整体Elo达到了1547,比Kimi K2.6跃升了732分,仅落后于Claude Fable 5。根据发布后广泛流传的排行榜帖子,在Arena.ai的前端代码领域,Kimi K3攀升至第一,甚至超过了Claude Fable 5。

定价是故事中值得注意的部分。 Artificial Analysis 将每个任务的平均成本定为 0.94 美元,与 GPT-5.6 Sol 的 1.04 美元相当,大约是 Claude Opus 4.8 1.80 美元的一半,同时指出 Kimi K3 使用的输出代币比其前身少了 21%。按每个代币计算,该模型的定价为每百万输入代币 3 美元,每百万输出代币 15 美元——与 Anthropic 的 Claude Sonnet 系列处于同一级别,并且正如 Willison 观察到的,这是迄今为止中国人工智能实验室发布的最昂贵的模型,高于 Kimi K2.6 的 0.95 美元/4 美元。

代理编码和它自己构建的编译器

Moonshot 的大部分公告并不关注聊天机器人基准,而是关注长期代理任务。该公司表示,Kimi K3 可以维持扩展的工程会话、浏览大型代码存储库以及在最少的人工监督下编排终端工具。

Moonshot 在一次演示中表示,Kimi K3 的早期版本在后期开发过程中处理了团队自己的大部分 GPU 内核优化工作。在另一个模型中,该模型构建了“MiniTriton”,这是一个紧凑的类似 Triton 的 GPU 编译器,具有自己的图块级中间表示、优化通道和 PTX 代码生成管道。 Moonshot 声称 MiniTriton 在支持的 Roofline 基准和持续的端到端 nanoGPT 训练上匹配或击败了现有的 Triton 和 torch.compile 堆栈,并具有稳定的收敛性。

该公司还展示了芯片设计方面令人惊叹的概念验证。据报道,在一次 48 小时的自主运行中,Kimi K3 使用 Nangate 45nm 库上的开源 EDA 工具设计、优化和验证了一款芯片,该芯片旨在为自己的架构上的纳米模型提供服务。 Moonshot 表示,该设计在 4 mm² 内以 100 MHz 的频率关闭时序,并在模拟中维持每秒超过 8,700 个令牌的解码吞吐量。

在研究方面,Moonshot 表示,Kimi K3 通过交叉验证 20 多篇论文,在 300 多个状态方程中实现完整的数值管道,并编写 3,000 多行 Python 代码,在大约两个小时内重现了计算天体物理学中的 I-Love-Q 普遍关系(该公司估计研究人员通常需要一到两周的时间才能完成这项工作)。

公开重量级辩论回归

Kimi K3 的到来重新引发了一场持续到 2026 年的争论,因为中国实验室一再拉近(或似乎正在拉近)与美国前沿模型的距离。这种模式现在很常见:中国发布的自我报告数据位居排行榜前列,西方实验室强调其仍在增长的专有优势,而企业则权衡成本和开放性与原始能力。

这种紧张在定价中显而易见。该模型的每任务成本低于 Claude Opus 4.8,同时接近其功能,但收费比之前任何中国版本都要高,这反映了 Moonshot 的信心,即即使在开放的生态系统中,它也能获得溢价。威利森警告不要过多地解读任何单一基准——他写道,他长期运行的“自行车上的鹈鹕”测试不再与现实世界的质量可靠地相关——但他表示,这次发布仍然奖励实际测试。

Kimi K3 现已通过 Kimi.com、Kimi Work 桌面代理、Kimi Code 开发人员工具和 Kimi API 提供。 Moonshot 表示,它正在与推理合作伙伴和开源维护人员合作,以确保在全面权重发布之前可靠地推出。

保持人工智能领先地位

如需持续报道模型发布、基准测试和开放权重前沿,请关注 AI Buzz Wire,了解塑造全球人工智能竞赛的发展动态。

阅读更多 AI 模型新闻 →