发布 Kimi K3(这个 2.8 万亿参数的开放权重模型,重新引发了关于中国在人工智能前沿竞赛中的地位的争论)几天后,Moonshot AI 就被迫停止新的订阅,因为需求超出了其计算能力。美联社于 2026 年 7 月 20 日首次报道了这一暂停,并得到了 Euronews、PYMNTS 和财新国际等媒体的证实,这标志着一个不寻常的时刻:一家中国人工智能实验室因自身基础设施无法跟上而拒绝付费客户。

这一发展是人工智能行业报道更广泛的故事中一个引人注目的次要情节,其中的焦点已经从开放权重模型是否可以与专有模型竞争,转移到任何人(在任何国家)是否可以提供足够的计算来为他们提供服务。

发生了什么

据美联社报道,由于需求“容量饱和”,中国的新人工智能模式停止了新的订阅。欧洲新闻网更直言不讳地报道称,由于“巨大的需求”,中国型号停止了注册,这反映了 Kimi K3 发布后全球范围内的兴趣浪潮。 PYMNTS 报道称,Moonshot 停止了新的 Kimi K3 订阅,具体是因为需求“压倒了计算”——这意味着该公司的服务器无法处理来自新用户和潜在用户的大量推理请求。

顺序很简单。 Moonshot 于 2026 年 7 月 16 日推出了 Kimi K3,宣称其是世界上第一个开放的 3T 级模型——一个基于混合专家架构构建的 2.8 万亿参数系统,每个代币仅激活一小部分参数。该模型立即引起了强烈关注,登上了黑客新闻的榜首,并吸引了路透社、彭博社和纽约时报的报道,缩小了与 Anthropic 和 OpenAI 专有系统的差距。几天之内,这种关注转化为使用量激增,而该公司的托管基础​​设施规模无法承受。

计算瓶颈

这一停顿凸显了每个前沿人工智能实验室现在都面临的一个严格限制:建立一个强大的模型只是成功的一半;还需要继续努力。大规模服务是另一半,而且通常更昂贵。推理——运行模型来为用户生成响应——需要持续访问专用芯片以及为其提供动力的能量。像 Kimi K3 这样大的模型,即使采用高效的专家混合设计,也需要大量的 GPU 容量才能为数千个并发用户提供服务。

Moonshot 停止接受新订阅的决定表明,该公司将现有用户和服务质量置于增长之上。放弃收入很少是初创公司轻易做出的选择,这表明替代方案——降低性能或使服务崩溃——被认为更糟糕。这也意味着,至少暂时而言,Kimi K3 的功能与实际可以使用托管版本的人数之间的差距是由计算来分配的,而不是由模型的质量来分配的。

这与西方实验室周期性紧张的情况相同。当新模型令人兴奋时,推理需求的激增速度远远快于基础设施的配置速度,而芯片并不是公司可以在一夜之间订购更多的东西。 Moonshot 的情况表明,计算紧缩不仅仅是美国的问题,它是前沿人工智能市场的一个结构特征,无论谁发布了足以吸引大众的模型,都会感受到这一点。

开放式配重提供部分释放阀

Kimi K3 与面临同样压力的专有型号有一个细微差别:它是开放重量的。 Moonshot 致力于发布完整的模型权重,这意味着拥有自己 GPU 的组织可以独立下载和运行 Kimi K3,完全绕过 Moonshot 的托管服务。

这并不能直接解决 Moonshot 的订阅问题,因为在本地运行 2.8 万亿参数的模型仍然需要大多数个人用户所不具备的硬件。但这确实意味着该模型的覆盖范围并不受一家公司的服务器场的严格限制。研究实验室、企业和有闲置能力的云提供商可以建立自己的实例,而开放权重社区已经开始这样做。

那么,这种紧张关系是 Moonshot 的托管消费者产品所特有的——这是非技术用户尝试 Kimi K3 的最简单方法。这就是暂停的服务,也是最能感受到计算上限的地方。

公开重量级辩论的信号

这一暂停也加剧了关于开放重量模型的持续政治和商业争论。 Kimi K3 的成功吸引了超过供应的需求,从某种意义上说,这是一种验证:该模型显然足够好,以至于人们对它的渴望足以压倒其制造商。硅谷分析师指出,Kimi K3 引发了人们对可免费下载的系统能否与封闭系统相媲美的真正焦虑,而用户的激增就是具体的证据,表明这种兴趣不仅仅是炒作。

与此同时,容量紧缩凸显了最大的封闭实验室的一个很少被讨论的优势:他们花费了数年和数十亿美元积累计算能力,正是为了能够吸收像这样的需求峰值。拥有出色模型但积累的基础设施较少的新进入者可能会发现自己在最糟糕的时刻(即关注度达到顶峰时)容量受阻。

对于 Moonshot 来说,近期的问题是它能够以多快的速度扩大服务能力以重新开放订阅。整个行业共同面临的长期问题是,模型改进的速度是否超过了任何人都可以构建运行模型的基础设施的速度。

保持人工智能领先地位

如需继续报道前沿模型、开放权重运动和全球计算竞赛,请关注我们的最新人工智能发展

阅读更多人工智能新闻