字节跳动正在训练一个具有多达 10 万亿个参数的人工智能模型,该系统可以接近 Anthropic 的尖端 Mythos 模型的规模,并大大提高全球人工智能竞赛的赌注。 《金融时报》于 2026 年 8 月 7 日援引知情人士的话报道了该计划,《路透社》和其他媒体随后证实了细节。
这一建设是中国科技公司拒绝在前沿模式竞赛中输给美国竞争对手的最新信号。为了持续提供突发人工智能新闻 并分析每个实验室的情况,AI Buzz Wire 正在跟踪这个故事的发展。
10 万亿参数数字意味着什么
模型的参数是它从训练数据中学习的数值权重,用于识别模式、生成文本和执行任务。它们被广泛用作规模的粗略代理,尽管研究人员警告说,参数计数本身并不能决定模型的能力。训练方法、数据质量和架构同样重要。
即便如此,10万亿参数的目标仍然意义重大。按照这个规模,字节跳动的模型将比 Moonshot AI 的 Kimi K3 大三倍多,后者拥有 2.8 万亿个参数,是迄今为止中国最雄心勃勃的努力之一。
在Kimi K3发布之前,美团的LongCat-2.0和DeepSeek的V4-Pro分别以约1.6万亿参数引领中国国内领域,而其他几个中国实验室也已跨过万亿参数的门槛。字节跳动计划的系统将把它们全部远远甩在后面。
用 Anthropic 的神话缩小差距
与美国领先模型进行直接比较很困难,因为 Anthropic 和 OpenAI 等公司没有公开披露 Fable、Mythos 或 GPT-5.5 等系统的参数计数。然而,《金融时报》引用了行业估计,Anthropic 最先进的《神话 5》的参数约为 8 万亿个参数,《神鬼寓言 5》的参数约为 5 万亿个。
这将使字节跳动即将推出的模型接近 Mythos 的规模,该系统被广泛认为是可用的最强大的前沿模型之一。达到这一规模将标志着中国实验室的一个里程碑,并加剧了美国和中国前沿模型之间的参数差距是否最终缩小的问题。
报道指出,字节跳动没有立即回应置评请求。
预训练已经在进行中
据《金融时报》报道,字节跳动模型目前正在进行预训练。预训练是开发大型模型中计算最密集的阶段,该过程通常持续三到六个月,然后才能对系统进行微调和发布。
该时间表表明,任何公开发布还需要几个月的时间,尽管开始如此规模的预培训的决定反映了一个严肃的、资源充足的承诺。预训练一个 10 万亿参数的模型需要大量的专用芯片和大量的电力,而世界上只有少数公司能够承担这一成本。
字节跳动作为 TikTok 和抖音的母公司而闻名,此前曾将人工智能列为其 2026 年的四大战略重点之一。该公司一直在通过豆宝聊天机器人和 Seedance 视频模型进军生成式人工智能,但前沿语言模型将代表其迄今为止最雄心勃勃的努力,与领先的实验室进行正面竞争。
为什么参数军备竞赛很重要
据报道,中国科技公司正在继续加快其模型发布周期,与美国竞争对手展开竞争,以打造更强大的系统,同时又不让其运行成本过高。该战略在 2026 年推出了一系列产品,从 Moonshot 的 Kimi K3 到阿里巴巴的 Qwen3 系列和 DeepSeek 的 V4 系列。
与此同时,更广泛的政策环境正在发生变化。北京一直在考虑对其顶级人工智能模型和芯片实施更严格的出口管制,此举可能会限制海外获取字节跳动目前正在构建的前沿系统。在这些限制下开发的 10 万亿参数模型将是一个强大的、主要为国内服务的系统。
对于实验室本身来说,计算越来越与经济有关。更大的模型能力更强,但训练和运行的成本要高得多,而且行业对于原始规模还是更智能的架构存在分歧,而训练后将决定下一个赢家。
大局观
字节跳动的计划凸显了一个更广泛的趋势:美国和中国最大的前沿模式之间一度被认为难以逾越的差距似乎正在缩小。如果行业对 Mythos 规模的估计是准确的,那么字节跳动的模型在同一范围内将代表着这一距离的有意义的缩小。
这也给 OpenAI、Anthropic 和谷歌带来了保持领先地位的压力。随着中国公司现在瞄准超过数万亿的参数系统,而西方实验室追求更大的架构,参数竞赛几乎没有放缓的迹象——尽管研究人员争论原始数据到底有多重要。
在人工智能竞赛中保持领先地位
前沿模型的发展速度比以往任何时候都快。将我们的主页添加为书签,了解最新的人工智能发展以及每个主要版本的深入报道。
阅读更多人工智能新闻 →