中国人工智能实验室 DeepSeek 与华为合作,发布了一套适用于华为 Ascend AI 芯片的开源编程工具,此举直接瞄准了支撑英伟达在人工智能计算领域主导地位的软件生态系统。
The announcement was made on DeepSeek's official WeChat channel and confirmed by Reuters, Bloomberg and The New York Times. According to The Decoder, the release includes libraries for computation and for moving data between chips — and all of it is open source. DeepSeek表示华为“全力支持”这项工作。
对于追踪中国芯片行业人工智能突发新闻的读者来说,这是今年最重要的软件发布之一:这是迄今为止最明显的迹象,表明中国领先的人工智能实验室正在围绕国产芯片而不是 Nvidia GPU 构建堆栈。
DeepSeek 实际发布了什么
此次发布的核心是 TileLang,一种用于人工智能芯片的开源编程语言,最初由北京大学的研究人员开发。据 The Decoder 报道,DeepSeek 已经在内部使用该语言大约一年了,并首先在较旧的 Nvidia 芯片上进行了测试,然后再将其引入华为硬件。
DeepSeek 的观点是,任何试图为 AI 芯片构建独立软件生态系统的人都需要一种易于编程的通用语言,同时仍能从硬件中充分发挥性能。该公司认为,TileLang 提供了比 CUDA 更简单的编程模型,CUDA 是 Nvidia 的专有平台,近二十年来一直是人工智能开发的事实上的标准。
据《纽约时报》报道,TileLang 现在是 DeepSeek 自己的通用人工智能工作的主要工具——考虑到 DeepSeek 的模型是在前沿规模上进行训练和服务的,这是一个值得注意的认可。
超越语言本身
除了 TileLang 之外,DeepSeek 还提供了涵盖计算和芯片间数据移动的开源库,这两种工作负载主导着大规模人工智能训练和推理。 The company also said it jointly optimized a "supernode" with Huawei — a cluster of 128 Ascend 950 chips designed to work as a single system.
为什么这直接针对 Nvidia
Nvidia's advantage has never been chip design alone. The Decoder 指出,该公司真正的护城河是 CUDA 及其周围的生态系统:全球估计有 400 万开发人员使用 CUDA 进行开发,而 AMD 等竞争对手即使其硬件在纸面上看起来具有竞争力,也难以跨越这一安装基础。
That is what makes the DeepSeek-Huawei release different from previous Chinese chip announcements. Rather than only building faster hardware, China's AI industry is now trying to replicate the software layer that locks developers in.
《纽约时报》报道称,迄今为止,Z.ai 和 Moonshot AI 等中国模型制造商的发展速度比该国芯片制造商更快,这意味着中国最好的模型仍然在很大程度上依赖于外国计算。华为希望缩小这一差距。在DeepSeek宣布的两周前,华为推出了新一代AI处理器和超级节点系统,并表示明年将广泛用于模型训练。
出口管制背景
此次合作与美国的出口管制密不可分,美国的出口管制逐渐切断了中国公司与英伟达最先进 GPU 的联系。据 The Decoder 报道,华为轮值董事长徐直军表示,该公司不能接受取决于其他国家是否愿意向中国出售芯片的未来。 DeepSeek 公开发布其芯片软件的举动也使得任何单一供应商(中国或美国)更难控制每个人都依赖的层。
CUDA 护城河真的破裂了吗?
有趣的背景来自研究公司 SemiAnalysis,该公司最近测试了 OpenAI 的内部推理芯片 Jalapeo,并得出结论,CUDA 护城河“可能已经死亡”——并指出 OpenAI 可以非常快地在自己的硬件上运行新模型,并且 Jalapeo 在大多数测试场景中在每瓦性能方面击败了 Nvidia 的 Blackwell,正如 The Decoder 报道的那样。
但分析师补充了重要的警告。他们只测试了相对容易优化的场景,大约有 8,000 个输入令牌和 1,000 个输出令牌,而且他们还没有运行 AgentX,这是一个衡量 AI 代理如何处理多步骤任务的基准——SemiAnalysis 在 8 月份就发现 Nvidia 在这方面遥遥领先。
这对行业意味着什么
现实的解读并不是 CUDA 一夜之间就崩溃了。四百万开发人员、二十年的库和无数的生产部署无法快速迁移。但 DeepSeek 的软件、华为的新芯片以及 OpenAI 等定制芯片的结合表明,让 Nvidia 成为默认的软件锁定正在从多个方向同时被削弱。
对于中国来说,回报是战略性的:一个可行的、开放的替代软件堆栈使国产芯片可以大规模使用,从而降低美国出口政策的影响力。对于其他人来说,开源 TileLang 生态系统最终可以降低针对世界任何地方的非 Nvidia 硬件的成本。
DeepSeek 和华为尚未披露在同等硬件上将新堆栈与 CUDA 进行比较的性能基准,因此具体的速度和效率声明尚未得到证实。方向是明确的:中国最受关注的人工智能实验室不再将英伟达的软件视为不可避免的依赖。
保持人工智能领先地位
错过了一个故事吗? 阅读更多人工智能新闻 →
