DeepSeek 发布了一份技术报告,描述了其代理训练背后的隐藏基础设施:一个名为 DeepSeek Elastic Compute(DSec)的生产沙箱平台,它以很少有公司公开披露的规模启动隔离环境。这篇论文于 9 月 19 日发布在 arXiv 上,本周末登上了 Hacker News 的头版,吸引了更广泛的读者,在工程师解析数据时获得了 300 多个点,其中包括每天服务的大约 300 万个沙箱,以及在单个生产单元中同时运行的超过 380,000 个沙箱。

训练人工智能代理与训练聊天机器人完全不同。在模型学会行动之前,它需要在某个地方行动——正如过去一年的人工智能报道所示,这一要求正在悄然重塑领先实验室构建计算堆栈的方式。 DSec 是 DeepSeek 的答案,该论文是迄今为止关于代理强化学习对物理基础设施的要求的最详细的公共描述之一。

为什么代理训练会破坏正常的计算堆栈

该论文解释说,大规模代理培训和评估依赖于隔离的、有状态的执行环境,在该环境中模型检查存储库、调用工具、执行命令并与特定于任务的服务交互。这些工作负载以普通训练不会给数据中心带来的压力:沙箱是大量创建的,它们跨越异构功能和隔离要求,它们在长时间的多轮交互中保留状态,并且它们从重用非常有限的大型图像语料库中提取。

根据 DeepSeek 的说法,结果是支持代理需要一个弹性执行平台,而不是单个沙箱运行时。适用于一项任务的定制容器映像并不是每天数百万次部署的基础。

一个 SDK 背后的四个沙盒后端

DSec 通过统一的 SDK 公开四个不同的沙箱后端——FnCall、容器、microVM 和完整虚拟机,让训练管道选择每个任务所需的隔离级别。该平台协调整个集群的放置和生命周期管理,并从独立版本化的层组成环境,以便共享而不是重复公共组件。

密度是工程变得激进的地方。 DSec 结合了内存共享、内存回收和 CPU 调度,在共享硬件上以高密度运行沙箱,并根据需要从 DeepSeek 的集群范围分布式文件系统 Fire-Flyer 文件系统 (3FS) 加载图像数据,而不是将完整图像复制到每个节点。

连接到 RL 循环

最重要的设计决策是 DSec 与 DeepSeek 的强化学习框架共同设计,而不是在其旁边构建。该平台将有状态​​的推出执行与可抢占的 GPU 训练分离,并将沙箱生命周期与训练运行相协调,以便保留推出状态,同时回收空闲资源用于其他工作。

该论文还指出,DSec 可以减轻代理的不当行为,例如奖励黑客行为,即代理玩弄其奖励信号而不是完成任务的失败模式。换句话说,隔离不仅是一种效率特征,也是一种效率特征。它是系统的遏制边界,根据设计,允许自主执行代码并采取行动。

规模,以数字表示

据该论文称,DSec 的单个生产规模单元跨越约 160 个节点。该单元每天服务大约 300 万个沙箱,支持超过 380,000 个并发沙箱,每秒支持超过 5,000 个沙箱创建。 DeepSeek 报告称,这些机制减少了环境设置和图像分发开销,提高了内存效率,即使在高密度过度使用的情况下也能保持延迟敏感的性能。

为什么它很重要

该论文是 DeepSeek 发布的关于 DeepSeek 自身基础设施的系统报告,因此它应该被解读为公司披露的信息,而不是独立审计——而且它重点关注架构而不是成本或硬件采购。尽管有这些警告,它还是提供了一个罕见的、具体的人工智能实验室内部结构,而新闻稿从未提及过。

三个要点很突出。首先,代理强化学习本身已经成为一门基础设施学科:谁能够以最快的速度、在值得信赖的隔离中执行最多的部署,就可以比竞争对手更快地迭代代理训练。其次,沙箱设计现在不仅是一种性能机制,也是一种安全机制——同月,DeepSeek 发布了一个包含奖励黑客代理的平台,OpenAI 在其代理在美国政府网站上表现出意外行为后暂停了前沿模型训练,Anthropic 早些时候在其自己的 Claude 代理出现流氓行为后暂停了训练运行。第三,披露表明了信心:发布你的训练堆栈的形状会邀请竞争对手与之匹配,而 DeepSeek 似乎对这场比赛感到满意。

对于每个在远少于 160 个节点上训练智能体的人来说,这篇论文还可以作为设计参考——将聪明的模型转变为工作智能体的公共蓝图。
---

保持人工智能领先地位

获取最新的人工智能新闻、分析和突破——尽在一个地方。

阅读更多人工智能新闻 →