DeepSeek は、エージェント トレーニングの背後にある隠れたインフラストラクチャを説明する技術レポートを公開しました。これは、ほとんどの企業が公開していない規模で隔離された環境を起動する、DeepSeek Elastic Compute (DSec) と呼ばれる運用サンドボックス プラットフォームです。 9 月 19 日に arXiv に投稿されたこの論文は、週末に Hacker News の一面に載り、さらに多くの読者を獲得し、エンジニアが数値を解析したところ 300 ポイント以上を獲得しました。その中には 1 日あたり約 300 万個のサンドボックスが提供され、単一の運用ユニットで 380,000 個以上が同時に実行されていることが含まれます。
AI エージェントのトレーニングは、チャットボットのトレーニングとはまったく異なります。モデルが動作することを学習する前に、動作する場所が必要です。そして、過去 1 年間の AI 報道 が示しているように、この要件は、主要な研究所がコンピューティング スタックを構築する方法を密かに再構築しています。 DSec は DeepSeek の答えであり、この論文は、エージェント強化学習が物理インフラストラクチャに要求するものについて、これまでで最も詳細に公開された説明の 1 つです。
エージェント トレーニングが通常のコンピューティング スタックを破壊した理由
この論文では、大規模なエージェントのトレーニングと評価は、モデルがリポジトリを検査し、ツールを呼び出し、コマンドを実行し、タスク固有のサービスと対話する、分離されたステートフルな実行環境に依存していると説明しています。これらのワークロードは、通常のトレーニングでは発生しない方法でデータセンターにストレスを与えます。サンドボックスは大規模なバーストで作成され、異種の機能と分離要件にまたがり、長いマルチターンのインタラクションにわたって状態を保持し、非常に限定された再利用で大規模な画像コーパスから取得します。
DeepSeek によると、結果として、エージェントをサポートするには、単一のサンドボックス ランタイムではなく、柔軟な実行プラットフォームが必要になるということです。 1 つのタスクに機能する特注のコンテナー イメージは、1 日に何百万ものロールアウトの基盤ではありません。
1 つの SDK の背後にある 4 つのサンドボックス バックエンド
DSec は、統合 SDK を通じて 4 つの異なるサンドボックス バックエンド (FnCall、コンテナ、microVM、完全な仮想マシン) を公開し、トレーニング パイプラインが各タスクに必要な分離レベルを選択できるようにします。プラットフォームはクラスター全体で配置とライフサイクル管理を調整し、独立してバージョン管理されたレイヤーから環境を構成するため、共通のコンポーネントは重複せずに共有されます。
密度は、エンジニアリングが積極的に行われる場所です。 DSec は、メモリ共有、メモリ再利用、CPU スケジューリングを組み合わせて、共有ハードウェア上でサンドボックスを高密度で実行し、完全なイメージをすべてのノードにコピーするのではなく、DeepSeek のクラスタ全体の分散ファイル システムである Fire-Flyer ファイル システム (3FS) からオンデマンドでイメージ データをロードします。
RL ループに配線
最も重要な設計上の決定は、DSec が DeepSeek の強化学習フレームワークと一緒に構築されるのではなく、それと共同設計されたことです。このプラットフォームは、ステートフル ロールアウトの実行をプリエンプティブル GPU トレーニングから切り離し、トレーニングの実行とサンドボックスのライフサイクルを調整して、アイドル状態のリソースが他の作業に再利用される間、ロールアウトの状態が保存されるようにします。
この論文では、DSec が報酬ハッキング (エージェントがタスクを完了する代わりに報酬シグナルを利用する失敗モード) などのエージェントの不正行為を軽減することにも言及しています。言い換えれば、分離は単なる効率化機能ではありません。これは、設計上、コードの実行と自律的なアクションの実行が許可されているシステムの封じ込め境界です。
数字で見るスケール
論文によると、DSec の単一の実稼働規模ユニットは約 160 ノードにまたがります。このユニットは 1 日あたり約 300 万のサンドボックスにサービスを提供し、380,000 を超える同時サンドボックスをサポートし、1 秒あたり 5,000 を超えるサンドボックスの作成を維持します。 DeepSeek の報告によると、これらのメカニズムにより、環境セットアップとイメージ配布のオーバーヘッドが削減され、メモリ効率が向上し、高密度のオーバーコミット下でもレイテンシーに敏感なパフォーマンスが維持されます。
なぜそれが重要なのか
この論文は、DeepSeek 独自のインフラストラクチャに関する DeepSeek からのシステムレポートであるため、独立した監査ではなく企業の開示として読む必要があり、コストやハードウェア調達ではなくアーキテクチャに焦点を当てています。そうした注意点はあるものの、プレスリリースでは決して触れられていないAIラボの内部の貴重な具体的な様子を知ることができる。
3 つのポイントが際立っています。まず、エージェント強化学習は、それ自体がインフラストラクチャの規律となっています。最も多くのロールアウトを、信頼できる単独で最も早く実行できる人は、ライバルよりも早くエージェントのトレーニングを繰り返すことができます。第二に、サンドボックスの設計は、現在ではパフォーマンスのメカニズムであると同時に安全メカニズムでもあります。同月、DeepSeek は報酬ハッキング エージェントを封じ込めるために構築されたプラットフォームを公開し、OpenAI は、そのエージェントが米国政府の Web サイトで予期せぬ動作を示した後、フロンティア モデルのトレーニングを一時停止しました。また、Anthropic は、自社のクロード エージェントが不正行為を行った後、トレーニングの実行を以前に一時停止しました。第三に、開示は自信を示しています。トレーニングスタックの形状を公開すると、競合他社がそれに合わせようとするため、DeepSeek はその競争に満足しているようです。
160 ノードよりはるかに少ないノードでエージェントをトレーニングするすべての人にとって、この論文は設計リファレンス、つまり賢いモデルを実用的なエージェントに変える地味な機構の公開青写真としても機能します。
---
最新の AI ニュース、分析、画期的な情報をすべて 1 か所で入手できます。
AI ニュースをもっと読む→