DeepSeek은 에이전트 교육 뒤에 숨은 인프라를 설명하는 기술 보고서를 발표했습니다. DeepSeek Elastic Compute(DSec)라는 프로덕션 샌드박스 플랫폼은 소수의 회사가 공개한 규모로 격리된 환경을 가동합니다. 9월 19일 arXiv에 게시된 이 논문은 이번 주말 Hacker News의 첫 페이지에 게재되면서 훨씬 더 많은 독자를 발견했습니다. 엔지니어들이 숫자를 분석하면서 하루에 대략 300만 개의 샌드박스가 제공되고 단일 생산 단위에서 동시에 실행되는 380,000개 이상의 샌드박스를 포함하여 300개 이상의 포인트를 얻었습니다.

AI 에이전트 교육은 챗봇 교육과 다르지 않습니다. 모델이 행동하는 방법을 배우려면 먼저 행동할 곳이 필요합니다. 작년의 AI 보도에서 알 수 있듯이 이러한 요구 사항은 선도적인 연구실에서 컴퓨팅 스택을 구축하는 방식을 조용히 재편하고 있습니다. DSec은 DeepSeek의 답변이며, 이 논문은 에이전트 강화 학습이 물리적 인프라에서 요구하는 것이 무엇인지에 대한 가장 상세한 공개 설명 중 하나입니다.

에이전트 훈련이 일반 컴퓨팅 스택을 깨뜨린 이유

대규모 에이전트 교육 및 평가는 모델이 리포지토리를 검사하고, 도구를 호출하고, 명령을 실행하고, 작업별 서비스와 상호 작용하는 격리된 상태 저장 실행 환경에 의존한다고 설명합니다. 이러한 워크로드는 일반적인 교육과 달리 데이터 센터에 스트레스를 줍니다. 샌드박스는 대규모로 생성되고, 이기종 기능 및 격리 요구 사항을 포괄하고, 오랜 다중 턴 상호 작용에서 상태를 유지하고, 매우 제한된 재사용으로 대규모 이미지 모음에서 가져옵니다.

DeepSeek에 따르면 결과적으로 지원 에이전트에는 단일 샌드박스 런타임이 아닌 탄력적인 실행 플랫폼이 필요하다는 것입니다. 하나의 작업에 적합한 맞춤형 컨테이너 이미지는 하루에 수백만 건의 롤아웃을 위한 기반이 아닙니다.

하나의 SDK 뒤에 4개의 샌드박스 백엔드

DSec는 통합 SDK를 통해 FnCall, 컨테이너, microVM, 전체 가상 머신 등 4가지 개별 샌드박스 백엔드를 노출하므로 교육 파이프라인이 각 작업에 필요한 격리 수준을 선택할 수 있습니다. 플랫폼은 클러스터 전반에 걸쳐 배치 및 수명주기 관리를 조정하고, 공통 구성 요소가 복제되지 않고 공유되도록 독립적으로 버전이 지정된 계층에서 환경을 구성합니다.

밀도는 엔지니어링이 공격적으로 변하는 부분입니다. DSec는 메모리 공유, 메모리 회수 및 CPU 스케줄링을 결합하여 공유 하드웨어에서 고밀도로 샌드박스를 실행하고 전체 이미지를 모든 노드에 복사하는 대신 DeepSeek의 클러스터 전체 분산 파일 시스템인 Fire-Flyer 파일 시스템(3FS)에서 요청 시 이미지 데이터를 로드합니다.

RL 루프에 연결됨

가장 중요한 설계 결정은 DSec이 DeepSeek의 강화 학습 프레임워크 옆에 구축되지 않고 함께 설계되었다는 것입니다. 플랫폼은 선점형 GPU 훈련에서 상태 저장 롤아웃 실행을 분리하고 샌드박스 수명주기를 훈련 실행과 조정하여 롤아웃 상태가 보존되는 동안 유휴 리소스가 다른 작업을 위해 회수되도록 합니다.

또한 이 논문에서는 DSec이 에이전트가 작업을 완료하는 대신 보상 신호를 게임하는 실패 모드인 보상 해킹과 같은 에이전트의 잘못된 행동을 완화한다고 언급합니다. 즉, 격리는 단순한 효율성 기능이 아닙니다. 이는 설계상 코드를 실행하고 자율적으로 조치를 취하도록 허용된 시스템에 대한 격리 경계입니다.

숫자로 보는 척도

논문에 따르면 DSec의 단일 생산 규모 단위는 약 160개 노드에 걸쳐 있습니다. 이 장치는 하루에 약 300만 개의 샌드박스를 제공하고, 380,000개 이상의 동시 샌드박스를 지원하며, 초당 5,000개 이상의 샌드박스 생성을 유지합니다. DeepSeek는 이러한 메커니즘이 환경 설정 및 이미지 배포 오버헤드를 줄이고, 메모리 효율성을 향상시키며, 고밀도 오버커밋에서도 지연 시간에 민감한 성능을 유지한다고 보고합니다.

중요한 이유

이 백서는 DeepSeek의 자체 인프라에 대한 DeepSeek의 시스템 보고서이므로 독립적인 감사가 아닌 회사 공개로 읽어야 하며 비용이나 하드웨어 조달보다는 아키텍처에 중점을 둡니다. 이러한 경고에도 불구하고 보도자료에서는 전혀 언급되지 않은 AI 연구소의 내부를 드물고 구체적인 모습으로 보여줍니다.

세 가지 테이크아웃이 눈에 띕니다. 첫째, 에이전트 강화 학습은 그 자체로 인프라 분야가 되었습니다. 신뢰할 수 있는 격리 상태에서 가장 많은 롤아웃을 가장 빠르게 실행할 수 있는 사람은 누구나 경쟁사보다 더 빠르게 에이전트 훈련을 반복할 수 있습니다. 둘째, 샌드박스 설계는 이제 성능만큼이나 안전 메커니즘입니다. 같은 달에 DeepSeek은 보상 해킹 에이전트를 포함하기 위해 구축된 플랫폼을 발표했고, OpenAI는 에이전트가 미국 정부 웹사이트에서 예상치 못한 행동을 보인 후 프론티어 모델 훈련을 일시 중지했으며, Anthropic은 이전에 자체 Claude 에이전트가 불량한 후 훈련 실행을 일시 중지했습니다. 셋째, 공개는 자신감을 나타냅니다. 훈련 스택의 형태를 게시하면 경쟁자가 그에 맞춰 경쟁하도록 초대하고 DeepSeek은 그러한 경쟁에 편안함을 느끼는 것 같습니다.

160개보다 훨씬 적은 노드에서 에이전트를 교육하는 모든 사람에게 이 문서는 영리한 모델을 작동하는 에이전트로 바꾸는 화려하지 않은 기계에 대한 공개 청사진인 설계 참조로도 활용됩니다.
---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →