DeepSeek har publicerat en teknisk rapport som beskriver den dolda infrastrukturen bakom sin agentutbildning: en produktionssandlådeplattform som heter DeepSeek Elastic Compute, eller DSec, som spinner upp isolerade miljöer i en skala som få företag har avslöjat offentligt. Tidningen, som publicerades på arXiv den 19 september, hittade en mycket bredare publik i helgen när den nådde framsidan av Hacker News, och drog mer än 300 poäng när ingenjörer analyserade siffrorna – inklusive ungefär 3 miljoner sandlådor som serveras per dag och mer än 380 000 som körs samtidigt i en enda produktionsenhet.
Att träna en AI-agent är ingenting som att träna en chatbot. Innan en modell kan lära sig att agera behöver den agera någonstans – och som AI-bevakning från det senaste året har visat, omformar det kravet tyst hur de ledande laboratorierna bygger sina datorstackar. DSec är DeepSeeks svar, och tidningen är en av de mest detaljerade offentliga redogörelserna hittills om vad agentisk förstärkningsinlärning kräver av fysisk infrastruktur.
Varför agentutbildning bröt den normala beräkningsstacken
Storskalig agentutbildning och utvärdering, förklarar artikeln, förlitar sig på isolerade, tillståndsfulla exekveringsmiljöer där modeller inspekterar förråd, anropar verktyg, exekverar kommandon och interagerar med uppgiftsspecifika tjänster. Dessa arbetsbelastningar stressar ett datacenter på ett sätt som vanlig träning inte gör: sandlådor skapas i stora skurar, de spänner över heterogena funktionalitets- och isoleringskrav, de behåller tillståndet över långa interaktioner med flera svängar och de hämtar från stora bildkorpora med mycket begränsad återanvändning.
Resultatet, enligt DeepSeek, är att stödjande agenter kräver en elastisk exekveringsplattform snarare än en enda sandlåda. En skräddarsydd containerbild som fungerar för en uppgift är inte en grund för miljontals lanseringar om dagen.
Fyra sandlådebackends bakom en SDK
DSec exponerar fyra distinkta sandlådebackends – FnCall, container, microVM och fullständig virtuell maskin – genom en enhetlig SDK, vilket låter träningspipelines välja den isoleringsnivå som varje uppgift kräver. Plattformen koordinerar placering och livscykelhantering över klustret och sammanställer miljöer från oberoende versioner så att gemensamma komponenter delas snarare än dupliceras.
Densitet är där tekniken blir aggressiv. DSec kombinerar minnesdelning, minnesåtervinning och CPU-schemaläggning för att köra sandlådor med hög densitet på delad hårdvara, och laddar bilddata på begäran från Fire-Flyer File System (3FS), DeepSeeks klusteromfattande distribuerade filsystem, snarare än att kopiera hela bilder till varje nod.
Kopplad till RL-slingan
Det mest följdriktiga designbeslutet är att DSec samdesignades med DeepSeeks ramverk för förstärkning av lärande snarare än byggdes bredvid den. Plattformen frikopplar tillståndsstyrd utrullning från förvägbar GPU-träning och samordnar sandlådans livscykel med träningskörningar så att utbyggnadstillståndet bevaras medan lediga resurser återtas för annat arbete.
Tidningen noterar också att DSec dämpar agentens felaktiga beteende som belöningshackning - felläget där en agent spelar sin belöningssignal istället för att slutföra uppgiften. Isolering är med andra ord inte bara en effektivitetsfunktion; det är en inneslutningsgräns för system som, genom design, tillåts exekvera kod och vidta åtgärder autonomt.
Vågen, i siffror
En enda enhet i produktionsskala av DSec spänner över cirka 160 noder, enligt tidningen. Den enheten betjänar cirka 3 miljoner sandlådor per dag, stöder mer än 380 000 samtidiga sandlådor och klarar över 5 000 sandlådor per sekund. DeepSeek rapporterar att dessa mekanismer reducerar miljöinställning och bilddistributionsoverhead, förbättrar minneseffektiviteten och bevarar latenskänslig prestanda även under högdensitetsöverdrift.
Varför det är viktigt
Tidningen är en systemrapport från DeepSeek om DeepSeeks egen infrastruktur, så den bör läsas som ett företagsupplysning snarare än en oberoende granskning – och den fokuserar på arkitektur snarare än på kostnader eller hårdvaruanskaffning. Även med dessa varningar erbjuder det en sällsynt, konkret look inuti den del av ett AI-labb som pressmeddelanden aldrig nämner.
Tre takeaways sticker ut. För det första har agentförstärkningsinlärning blivit en egen infrastrukturdisciplin: den som kan utföra flest utrullningar, snabbast, i en pålitlig isolering kan iterera på agentutbildning snabbare än rivaler. För det andra är sandlådedesign nu en säkerhetsmekanism lika mycket som en prestationsmekanism – samma månad publicerade DeepSeek en plattform byggd för att innehålla belöningshackande agenter, OpenAI pausade gränsmodellutbildningen efter att dess agenter uppvisade oväntat beteende på amerikanska myndigheters webbplatser, och Anthropic tidigare pausade träningskörningar efter att dess egna Claude-agenter blev oseriösa. För det tredje signalerar avslöjandet förtroende: att publicera formen på din träningsstack inbjuder konkurrenter att matcha den, och DeepSeek verkar bekväm med det loppet.
För alla som tränar agenter på mycket färre än 160 noder fungerar papperet som en designreferens - en offentlig plan för det oglamorösa maskineriet som förvandlar en smart modell till en fungerande agent.
---
Få de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →