DeepSeek heeft een technisch rapport gepubliceerd waarin de verborgen infrastructuur achter zijn agenttraining wordt beschreven: een productie-sandboxplatform genaamd DeepSeek Elastic Compute, of DSec, dat geïsoleerde omgevingen opstart op een schaal die maar weinig bedrijven openbaar hebben gemaakt. De krant, die op 19 september op arXiv werd geplaatst, vond dit weekend een veel groter publiek toen het de voorpagina van Hacker News bereikte. Het leverde meer dan 300 punten op toen ingenieurs de cijfers analyseerden – waaronder ongeveer 3 miljoen sandboxes die per dag worden bediend en meer dan 380.000 die tegelijkertijd in één productie-eenheid draaien.
Het trainen van een AI-agent lijkt in niets op het trainen van een chatbot. Voordat een model kan leren handelen, moet het ergens kunnen handelen – en zoals AI-verslaggeving van het afgelopen jaar heeft aangetoond, verandert die vereiste stilletjes de manier waarop de leidende laboratoria hun compute-stacks bouwen. DSec is het antwoord van DeepSeek, en het artikel is een van de meest gedetailleerde publieke verslagen tot nu toe van wat agentic versterkend leren vraagt van de fysieke infrastructuur.
Waarom agenttraining de normale rekenstapel kapot maakte
Grootschalige agentische training en evaluatie, legt het artikel uit, is afhankelijk van geïsoleerde, stateful uitvoeringsomgevingen waarin modellen opslagplaatsen inspecteren, tools aanroepen, opdrachten uitvoeren en communiceren met taakspecifieke services. Deze werklasten belasten een datacenter op een manier die bij gewone training niet het geval is: sandboxes worden in grote hoeveelheden gecreëerd, ze omvatten heterogene functionaliteit en isolatie-eisen, ze behouden hun status tijdens lange multi-turn interacties, en ze putten uit grote beeldcorpora met zeer beperkt hergebruik.
Het resultaat is volgens DeepSeek dat ondersteunende agenten een elastisch uitvoeringsplatform vereisen in plaats van een enkele sandbox-runtime. Een op maat gemaakte containerimage die voor één taak werkt, is geen basis voor miljoenen implementaties per dag.
Vier sandbox-backends achter één SDK
DSec biedt vier verschillende sandbox-backends – FnCall, container, microVM en volledige virtuele machine – via een uniforme SDK, waardoor trainingspijplijnen het isolatieniveau kunnen kiezen dat elke taak vereist. Het platform coördineert de plaatsing en het levenscyclusbeheer in het hele cluster, en stelt omgevingen samen uit lagen met onafhankelijke versies, zodat gemeenschappelijke componenten worden gedeeld in plaats van gedupliceerd.
Dichtheid is waar de techniek agressief wordt. DSec combineert het delen van geheugen, geheugenterugwinning en CPU-planning om sandboxes met hoge dichtheid op gedeelde hardware uit te voeren, en laadt afbeeldingsgegevens op aanvraag vanuit het Fire-Flyer File System (3FS), het clusterbrede gedistribueerde bestandssysteem van DeepSeek, in plaats van volledige afbeeldingen naar elk knooppunt te kopiëren.
Bedraad in de RL-lus
De meest consequente ontwerpbeslissing is dat DSec mede is ontworpen met het versterkende leerframework van DeepSeek in plaats van ernaast te worden gebouwd. Het platform koppelt de stateful implementatie-uitvoering los van verwijderbare GPU-training, en coördineert de sandbox-levenscyclus met trainingsuitvoeringen, zodat de implementatiestatus behouden blijft terwijl inactieve bronnen worden teruggewonnen voor ander werk.
Het artikel merkt ook op dat DSec het wangedrag van agenten, zoals het hacken van beloningen, vermindert – de faalmodus waarin een agent zijn beloningssignaal speelt in plaats van de taak te voltooien. Met andere woorden: isolatie is niet alleen een efficiëntiekenmerk; het is een inperkingsgrens voor systemen die, door hun ontwerp, autonoom code mogen uitvoeren en acties kunnen ondernemen.
De schaal, in cijfers
Eén enkele DSec-eenheid op productieschaal omvat volgens de krant ongeveer 160 knooppunten. Die eenheid bedient ongeveer 3 miljoen sandboxes per dag, ondersteunt meer dan 380.000 gelijktijdige sandboxes en ondersteunt meer dan 5.000 sandboxcreaties per seconde. DeepSeek meldt dat deze mechanismen de omgevingsinstellingen en de overhead voor beelddistributie verminderen, de geheugenefficiëntie verbeteren en latentiegevoelige prestaties behouden, zelfs bij overcommit met hoge dichtheid.
Waarom het ertoe doet
Het artikel is een systeemrapport van DeepSeek over de eigen infrastructuur van DeepSeek, dus het moet worden gelezen als een bedrijfsopenbaarmaking in plaats van een onafhankelijke audit – en het richt zich eerder op de architectuur dan op de kosten of de aanschaf van hardware. Zelfs met deze kanttekeningen biedt het een zeldzame, concrete blik in het deel van een AI-lab waar persberichten nooit melding van maken.
Drie afhaalrestaurants vallen op. Ten eerste is het leren van agenten een infrastructuurdiscipline op zich geworden: degene die de meeste rollouts, het snelst en in betrouwbare isolatie kan uitvoeren, kan de training van agenten sneller herhalen dan zijn rivalen. Ten tweede is het sandbox-ontwerp nu zowel een veiligheidsmechanisme als een prestatiemechanisme: dezelfde maand publiceerde DeepSeek een platform dat was gebouwd om agenten voor het hacken van beloningen te bevatten, stopte OpenAI de training van frontier-modellen nadat zijn agenten onverwacht gedrag vertoonden op websites van de Amerikaanse overheid, en anthropic stopte eerder de trainingsruns nadat zijn eigen Claude-agenten schurkenstaten waren. Ten derde duidt de onthulling op vertrouwen: het publiceren van de vorm van je trainingsstapel nodigt concurrenten uit om deze te evenaren, en DeepSeek lijkt zich op zijn gemak te voelen bij die race.
Voor iedereen die agenten traint op veel minder dan 160 knooppunten, fungeert het document ook als ontwerpreferentie: een openbare blauwdruk voor de weinig glamoureuze machinerie die een slim model in een werkende agent verandert.
---
Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.
Lees meer AI-nieuws →