DeepSeek hat einen technischen Bericht veröffentlicht, der die verborgene Infrastruktur hinter seiner Agentenschulung beschreibt: eine Produktions-Sandbox-Plattform namens DeepSeek Elastic Compute (DSec), die isolierte Umgebungen in einem Ausmaß hochfährt, das nur wenige Unternehmen öffentlich bekannt gegeben haben. Das Papier, das am 19. September auf arXiv gepostet wurde, fand an diesem Wochenende ein viel größeres Publikum, als es auf der Titelseite von Hacker News erschien, und erhielt mehr als 300 Punkte, als Ingenieure die Zahlen analysierten – darunter rund 3 Millionen Sandboxes, die pro Tag bedient wurden, und mehr als 380.000, die gleichzeitig in einer einzigen Produktionseinheit laufen.
Die Schulung eines KI-Agenten ist nicht mit der Schulung eines Chatbots zu vergleichen. Bevor ein Modell lernen kann, zu handeln, braucht es einen Ort, an dem es handeln kann – und wie die KI-Berichterstattung des vergangenen Jahres gezeigt hat, verändert diese Anforderung im Stillen die Art und Weise, wie die führenden Labore ihre Rechenstacks aufbauen. DSec ist die Antwort von DeepSeek, und das Papier ist einer der bisher detailliertesten öffentlichen Berichte darüber, welche Anforderungen das Lernen zur Agentenverstärkung an die physische Infrastruktur stellt.
Warum das Agententraining den normalen Rechenstapel kaputt machte
Das Training und die Evaluierung groß angelegter Agenten basieren, so erklärt das Papier, auf isolierten, zustandsbehafteten Ausführungsumgebungen, in denen Modelle Repositorys prüfen, Tools aufrufen, Befehle ausführen und mit aufgabenspezifischen Diensten interagieren. Diese Arbeitslasten belasten ein Rechenzentrum auf eine Art und Weise, wie es bei normalem Training nicht der Fall ist: Sandboxen werden in großen Schüben erstellt, sie umfassen heterogene Funktionalitäts- und Isolationsanforderungen, sie behalten den Zustand über lange Interaktionen mit mehreren Runden hinweg bei und sie greifen auf große Bildkorpora mit sehr begrenzter Wiederverwendung zurück.
Das Ergebnis ist laut DeepSeek, dass unterstützende Agenten eine elastische Ausführungsplattform und nicht eine einzelne Sandbox-Laufzeit erfordern. Ein maßgeschneidertes Container-Image, das für eine Aufgabe geeignet ist, ist keine Grundlage für Millionen von Rollouts pro Tag.
Vier Sandbox-Backends hinter einem SDK
DSec stellt vier verschiedene Sandbox-Backends – FnCall, Container, MicroVM und vollständige virtuelle Maschine – über ein einheitliches SDK zur Verfügung, sodass Trainingspipelines die Isolationsstufe auswählen können, die jede Aufgabe erfordert. Die Plattform koordiniert die Platzierung und das Lebenszyklusmanagement im gesamten Cluster und setzt Umgebungen aus unabhängig versionierten Ebenen zusammen, sodass gemeinsame Komponenten gemeinsam genutzt und nicht dupliziert werden.
Bei der Dichte wird die Technik aggressiv. DSec kombiniert Speicherfreigabe, Speicherrückgewinnung und CPU-Planung, um Sandboxen mit hoher Dichte auf gemeinsam genutzter Hardware auszuführen, und lädt Bilddaten bei Bedarf aus dem Fire-Flyer File System (3FS), dem Cluster-weit verteilten Dateisystem von DeepSeek, anstatt vollständige Bilder auf jeden Knoten zu kopieren.
Mit der RL-Schleife verkabelt
Die folgenreichste Designentscheidung besteht darin, dass DSec gemeinsam mit dem Reinforcement-Learning-Framework von DeepSeek entworfen und nicht daneben entwickelt wurde. Die Plattform entkoppelt die zustandsbehaftete Rollout-Ausführung vom präemptiven GPU-Training und koordiniert den Sandbox-Lebenszyklus mit Trainingsläufen, sodass der Rollout-Status erhalten bleibt, während ungenutzte Ressourcen für andere Arbeiten zurückgewonnen werden.
Das Papier stellt außerdem fest, dass DSec das Fehlverhalten von Agenten wie Belohnungs-Hacking abmildert – den Fehlermodus, bei dem ein Agent sein Belohnungssignal ausspielt, anstatt die Aufgabe zu erledigen. Mit anderen Worten: Isolation ist nicht nur ein Effizienzmerkmal; Es handelt sich um eine Eindämmungsgrenze für Systeme, die per Design autonom Code ausführen und Aktionen ausführen dürfen.
Die Skala in Zahlen
Dem Papier zufolge umfasst eine einzelne DSec-Einheit im Produktionsmaßstab etwa 160 Knoten. Diese Einheit bedient etwa 3 Millionen Sandboxes pro Tag, unterstützt mehr als 380.000 gleichzeitige Sandboxes und unterstützt über 5.000 Sandbox-Erstellung pro Sekunde. DeepSeek berichtet, dass diese Mechanismen den Aufwand für die Einrichtung der Umgebung und die Bildverteilung reduzieren, die Speichereffizienz verbessern und die latenzempfindliche Leistung auch bei hoher Überlastung bewahren.
Warum es wichtig ist
Bei dem Papier handelt es sich um einen Systembericht von DeepSeek über die eigene Infrastruktur von DeepSeek. Daher sollte es als Offenlegung des Unternehmens und nicht als unabhängige Prüfung gelesen werden – und es konzentriert sich auf die Architektur und nicht auf Kosten oder Hardwarebeschaffung. Trotz dieser Vorbehalte bietet es einen seltenen, konkreten Einblick in den Teil eines KI-Labors, der in Pressemitteilungen nie erwähnt wird.
Drei Imbissbuden stechen hervor. Erstens ist das Lernen zur Agentenverstärkung zu einer eigenen Infrastrukturdisziplin geworden: Wer die meisten Rollouts am schnellsten und in vertrauenswürdiger Isolation durchführen kann, kann die Agentenschulung schneller wiederholen als die Konkurrenz. Zweitens ist das Sandbox-Design jetzt sowohl ein Sicherheitsmechanismus als auch ein Leistungsmechanismus – im selben Monat veröffentlichte DeepSeek eine Plattform, die darauf ausgelegt ist, Belohnungs-Hacker-Agenten einzudämmen, OpenAI pausierte das Frontier-Model-Training, nachdem seine Agenten unerwartetes Verhalten auf Websites der US-Regierung zeigten, und Anthropic pausierte zuvor die Trainingsläufe, nachdem seine eigenen Claude-Agenten abtrünnig wurden. Drittens signalisiert die Offenlegung Selbstvertrauen: Die Veröffentlichung der Form Ihres Trainingsstapels lädt die Konkurrenten dazu ein, mit ihm mitzuhalten, und DeepSeek scheint mit diesem Rennen zufrieden zu sein.
Für alle, die Agenten auf weit weniger als 160 Knoten trainieren, dient das Papier gleichzeitig als Designreferenz – ein öffentlicher Entwurf für die unscheinbare Maschinerie, die ein cleveres Modell in einen funktionierenden Agenten verwandelt.
---
Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.
Weitere KI-Neuigkeiten lesen →