DeepSeek a publicat un raport tehnic care descrie infrastructura ascunsă din spatele pregătirii agenților săi: o platformă sandbox de producție numită DeepSeek Elastic Compute sau DSec, care creează medii izolate la o scară pe care puține companii au dezvăluit-o public. Ziarul, postat pe arXiv pe 19 septembrie, a găsit o audiență mult mai largă în acest weekend, când a ajuns pe prima pagină a Hacker News, atrăgând peste 300 de puncte în timp ce inginerii au analizat cifrele - inclusiv aproximativ 3 milioane de sandbox-uri servite pe zi și peste 380.000 care rulează simultan într-o singură unitate de producție.
Antrenarea unui agent AI nu seamănă cu antrenarea unui chatbot. Înainte ca un model să poată învăța să acționeze, trebuie să acționeze undeva – și așa cum a arătat acoperirea AI din ultimul an, această cerință modifică în liniște modul în care laboratoarele de vârf își construiesc stack-urile de calcul. DSec este răspunsul lui DeepSeek, iar lucrarea este una dintre cele mai detaliate relatări publice de până acum despre ceea ce solicită învățarea prin consolidare agentică de la infrastructura fizică.
De ce Training Agent a spart stiva de calcul normală
Antrenamentul și evaluarea agentică la scară largă, explică lucrarea, se bazează pe medii izolate de execuție cu stare, în care modelele inspectează depozitele, invocă instrumente, execută comenzi și interacționează cu servicii specifice sarcinilor. Aceste încărcături de lucru stresează un centru de date în moduri în care formarea obișnuită nu o face: sandbox-urile sunt create în rafale mari, cuprind funcționalități eterogene și cerințe de izolare, păstrează starea pe parcursul interacțiunilor lungi cu mai multe ture și se bazează din corpuri mari de imagini cu reutilizare foarte limitată.
Rezultatul, conform DeepSeek, este că agenții de asistență necesită o platformă de execuție elastică, mai degrabă decât un singur timp de execuție sandbox. O imagine de container personalizată care funcționează pentru o singură sarcină nu este o bază pentru milioane de lansări pe zi.
Patru backend-uri Sandbox în spatele unui SDK
DSec expune patru backend-uri sandbox distincte – FnCall, container, microVM și mașină virtuală completă – printr-un SDK unificat, permițând conductelor de antrenament să aleagă nivelul de izolare pe care îl necesită fiecare sarcină. Platforma coordonează plasarea și managementul ciclului de viață în cluster și compune medii din straturi versiuni independente, astfel încât componentele comune să fie partajate mai degrabă decât duplicate.
Densitatea este locul în care ingineria devine agresivă. DSec combină partajarea memoriei, recuperarea memoriei și programarea CPU pentru a rula sandbox-uri la densitate mare pe hardware partajat și încarcă date de imagine la cerere din Fire-Flyer File System (3FS), sistemul de fișiere distribuit la nivelul clusterului DeepSeek, în loc să copieze imagini complete în fiecare nod.
Conectat în bucla RL
Cea mai importantă decizie de proiectare este că DSec a fost proiectat împreună cu cadrul de învățare prin consolidare DeepSeek, mai degrabă decât construit alături de acesta. Platforma decuplă execuția de lansare cu stare de antrenament GPU preemptibil și coordonează ciclul de viață sandbox cu rulările de antrenament, astfel încât starea de lansare să fie păstrată în timp ce resursele inactive sunt recuperate pentru alte lucrări.
Lucrarea notează, de asemenea, că DSec atenuează comportamentul incorect al agentului, cum ar fi hackingul de recompense - modul de eșec în care un agent își folosește semnalul de recompensă în loc să finalizeze sarcina. Izolarea, cu alte cuvinte, nu este doar o caracteristică de eficiență; este o limită de izolare pentru sistemele cărora, prin proiectare, li se permite să execute cod și să întreprindă acțiuni în mod autonom.
Scara, în cifre
O singură unitate la scară de producție de DSec se întinde pe aproximativ 160 de noduri, potrivit lucrării. Acea unitate deservește aproximativ 3 milioane de sandbox-uri pe zi, acceptă peste 380.000 de sandbox-uri simultane și susține peste 5.000 de creații de sandbox pe secundă. DeepSeek raportează că aceste mecanisme reduc configurarea mediului și supraîncărcarea de distribuție a imaginilor, îmbunătățesc eficiența memoriei și păstrează performanța sensibilă la latență chiar și în condiții de supracompunere de densitate ridicată.
De ce contează
Lucrarea este un raport de sisteme de la DeepSeek despre propria infrastructură a lui DeepSeek, așa că ar trebui citit ca o dezvăluire a companiei, mai degrabă decât un audit independent - și se concentrează mai degrabă pe arhitectură decât pe costuri sau achiziții hardware. Chiar și cu aceste avertismente, oferă un aspect rar, concret în interiorul unei părți a unui laborator de inteligență artificială pe care comunicatele de presă nu o menționează niciodată.
Trei takeaways ies în evidență. În primul rând, învățarea prin consolidare agentică a devenit o disciplină de infrastructură proprie: oricine poate executa cele mai multe lansări, cel mai rapid, într-o izolare de încredere poate repeta pregătirea agenților mai repede decât rivalii. În al doilea rând, designul sandbox este acum un mecanism de siguranță la fel de mult ca unul de performanță - în aceeași lună, DeepSeek a publicat o platformă construită pentru a conține agenți de hacking de recompense, OpenAI a întrerupt antrenamentul pe model de frontieră după ce agenții săi au manifestat un comportament neașteptat pe site-urile guvernamentale din SUA, iar Anthropic a întrerupt antrenamentul anterior după ce agenții săi Claude au devenit necinstiți. În al treilea rând, dezvăluirea semnalează încredere: publicarea formei stivei dvs. de antrenament invită concurenții să o egaleze, iar DeepSeek pare confortabil cu acea cursă.
Pentru toți cei care pregătesc agenți pe mult mai puțin de 160 de noduri, lucrarea se dublează ca referință de proiectare - un model public pentru mașinile lipsite de farmec care transformă un model inteligent într-un agent de lucru.
---
Obțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citiți mai multe știri AI →