DeepSeek ha pubblicato un rapporto tecnico che descrive l'infrastruttura nascosta dietro la formazione degli agenti: una piattaforma sandbox di produzione chiamata DeepSeek Elastic Compute, o DSec, che crea ambienti isolati su una scala che poche aziende hanno divulgato pubblicamente. Il documento, pubblicato su arXiv il 19 settembre, ha trovato un pubblico molto più ampio questo fine settimana quando ha raggiunto la prima pagina di Hacker News, ottenendo più di 300 punti mentre gli ingegneri analizzavano i numeri, inclusi circa 3 milioni di sandbox serviti al giorno e più di 380.000 in esecuzione contemporaneamente in una singola unità di produzione.

Addestrare un agente AI non è come addestrare un chatbot. Prima che un modello possa imparare ad agire, ha bisogno di un posto dove agire e come ha dimostrato la copertura sull'intelligenza artificiale dell'ultimo anno, tale requisito sta tranquillamente rimodellando il modo in cui i principali laboratori costruiscono i propri stack di calcolo. DSec è la risposta di DeepSeek e il documento è uno dei resoconti pubblici più dettagliati finora su ciò che l'apprendimento di rinforzo dell'agente richiede dall'infrastruttura fisica.

Perché la formazione degli agenti ha rotto il normale stack di elaborazione

La formazione e la valutazione degli agenti su larga scala, spiega il documento, si basano su ambienti di esecuzione isolati e con stato in cui i modelli ispezionano repository, invocano strumenti, eseguono comandi e interagiscono con servizi specifici per attività. Questi carichi di lavoro stressano un data center in modi diversi dalla formazione ordinaria: i sandbox vengono creati in grandi quantità, abbracciano funzionalità eterogenee e requisiti di isolamento, mantengono lo stato attraverso lunghe interazioni multi-turno e attingono da corpora di immagini di grandi dimensioni con un riutilizzo molto limitato.

Il risultato, secondo DeepSeek, è che gli agenti di supporto richiedono una piattaforma di esecuzione elastica anziché un singolo runtime sandbox. Un'immagine di un contenitore su misura che funzioni per un'attività non è la base per milioni di implementazioni al giorno.

Quattro backend sandbox dietro un unico SDK

DSec espone quattro backend sandbox distinti (FnCall, contenitore, microVM e macchina virtuale completa) tramite un SDK unificato, consentendo alle pipeline di addestramento di scegliere il livello di isolamento richiesto da ciascuna attività. La piattaforma coordina il posizionamento e la gestione del ciclo di vita nel cluster e compone ambienti da livelli con versioni indipendenti in modo che i componenti comuni siano condivisi anziché duplicati.

La densità è il punto in cui l'ingegneria diventa aggressiva. DSec combina la condivisione della memoria, il recupero della memoria e la pianificazione della CPU per eseguire sandbox ad alta densità su hardware condiviso e carica i dati delle immagini su richiesta dal Fire-Flyer File System (3FS), il file system distribuito a livello di cluster di DeepSeek, anziché copiare immagini complete su ogni nodo.

Collegato al circuito RL

La decisione progettuale più importante è che DSec è stato co-progettato con il framework di apprendimento per rinforzo di DeepSeek piuttosto che costruito accanto ad esso. La piattaforma disaccoppia l'esecuzione del rollout con stato dall'addestramento della GPU prerilasciabile e coordina il ciclo di vita del sandbox con le esecuzioni del training in modo che lo stato di implementazione venga preservato mentre le risorse inattive vengono recuperate per altre attività.

Il documento rileva inoltre che DSec mitiga il comportamento scorretto degli agenti come l'hacking della ricompensa, la modalità di fallimento in cui un agente manipola il segnale di ricompensa invece di completare l'attività. L’isolamento, in altre parole, non è solo una caratteristica di efficienza; è un confine di contenimento per i sistemi a cui, in base alla progettazione, è consentito eseguire codice e intraprendere azioni in modo autonomo.

La Scala, in Numeri

Secondo il documento, una singola unità DSec su scala di produzione si estende su circa 160 nodi. Questa unità serve circa 3 milioni di sandbox al giorno, supporta più di 380.000 sandbox simultanei e sostiene oltre 5.000 creazioni di sandbox al secondo. DeepSeek riferisce che questi meccanismi riducono il sovraccarico di configurazione dell'ambiente e di distribuzione delle immagini, migliorano l'efficienza della memoria e preservano le prestazioni sensibili alla latenza anche in caso di overcommit ad alta densità.

Perché è importante

Il documento è un rapporto di sistema di DeepSeek sull'infrastruttura di DeepSeek, quindi dovrebbe essere letto come un'informativa aziendale piuttosto che come un audit indipendente e si concentra sull'architettura piuttosto che sui costi o sull'approvvigionamento dell'hardware. Anche con questi avvertimenti, offre uno sguardo raro e concreto all'interno della parte di un laboratorio di intelligenza artificiale che i comunicati stampa non menzionano mai.

Spiccano tre takeaway. In primo luogo, l’apprendimento per rinforzo degli agenti è diventato una disciplina infrastrutturale a sé stante: chiunque sia in grado di eseguire il maggior numero di implementazioni, più velocemente e in un isolamento affidabile, può eseguire l’iterazione della formazione degli agenti più velocemente dei rivali. In secondo luogo, il design sandbox è ora un meccanismo di sicurezza tanto quanto prestazionale: lo stesso mese in cui DeepSeek ha pubblicato una piattaforma creata per contenere agenti di hacking ricompensati, OpenAI ha sospeso l'addestramento del modello di frontiera dopo che i suoi agenti hanno mostrato comportamenti inaspettati sui siti Web del governo degli Stati Uniti e Anthropic ha precedentemente sospeso l'addestramento dopo che i suoi stessi agenti Claude si sono rivelati disonesti. In terzo luogo, la divulgazione segnala fiducia: pubblicare la forma del tuo stack di allenamento invita i concorrenti ad abbinarlo e DeepSeek sembra a suo agio con quella gara.

Per tutti coloro che addestrano agenti su molto meno di 160 nodi, il documento funge anche da riferimento di progettazione: un progetto pubblico per il macchinario poco affascinante che trasforma un modello intelligente in un agente funzionante.
---

Stai al passo con l'intelligenza artificiale

Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →