DeepSeek zveřejnil technickou zprávu popisující skrytou infrastrukturu za školením agentů: produkční sandboxovou platformu nazvanou DeepSeek Elastic Compute nebo DSec, která vytváří izolovaná prostředí v rozsahu, který jen málo společností veřejně zveřejnilo. Noviny, zveřejněné na arXiv 19. září, si tento víkend našly mnohem širší publikum, když se dostaly na titulní stránku Hacker News, když inženýři analyzovali čísla, získali více než 300 bodů – včetně zhruba 3 milionů sandboxů obsluhovaných denně a více než 380 000 běžících souběžně v jedné produkční jednotce.

Školení agenta AI není nic jako školení chatbota. Než se model naučí jednat, musí někde jednat – a jak ukázalo pokrytí umělou inteligencí z minulého roku, tento požadavek v tichosti přetváří způsob, jakým přední laboratoře vytvářejí své výpočetní zásobníky. DSec je odpovědí DeepSeek a tento článek je jedním z dosud nejpodrobnějších veřejných popisů toho, co učení agentů vyžaduje od fyzické infrastruktury.

Proč školení agentů rozbilo normální výpočetní zásobník

Rozsáhlé školení a hodnocení agentů, vysvětluje článek, spoléhají na izolovaná, stavová spouštěcí prostředí, ve kterých modely kontrolují úložiště, vyvolávají nástroje, spouštějí příkazy a komunikují se službami specifickými pro úkoly. Tyto pracovní zátěže zatěžují datová centra způsobem, který běžné školení nedělá: sandboxy jsou vytvářeny ve velkých dávkách, pokrývají heterogenní požadavky na funkčnost a izolaci, zachovávají si stav během dlouhých víceotáčkových interakcí a čerpají z velkých obrazových korpusů s velmi omezeným opětovným použitím.

Výsledkem podle DeepSeek je, že podpůrné agenty vyžadují spíše pružnou platformu pro provádění než jediné runtime sandboxu. Obraz kontejneru na míru, který funguje pro jeden úkol, není základem pro miliony zavedení denně.

Čtyři backendy sandbox za jedním SDK

DSec odhaluje čtyři odlišné sandboxové backendy – FnCall, kontejner, microVM a úplný virtuální stroj – prostřednictvím jednotné sady SDK, která umožňuje trénovacím kanálům vybrat úroveň izolace, kterou každý úkol vyžaduje. Platforma koordinuje správu umístění a životního cyklu v celém clusteru a skládá prostředí z nezávisle verzovaných vrstev, takže společné komponenty jsou sdíleny, nikoli duplikovány.

Hustota je místo, kde se inženýrství stává agresivní. DSec kombinuje sdílení paměti, rekultivaci paměti a plánování CPU pro spouštění sandboxů s vysokou hustotou na sdíleném hardwaru a načítá obrazová data na vyžádání z Fire-Flyer File System (3FS), celoklastrového distribuovaného souborového systému DeepSeek, namísto kopírování úplných obrazů do každého uzlu.

Zapojeno do RL smyčky

Nejdůležitějším návrhovým rozhodnutím je, že DSec byl navržen společně s výukovým rámcem DeepSeek, nikoli postaven vedle něj. Platforma odděluje provádění stavového zavádění od preemptivního školení GPU a koordinuje životní cyklus izolovaného prostoru s běhy školení, takže stav zavádění je zachován, zatímco nečinné zdroje jsou získávány pro jinou práci.

Dokument také poznamenává, že DSec zmírňuje špatné chování agentů, jako je hacking odměn – režim selhání, ve kterém agent hraje svůj signál odměny místo dokončení úkolu. Izolace, jinými slovy, není jen vlastnost efektivity; je to hranice pro systémy, které mají ze své podstaty povoleno spouštět kód a provádět akce autonomně.

Měřítko v číslech

Jedna produkční jednotka DSec podle papíru zahrnuje přibližně 160 uzlů. Tato jednotka obsluhuje přibližně 3 miliony sandboxů denně, podporuje více než 380 000 souběžných sandboxů a udržuje více než 5 000 vytvoření sandboxů za sekundu. DeepSeek uvádí, že tyto mechanismy snižují režii nastavení prostředí a distribuce obrázků, zlepšují efektivitu paměti a zachovávají výkon citlivý na latenci i při přetížení s vysokou hustotou.

Proč na tom záleží

Tento dokument je systémovou zprávou od DeepSeek o vlastní infrastruktuře DeepSeek, takže by se měl chápat spíše jako zveřejnění společnosti než jako nezávislý audit – a zaměřuje se spíše na architekturu než na náklady nebo pořízení hardwaru. I s těmito výhradami nabízí vzácný, konkrétní pohled do části laboratoře AI, o které se tiskové zprávy nikdy nezmiňují.

Vynikají tři jídla s sebou. Zaprvé, učení agentů se stalo samostatnou disciplínou v oblasti infrastruktury: kdo dokáže provést nejvíce zavádění, nejrychleji, v důvěryhodné izolaci, může opakovat školení agentů rychleji než soupeři. Zadruhé, sandboxový design je nyní bezpečnostním mechanismem stejně jako výkonnostním – tentýž měsíc DeepSeek zveřejnil platformu vytvořenou tak, aby obsahovala agenty hackingu odměn, OpenAI pozastavila školení hraničních modelů poté, co její agenti projevili neočekávané chování na webových stránkách americké vlády, a Anthropic dříve pozastavil tréninkové běhy poté, co se její vlastní agenti Claude zbláznili. Za třetí, zveřejnění signalizuje důvěru: zveřejnění tvaru vašeho tréninkového zásobníku vyzve konkurenty, aby se s ním vyrovnali, a DeepSeek se zdá být s tímto závodem spokojen.

Pro každého, kdo školí agenty na mnohem méně než 160 uzlech, slouží tento papír také jako referenční návrh – veřejný plán pro neokázalý stroj, který z chytrého modelu udělá fungujícího agenta.
---

Stay Ahead of AI

Získejte nejnovější zprávy, analýzy a průlomové informace o umělé inteligenci – vše na jednom místě.

Přečtěte si další zprávy o AI →