DeepSeek opublikował raport techniczny opisujący ukrytą infrastrukturę stojącą za szkoleniem agentów: produkcyjną platformę typu sandbox o nazwie DeepSeek Elastic Compute (DSec), która uruchamia izolowane środowiska na skalę ujawnianą publicznie przez niewiele firm. Artykuł, opublikowany w serwisie arXiv 19 września, znalazł w ten weekend znacznie szerszą publiczność, kiedy trafił na pierwszą stronę Hacker News, zdobywając ponad 300 punktów, gdy inżynierowie analizowali liczby – w tym około 3 miliony piaskownic obsługiwanych dziennie i ponad 380 000 działających jednocześnie w jednej jednostce produkcyjnej.

Szkolenie agenta AI w niczym nie przypomina szkolenia chatbota. Zanim model nauczy się działać, musi gdzieś działać — a jak pokazały badania AI z ostatniego roku, wymóg ten po cichu zmienia sposób, w jaki wiodące laboratoria budują swoje stosy obliczeniowe. DSec jest odpowiedzią DeepSeek, a artykuł ten jest jednym z najbardziej szczegółowych jak dotąd publicznych raportów na temat wymagań związanych z uczeniem się przez wzmacnianie agentów od infrastruktury fizycznej.

Dlaczego szkolenie agentów zepsuło normalny stos obliczeniowy

Jak wyjaśnia artykuł, szkolenie i ocena agentów na dużą skalę opierają się na izolowanych, stanowych środowiskach wykonawczych, w których modele sprawdzają repozytoria, wywołują narzędzia, wykonują polecenia i wchodzą w interakcję z usługami specyficznymi dla danego zadania. Te obciążenia obciążają centrum danych w sposób, jakiego nie powoduje zwykłe szkolenie: piaskownice są tworzone w dużych seriach, obejmują heterogeniczną funkcjonalność i wymagania dotyczące izolacji, zachowują stan podczas długich, wieloobrotowych interakcji i czerpią z dużych korpusów obrazów z bardzo ograniczonym ponownym wykorzystaniem.

Według DeepSeek rezultat jest taki, że agenci wspierający wymagają elastycznej platformy wykonawczej, a nie pojedynczego środowiska wykonawczego piaskownicy. Indywidualny obraz kontenera, który sprawdza się w jednym zadaniu, nie jest podstawą do milionów wdrożeń dziennie.

Cztery backendy piaskownicy za jednym pakietem SDK

DSec udostępnia cztery różne backendy piaskownicy — FnCall, kontener, microVM i pełną maszynę wirtualną — za pośrednictwem ujednoliconego pakietu SDK, umożliwiając potokom szkoleniowym wybór poziomu izolacji wymaganego dla każdego zadania. Platforma koordynuje rozmieszczanie i zarządzanie cyklem życia w klastrze oraz komponuje środowiska z niezależnie wersjonowanych warstw, dzięki czemu wspólne komponenty są udostępniane, a nie duplikowane.

Gęstość to miejsce, w którym inżynieria staje się agresywna. DSec łączy w sobie współdzielenie pamięci, odzyskiwanie pamięci i planowanie procesora, aby uruchamiać piaskownice z dużą gęstością na współdzielonym sprzęcie i ładuje dane obrazów na żądanie z Fire-Flyer File System (3FS), rozproszonego systemu plików DeepSeek obejmującego cały klaster, zamiast kopiować pełne obrazy do każdego węzła.

Podłączony do pętli RL

Najbardziej konsekwentną decyzją projektową jest to, że DSec został zaprojektowany wspólnie z platformą uczenia się przez wzmacnianie DeepSeek, a nie zbudowany obok niej. Platforma oddziela stanowe wykonanie wdrożenia od szkolenia GPU z możliwością wywłaszczenia i koordynuje cykl życia piaskownicy z przebiegami szkoleniowymi, dzięki czemu stan wdrożenia zostaje zachowany, a bezczynne zasoby są odzyskiwane do innych prac.

W artykule zauważono również, że DSec łagodzi niewłaściwe zachowanie agentów, takie jak hakowanie nagród – tryb niepowodzenia, w którym agent wykorzystuje sygnał nagrody zamiast ukończyć zadanie. Innymi słowy, izolacja to nie tylko cecha zwiększająca wydajność; jest to granica ograniczająca dla systemów, które z założenia mogą wykonywać kod i podejmować działania autonomicznie.

Skala w liczbach

Według artykułu pojedyncza jednostka DSec na skalę produkcyjną obejmuje około 160 węzłów. Jednostka ta obsługuje około 3 miliony piaskownic dziennie, obsługuje ponad 380 000 jednoczesnych piaskownic i podtrzymuje ponad 5000 utworzonych piaskownic na sekundę. DeepSeek podaje, że mechanizmy te zmniejszają obciążenie związane z konfiguracją środowiska i dystrybucją obrazów, poprawiają wydajność pamięci i zachowują wydajność wrażliwą na opóźnienia nawet w przypadku nadmiernego obciążenia o dużej gęstości.

Dlaczego to ma znaczenie

Artykuł ten jest raportem systemowym firmy DeepSeek na temat własnej infrastruktury DeepSeek, dlatego należy go czytać jako ujawnienie informacji firmy, a nie niezależny audyt – i skupia się na architekturze, a nie na kosztach czy zakupie sprzętu. Nawet z tymi zastrzeżeniami oferuje rzadkie, konkretne spojrzenie na część laboratorium sztucznej inteligencji, o której nigdy nie wspomina się w komunikatach prasowych.

Wyróżniają się trzy dania na wynos. Po pierwsze, uczenie się przez wzmacnianie agentów stało się samodzielną dyscypliną w zakresie infrastruktury: ktokolwiek może wykonać najwięcej wdrożeń, najszybciej i w godnej zaufania izolacji, może kontynuować szkolenie agentów szybciej niż rywale. Po drugie, projekt piaskownicy jest obecnie mechanizmem zarówno zabezpieczającym, jak i zapewniającym wydajność — w tym samym miesiącu DeepSeek opublikował platformę zbudowaną tak, aby zawierała agentów hakujących nagrody, OpenAI wstrzymało szkolenie w zakresie modeli granicznych po tym, jak jego agenci wykazali nieoczekiwane zachowanie na stronach internetowych rządu USA, a Anthropic wcześniej wstrzymał szkolenia po tym, jak jej agenci Claude popadli w nieuczciwość. Po trzecie, ujawnienie sygnalizuje pewność siebie: opublikowanie kształtu zestawu treningowego zachęca konkurentów do dopasowania go, a DeepSeek wydaje się czuć dobrze w tym wyścigu.

Dla każdego, kto szkoli agentów na znacznie mniej niż 160 węzłach, artykuł ten służy również jako odniesienie do projektu — publiczny plan nieestetycznej maszynerii, która zamienia sprytny model w działającego agenta.
---

Wyprzedź sztuczną inteligencję

Otrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

Przeczytaj więcej aktualności o sztucznej inteligencji →