DeepSeek wypuścił DSpark, platformę dekodowania spekulatywnego o otwartym kodzie źródłowym, która według firmy przyspiesza wnioskowanie z modelu dużego języka (LLM) nawet o 85% w ruchu na żywo, bez jakiejkolwiek utraty jakości wyjściowej. Opisany w nowym artykule DeepSeek-AI i Uniwersytetu w Pekinie system działa już w infrastrukturze obsługującej DeepSeek-V4, która obsługuje rzeczywiste żądania użytkowników.

Praca rozwiązuje jeden z najbardziej uporczywych problemów produkcyjnej sztucznej inteligencji: wnioskowanie jest powolne, ponieważ modele generują tekst po jednym tokenie na raz, a każdy wymaga pełnego przejścia przez sieć. Dekodowanie spekulatywne to popularne rozwiązanie, w którym mały, szybki model „szkicowy” proponuje blok tokenów, który następnie model pełnowymiarowy weryfikuje w jednym przebiegu, akceptując najdłuższy poprawny przedrostek. Ponieważ weryfikacja jest równoległa i dokładna matematycznie, przyspiesza działanie, zachowując jednocześnie rozkład oryginalnego modelu. DSpark, wydany wraz z repozytorium szkoleniowym DeepSpec w serwisie GitHub, szybko stał się jednym z najczęściej omawianych artykułów na temat inżynierii sztucznej inteligencji w Hacker News. Więcej kontekstu na ten temat znajdziesz w naszych najnowsze osiągnięcia AI.

Dlaczego istniejące dekodowanie spekulatywne uderza w mur

Niedawne badania spekulatywne nad dekodowaniem skierowały się w stronę „równoległych twórców”, którzy generują cały blok potencjalnych tokenów w jednym przebiegu do przodu, dzięki czemu opóźnienie wersji roboczej jest prawie niezależne od rozmiaru bloku. W artykule DSpark wskazano dwa wąskie gardła, które uniemożliwiają tym metodom realizację pokładanych w nich nadziei na dużą skalę.

Pierwszym z nich jest problem z jakością. Ponieważ równoległi kreślacze przewidują każdą pozycję niezależnie, nie mogą modelować wzajemnej zależności żetonów w bloku. Naukowcy pokazują, że prowadzi to do „kolizji multimodalnych” i szybkiego zaniku akceptacji w późniejszych pozycjach bloku ciągu, co nazywają zanikiem przyrostków. Im dłuższy blok równoległy, tym większe prawdopodobieństwo, że jego ogon jest błędny.

Drugi to problem na poziomie systemu. Chociaż generowanie długich bloków roboczych jest tanie, ślepa weryfikacja każdego proponowanego tokenu marnuje niewielką pojemność wsadową na tokeny, które mogą zostać odrzucone. W przypadku dużej współbieżności prawdziwego systemu obsługującego idealna długość weryfikacji różni się w dwóch osiach: ustrukturyzowane żądania, takie jak kod, zapewniają wyższy współczynnik akceptacji niż czat otwarty, a weryfikacja dodatkowych tokenów jest prawie bezpłatna przy niewielkim obciążeniu, ale kosztowna, gdy system jest nasycony.

Półautoregresywny model szkicu

Aby naprawić zanikanie przyrostków, DSpark przyjmuje to, co autorzy nazywają architekturą półautoregresywną. Łączy w sobie obciążający obliczeniowo równoległy szkielet, który może proponować wiele tokenów jednocześnie, z lekkim modułem sekwencyjnym, który wprowadza modelowanie zależności wewnątrz bloków. Projekt ma łączyć dużą pojemność modeli równoległych na wczesnych pozycjach ze spójnością sufiksów tradycyjnych autorów autoregresyjnych, które generują tokeny jeden po drugim i w naturalny sposób szanują zależności.

W kontrolowanych testach porównawczych offline obejmujących rozumowanie matematyczne, generowanie kodu i codzienny czat zespół podaje, że DSpark znacznie poprawia akceptowaną długość na cykl weryfikacji w porównaniu z mocnymi wartościami bazowymi. W artykule stwierdzono, że DSpark poprawia akceptowaną długość w porównaniu z autoregresyjnym narzędziem kreślarskim Eagle3 o 30,9%, 26,7% i 30,0% w trzech ustawieniach oraz w porównaniu z równoległym kreślarzem DFlash o 16,3%, 18,4% i 18,3%.

Weryfikacja zaplanowana z uwzględnieniem obciążenia i uwzględniająca obciążenie

Bardziej nowatorską połową DSpark jest podejście do weryfikacji. Zamiast weryfikować stałą liczbę tokenów wersji roboczej dla każdego żądania, DSpark formułuje wybór długości weryfikacji jako problem globalnej maksymalizacji przepustowości. Łączy skalibrowane szacunki tego, jak długo prefiks wersji roboczej prawdopodobnie przetrwa, co w artykule nazywa się prawdopodobieństwem przetrwania, z harmonogramem obsługującym sprzęt, który odczytuje obciążenie silnika w czasie rzeczywistym.

Rezultatem jest weryfikacja z harmonogramem zaufania: system dynamicznie dostosowuje liczbę tokenów, które sprawdza dla każdego żądania, zarówno na podstawie treści żądania, jak i bieżącego stanu silnika obsługującego. Przy niewielkim obciążeniu może pozwolić sobie na hojną weryfikację, podczas gdy przy dużej współbieżności kieruje budżet weryfikacyjny modelu docelowego tylko w stronę tokenów o najwyższym oczekiwanym zwrocie, unikając załamania przepustowości wynikającego z wydawania mocy wsadowej na tokeny o niskim prawdopodobieństwie.

Wyniki w obszarze Ruch użytkowników na żywo

Najważniejsze liczby pochodzą z produkcji. Zespół wdrożył DSpark w systemie obsługującym DeepSeek-V4 obsługującym ruch użytkowników na żywo i porównał go z wcześniejszą bazową wersją produkcyjną firmy, wielotokenową metodą przewidywania znaną jako MTP-1.

Według artykułu DSpark konsekwentnie zwiększa prędkość generowania danych na użytkownika o 60% do 85% w przypadku DeepSeek-V4-Flash i o 57% do 78% w przypadku DeepSeek-V4-Pro przy dopasowanej łącznej przepustowości. W ramach ścisłych umów dotyczących poziomu usług, w przypadku których pojemność bazowa ulega znacznemu pogorszeniu, co odpowiada 120 tokenom na sekundę w przypadku Flash i 50 tokenów na sekundę w przypadku wersji Pro, DSpark ogranicza obciążenie związane z weryfikacją, aby utrzymać wysoką przepustowość. Autorzy twierdzą, że przezwyciężenie tego urwiska wydajnościowego odblokowuje rygorystyczne poziomy interaktywności, które wcześniej były nieosiągalne, skutecznie przesuwając granicę Pareto w zakresie usług LLM na zewnątrz.

To rozróżnienie ma znaczenie dla operatorów. Większa prędkość na użytkownika przy tej samej całkowitej przepustowości oznacza bardziej responsywnych asystentów i agentyczne przepływy pracy bez konieczności kupowania większej ilości sprzętu, a przetrwanie rygorystycznych umów SLA dotyczących opóźnień pod obciążeniem odróżnia wersję demonstracyjną od systemu, który może wytrzymać skoki ruchu.

Oprogramowanie typu open source dla społeczności

DeepSeek udostępnia przeszkolone punkty kontrolne DSpark zarówno dla modeli demonstracyjnych DeepSeek-V4-Flash, jak i DeepSeek-V4-Pro. Towarzyszące repozytorium DeepSpec, opublikowane na liberalnej licencji MIT, jest opisane jako pełna, oparta na algorytmach baza kodów szkoleniowych i ewaluacyjnych do dekodowania spekulatywnego. Zawiera narzędzia do przygotowywania danych, implementacje modeli roboczych, skrypty szkoleniowe i zestawy ewaluacyjne, a także dostarcza trzy algorytmy modeli roboczych: DSpark, DFlash i Eagle3.

To wydanie zmniejsza barierę dla innych laboratoriów i zespołów zajmujących się infrastrukturą w zakresie szkolenia i porównywania własnych wersji roboczych modeli ze standardowym potokiem. Pakiet ewaluacyjny DeepSpec obejmuje uznane testy porównawcze, w tym GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval i Arena-Hard-v2.

Dlaczego to ma znaczenie

Koszt wnioskowania i opóźnienia należą obecnie do najważniejszych ograniczeń branży sztucznej inteligencji, kształtując wszystko, od tego, jak agresywnie firmy wdrażają agentów AI, po to, czy mniejsi dostawcy mogą konkurować z hiperskalerami pod względem ekonomii jednostkowej. Wkład DSpark to nie tyle pojedynczy nowy algorytm, ile demonstracja, że ​​staranne wspólne projektowanie modelu roboczego i harmonogramu weryfikacji oraz traktowanie długości weryfikacji jako funkcji aktywnego stanu systemu może znacząco wpłynąć na wynik rzeczywistych wdrożeń.

Dla firmy DeepSeek, która zbudowała swoją reputację na wydajnych, ogólnodostępnych systemach, DSpark to kolejny punkt danych potwierdzający argument, który laboratorium przedstawia od ponad roku: że pionierską wydajność obsługi można osiągnąć dzięki inteligentniejszej inżynierii, a nie tylko poprzez surowe obliczenia. Fakt, że zyski mierzono na podstawie bieżącego ruchu, a nie syntetycznego testu porównawczego, ułatwia innym operatorom potraktowanie wyników poważnie, gdy społeczność open source przeanalizuje papier i zacznie odtwarzać liczby.

---

Bądź na Bieżąco z AI

Najnowsze wiadomości, analizy i przełomy w dziedzinie AI — wszystko w jednym miejscu.

Czytaj więcej wiadomości AI →