DeepSeek uvolnil DSpark, open-source spekulativní dekódovací rámec, který podle společnosti urychluje odvození velkého jazykového modelu (LLM) až o 85 % při živém provozu, bez jakékoli ztráty kvality výstupu. Jak je popsáno v novém článku DeepSeek-AI a Pekingské univerzity, systém již běží uvnitř infrastruktury obsluhy DeepSeek-V4, která zpracovává skutečné požadavky uživatelů.

Práce řeší jeden z nejobtížnějších problémů v produkční umělé inteligenci: vyvozování je pomalé, protože modely generují text jeden token po druhém, přičemž každý vyžaduje úplný průchod sítí. Spekulativní dekódování je populární prostředek, ve kterém malý, rychlý „návrh“ model navrhuje blok tokenů, které pak model v plné velikosti ověřuje v jediném průchodu a přijímá nejdelší správnou předponu. Protože je verifikace paralelní a matematicky přesná, urychluje věci při zachování původní distribuce modelu. DSpark, vydaný spolu se školicím repozitářem DeepSpec na GitHubu, se rychle stal jedním z nejvíce diskutovaných příběhů o inženýrství AI na Hacker News. For more context on this story, see our ongoing breaking AI news.

Proč stávající spekulativní dekódování narazí na zeď

Nedávný výzkum spekulativního dekódování se posunul směrem k „paralelním návrhářům“, které generují celý blok kandidátských tokenů v jediném dopředném průchodu, díky čemuž je latence návrhu téměř nezávislá na velikosti bloku. Dokument DSpark identifikuje dvě úzká hrdla, která těmto metodám brání v plnění jejich slibů ve velkém měřítku.

První je problém s kvalitou. Protože paralelní navrhovatelé předpovídají každou pozici nezávisle, nemohou modelovat, jak na sobě žetony v bloku závisí. Výzkumníci ukazují, že to vede k „multimodálním kolizím“ a rychlému poklesu přijatelnosti v pozdějších pozicích v tahovém bloku, což je jev, který nazývají rozpad přípony. Čím delší je paralelní blok, tím je pravděpodobnější, že je jeho ocas nesprávný.

Druhým je problém na systémové úrovni. I když je generování dlouhých bloků konceptu levné, slepé ověřování každého navrhovaného tokenu plýtvá vzácnou dávkovou kapacitou tokenů, které budou pravděpodobně odmítnuty. Při vysoké souběžnosti skutečného obslužného systému se ideální délka ověřování liší ve dvou osách: strukturované požadavky, jako je kód, mají vyšší míru přijetí než chat s otevřeným koncem a ověřování dalších tokenů je téměř zdarma při nízké zátěži, ale drahé, když je systém nasycený.

Poloautoregresivní model tahu

K nápravě rozpadu přípony přebírá DSpark to, co autoři nazývají semi-autoregresivní architektura. Spojuje výpočetně náročnou paralelní páteř, která může navrhovat mnoho tokenů najednou, s lehkým sekvenčním modulem, který zavádí modelování závislostí uvnitř bloku. Design má kombinovat vysokou kapacitu paralelních modelů na raných pozicích s příponovou koherencí tradičních autoregresních drafterů, které generují tokeny jeden po druhém a přirozeně respektují závislosti.

Na řízených offline srovnávacích testech zahrnujících matematické uvažování, generování kódu a každodenní chat, tým uvádí, že DSpark podstatně zlepšuje přijatelnou délku jednoho ověřovacího cyklu oproti silným výchozím hodnotám. Dokument konkrétně uvádí, že DSpark zlepšuje přijatelnou délku oproti autoregresivnímu koncipovači Eagle3 o 30,9 %, 26,7 % a 30,0 % ve třech nastaveních a oproti paralelnímu vytahovači DFlash o 16,3 %, 18,4 % a 18,3 %.

Naplánované ověřování s ohledem na zatížení

Novější polovinou DSparku je jeho přístup k ověřování. Spíše než ověřování pevného počtu návrhů tokenů pro každý požadavek formuluje DSpark výběr délky ověření jako globální problém maximalizace propustnosti. Spáruje kalibrované odhady toho, jak dlouho předpona návrhu pravděpodobně přežije, čemuž se v článku říká pravděpodobnosti přežití, s hardwarovým plánovačem, který čte zatížení motoru v reálném čase.

Výsledkem je ověřování naplánované na základě spolehlivosti: systém dynamicky přizpůsobuje počet tokenů, které ověřuje pro každý požadavek, na základě obsahu požadavku a aktuálního stavu obslužného jádra. Při nízké zátěži si může dovolit ověřovat velkoryse, zatímco při velké souběžnosti směruje ověřovací rozpočet cílového modelu pouze k tokenům s nejvyšší očekávanou návratností, čímž se vyhne kolapsu propustnosti, který pochází z utrácení kapacity dávky za tokeny s nízkou pravděpodobností.

Výsledky v rámci živého provozu uživatelů

Nejsouvislejší čísla pocházejí z výroby. Tým nasadil DSpark uvnitř obslužného systému DeepSeek-V4 obsluhujícího živý uživatelský provoz a porovnal jej s předchozí výrobní základnou společnosti, metodou predikce s více tokeny známou jako MTP-1.

Podle dokumentu DSpark konzistentně zrychluje rychlost generování na uživatele o 60 % až 85 % pro DeepSeek-V4-Flash a o 57 % až 78 % pro DeepSeek-V4-Pro při odpovídající celkové propustnosti. Podle přísných smluv o úrovni služeb, kde se základní kapacita výrazně zhoršuje, což je ekvivalent 120 tokenů za sekundu pro Flash a 50 tokenů za sekundu pro Pro, snižuje DSpark režii ověřování, aby byla zachována robustní propustnost. Překonáním tohoto výkonnostního útesu autoři argumentují, že odemyká přísné úrovně interaktivity, které byly dříve nedosažitelné, a účinně posouvají Paretovu hranici poskytování LLM směrem ven.

Toto rozlišení je pro operátory důležité. Vyšší rychlost na uživatele při stejné celkové propustnosti znamená citlivější asistenty a agentní pracovní postupy bez nákupu dalšího hardwaru, zatímco přežití přísných latenčních SLA při zatížení je to, co odděluje výzkumnou ukázku od systému, který může vydržet během špiček provozu.

Otevřený zdroj pro komunitu

DeepSeek uvolňuje natrénované kontrolní body DSpark pro testovací modely DeepSeek-V4-Flash a DeepSeek-V4-Pro. Doprovodný repozitář DeepSpec, publikovaný pod tolerantní licencí MIT, je popsán jako úplný zásobník, algoritmem řízená trénovací a vyhodnocovací kódová základna pro spekulativní dekódování. Zahrnuje nástroje pro přípravu dat, implementace návrhu modelu, školicí skripty a vyhodnocovací svazky a dodává se se třemi algoritmy návrhu modelu: DSpark, DFlash a Eagle3.

Tato verze snižuje bariéru pro ostatní laboratoře a týmy pro infrastrukturu, aby trénovaly a porovnávaly své vlastní modely návrhů se standardizovaným potrubím. Hodnotící sada DeepSpec pokrývá zavedené benchmarky včetně GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval a Arena-Hard-v2.

Proč na tom záleží

Odvozená cena a latence jsou nyní mezi definujícími omezeními odvětví umělé inteligence a ovlivňují vše od toho, jak agresivně společnosti nasazují agenty umělé inteligence, až po to, zda menší poskytovatelé mohou konkurovat hyperškálovačům v ekonomice jednotek. Příspěvek DSparku není ani tak jediným novým algoritmem, ale ukázkou toho, že pečlivé společné navrhování modelu návrhu a plánovače verifikace a zpracování délky ověřování jako funkce živého stavu systému může smysluplně posunout jehlu v reálném nasazení.

Pro DeepSeek, který si vybudoval svou reputaci na efektivních, otevřeně vydávaných systémech, je DSpark dalším datovým bodem v argumentu, který laboratoř prosazuje již více než rok: že hraničního výkonu obsluhy lze dosáhnout pomocí chytřejšího inženýrství, nikoli pouze pomocí nezpracovaných výpočtů. Skutečnost, že zisky byly měřeny v reálném provozu, spíše než v syntetickém benchmarku, usnadňuje ostatním operátorům, aby výsledek brali vážně, protože open-source komunita stráví papír a začne reprodukovat čísla.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →