DeepSeek har släppt DSpark, en spekulativ avkodningsram med öppen källkod som företaget säger accelererar slutledning av stora språkmodeller (LLM) med upp till 85 % under livetrafik, utan någon förlust i utdatakvalitet. Systemet, som beskrivs i en ny artikel från DeepSeek-AI och Peking University, körs redan i DeepSeek-V4-tjänstinfrastrukturen som hanterar verkliga användarförfrågningar.

Arbetet tar itu med ett av de mest envisa problemen inom produktions-AI: slutledning är långsam eftersom modeller genererar text en token i taget, var och en kräver en fullständig passage genom nätverket. Spekulativ avkodning är ett populärt botemedel där en liten, snabb "utkast"-modell föreslår ett block av tokens som fullstorleksmodellen sedan verifierar i ett enda pass och accepterar det längsta korrekta prefixet. Eftersom verifieringen är parallell och matematiskt exakt, snabbar den upp saker och ting samtidigt som den ursprungliga modellens distribution bevaras. DSpark, som släpptes tillsammans med DeepSpec-utbildningsförrådet på GitHub, blev snabbt en av de mest diskuterade AI-teknikhistorierna på Hacker News. For more context on this story, see our ongoing AI trends.

Varför befintlig spekulativ avkodning träffar en vägg

Den senaste tidens spekulativa avkodningsforskning har rört sig mot "parallella ritare" som genererar ett helt block av kandidattokens i ett enda framåtpass, vilket gör utkastslatens nästan oberoende av blockstorleken. DSpark-papperet identifierar två flaskhalsar som har hindrat dessa metoder från att hålla vad de lovar i stor skala.

Det första är ett kvalitetsproblem. Eftersom parallellskrivare förutsäger varje position oberoende, kan de inte modellera hur tokens inom ett block är beroende av varandra. Forskarna visar att detta leder till "multimodala kollisioner" och snabbt acceptansförfall vid senare positioner i ett dragblock, ett fenomen som de kallar suffixförfall. Ju längre parallellblocket är, desto mer sannolikt är svansen fel.

Det andra är ett problem på systemnivå. Även om det är billigt att generera långa dragblock, blir blind verifiering av varje föreslagen token en knapp batchkapacitet på tokens som sannolikt kommer att avvisas. Under den höga samtidigheten av ett verkligt serveringssystem varierar den idealiska verifieringslängden längs två axlar: strukturerade förfrågningar som kod upprätthåller högre acceptansgrader än öppen chatt, och verifiering av extra tokens är nästan gratis under lätt belastning men dyrt när systemet är mättat.

En semi-autoregressiv utkastmodell

För att fixa suffixförfall antar DSpark vad författarna kallar en semi-autoregressiv arkitektur. Den kopplar en beräkningstung parallell ryggrad, som kan föreslå många tokens samtidigt, med en lätt sekventiell modul som introducerar beroendemodellering inom block. Designen är tänkt att kombinera den höga kapaciteten hos parallella modeller vid tidiga positioner med suffixkoherensen hos traditionella autoregressiva ritare, som genererar tokens efter varandra och naturligtvis respekterar beroenden.

På kontrollerade offline-riktmärken som spänner över matematiska resonemang, kodgenerering och daglig chatt rapporterar teamet att DSpark avsevärt förbättrar den accepterade längden per verifieringscykel över starka baslinjer. Specifikt uppger tidningen att DSpark förbättrar accepterad längd över den autoregressiva Eagle3 drafter med 30,9%, 26,7% och 30,0% över tre inställningar, och över den parallella DFlash drafter med 16,3%, 18,4% och 18,3%.

Konfidensschemalagd, belastningsmedveten verifiering

Den mer nya halvan av DSpark är dess metod för verifiering. Istället för att verifiera ett fast antal utkasttokens för varje begäran, formulerar DSpark val av verifieringslängd som ett globalt problem med maximering av genomströmning. Den parar kalibrerade uppskattningar av hur länge ett utkasts prefix sannolikt kommer att överleva, vad tidningen kallar överlevnadssannolikheter, med en hårdvarumedveten schemaläggare som läser av motorbelastning i realtid.

Resultatet är konfidensschemalagd verifiering: systemet skräddarsyr dynamiskt hur många tokens det verifierar för varje begäran baserat på både innehållet i begäran och det aktuella tillståndet för den betjänande motorn. Under lätt belastning har den råd att verifiera generöst, medan den under kraftig samtidighet dirigerar målmodellens verifieringsbudget endast mot tokens med den högsta förväntade avkastningen, vilket undviker genomströmningskollapsen som kommer från att spendera batchkapacitet på tokens med låg sannolikhet.

Resultat under Live User Traffic

De mest följdriktiga siffrorna kommer från produktionen. Teamet installerade DSpark i DeepSeek-V4-serveringssystemet som betjänade användartrafik i realtid och jämförde det med företagets tidigare produktionsbaslinje, en förutsägelsemetod med flera token som kallas MTP-1.

Enligt tidningen accelererar DSpark konsekvent hastigheterna per användares generation med 60 % till 85 % för DeepSeek-V4-Flash och med 57 % till 78 % för DeepSeek-V4-Pro vid matchad sammanlagd genomströmning. Under strikta servicenivåavtal där baslinjens kapacitet försämras kraftigt, motsvarande 120 tokens per sekund för Flash och 50 tokens per sekund för Pro, minskar DSpark verifieringskostnader för att bibehålla robust genomströmning. Genom att övervinna den prestandaklippan hävdar författarna att det låser upp strikta interaktivitetsnivåer som tidigare var ouppnåeliga, vilket effektivt flyttar Pareto-gränsen för LLM-tjänst utåt.

Den skillnaden är viktig för operatörerna. En snabbare hastighet per användare med samma totala genomströmning innebär mer lyhörda assistenter och agentarbetsflöden utan att köpa mer hårdvara, samtidigt som att överleva strikta latens-SLA:er under belastning är det som skiljer en forskningsdemo från ett system som kan hålla i sig under trafikspikar.

Öppen källkod för gemenskapen

DeepSeek släpper de tränade DSpark-kontrollpunkterna för både DeepSeek-V4-Flash och DeepSeek-V4-Pro förhandsvisningsmodellerna. Det medföljande DeepSpec-förrådet, publicerat under den tillåtande MIT-licensen, beskrivs som en full-stack, algoritmdriven utbildnings- och utvärderingskodbas för spekulativ avkodning. Det inkluderar dataförberedande verktyg, utkast till modellimplementeringar, utbildningsskript och utvärderingsselar, och levereras med tre utkastmodellalgoritmer: DSpark, DFlash och Eagle3.

Utgåvan sänker barriären för andra labb och infrastrukturteam att träna och jämföra sina egna utkast till modeller mot en standardiserad pipeline. DeepSpecs utvärderingssvit täcker etablerade riktmärken inklusive GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval och Arena-Hard-v2.

Varför det är viktigt

Slutledningskostnader och latens är nu bland de definierande begränsningarna för AI-industrin, som formar allt från hur aggressivt företag använder AI-agenter till huruvida mindre leverantörer kan konkurrera med hyperskalare när det gäller enhetsekonomi. DSparks bidrag är mindre en enskild ny algoritm än en demonstration av att noggrant samdesign av utkastmodellen och verifieringsschemaläggaren, och behandling av verifieringslängden som en funktion av systemets tillstånd, på ett meningsfullt sätt kan flytta nålen i verkliga installationer.

För DeepSeek, som har byggt sitt rykte på effektiva, öppet släppta system, är DSpark ytterligare en datapunkt i ett argument som labbet har framfört i över ett år: att serveringsprestanda på gränsen kan uppnås genom smartare ingenjörskonst snarare än bara genom rå beräkning. Det faktum att vinsterna mättes under livetrafik, snarare än i ett syntetiskt riktmärke, gör resultatet lättare för andra operatörer att ta på allvar när open source-gemenskapen smälter tidningen och börjar reproducera siffrorna.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →