DeepSeek heeft DSpark uitgebracht, een open-source speculatief decoderingsframework dat volgens het bedrijf de inferentie van grote taalmodellen (LLM) onder live verkeer tot 85% versnelt, zonder enig verlies aan uitvoerkwaliteit. Beschreven in een nieuw artikel van DeepSeek-AI en de Universiteit van Peking, draait het systeem al binnen de DeepSeek-V4-bedieningsinfrastructuur die echte gebruikersverzoeken afhandelt.

Het werk pakt een van de meest hardnekkige problemen in productie-AI aan: gevolgtrekking is traag omdat modellen tekst één token per keer genereren, waarbij elk een volledige doorgang door het netwerk vereist. Speculatieve decodering is een populaire oplossing waarbij een klein, snel 'concept'-model een blok tokens voorstelt dat het model op volledige grootte vervolgens in één keer verifieert, waarbij het langste correcte voorvoegsel wordt geaccepteerd. Omdat de verificatie parallel en wiskundig exact verloopt, versnelt dit de zaken terwijl de distributie van het oorspronkelijke model behouden blijft. DSpark, uitgebracht naast de DeepSpec-trainingsrepository op GitHub, werd al snel een van de meest besproken AI-engineeringverhalen op Hacker News. Voor meer context over dit verhaal, zie ons AI-trends.

Waarom de bestaande speculatieve decodering op een muur stuit

Recent speculatief decoderingsonderzoek is overgegaan op "parallelle opstellers" die een heel blok kandidaat-tokens genereren in een enkele voorwaartse doorgang, waardoor de latentie van de concepten vrijwel onafhankelijk is van de blokgrootte. Het DSpark-artikel identificeert twee knelpunten die ervoor zorgen dat deze methoden hun belofte op grote schaal niet kunnen waarmaken.

Het eerste is een kwaliteitsprobleem. Omdat parallelle opstellers elke positie onafhankelijk voorspellen, kunnen ze niet modelleren hoe tokens binnen een blok van elkaar afhankelijk zijn. De onderzoekers laten zien dat dit leidt tot "multimodale botsingen" en snel acceptatieverval op latere posities in een conceptblok, een fenomeen dat zij achtervoegselverval noemen. Hoe langer het parallelle blok, hoe groter de kans dat de staart verkeerd is.

Het tweede is een probleem op systeemniveau. Hoewel het genereren van lange conceptblokken goedkoop is, verspilt het blindelings verifiëren van elk voorgesteld token schaarse batchcapaciteit aan tokens die waarschijnlijk worden afgewezen. Onder de hoge mate van gelijktijdigheid van een echt bedieningssysteem varieert de ideale verificatielengte langs twee assen: gestructureerde verzoeken zoals code ondersteunen hogere acceptatiepercentages dan chat met een open einde, en het verifiëren van extra tokens is vrijwel gratis bij lichte belasting, maar duur als het systeem verzadigd is.

Een semi-autoregressief conceptmodel

Om achtervoegselverval tegen te gaan, gebruikt DSpark wat de auteurs een semi-autoregressieve architectuur noemen. Het koppelt een computationeel zware parallelle backbone, die veel tokens tegelijk kan voorstellen, met een lichtgewicht sequentiële module die intra-block afhankelijkheidsmodellering introduceert. Het ontwerp is bedoeld om de hoge capaciteit van parallelle modellen op vroege posities te combineren met de achtervoegselcoherentie van traditionele autoregressieve tekenaars, die de een na de ander tokens genereren en uiteraard de afhankelijkheden respecteren.

Op gecontroleerde offline benchmarks die wiskundig redeneren, codegeneratie en dagelijkse chat omvatten, rapporteert het team dat DSpark de geaccepteerde lengte per verificatiecyclus aanzienlijk verbetert ten opzichte van sterke basislijnen. Concreet stelt het artikel dat DSpark de geaccepteerde lengte ten opzichte van de autoregressieve Eagle3-tekenaar verbetert met 30,9%, 26,7% en 30,0% in drie instellingen, en ten opzichte van de parallelle DFlash-tekenaar met 16,3%, 18,4% en 18,3%.

Vertrouwensgeplande, load-aware verificatie

De meer nieuwe helft van DSpark is de benadering van verificatie. In plaats van voor elk verzoek een vast aantal concepttokens te verifiëren, formuleert DSpark de selectie van de verificatielengte als een globaal doorvoermaximalisatieprobleem. Het combineert gekalibreerde schattingen van hoe lang het voorvoegsel van een concept waarschijnlijk zal overleven, wat de krant overlevingskansen noemt, met een hardwarebewuste planner die de realtime motorbelasting afleest.

Het resultaat is een op vertrouwen geplande verificatie: het systeem past dynamisch aan hoeveel tokens het voor elk verzoek verifieert, op basis van zowel de inhoud van het verzoek als de huidige status van de dienende engine. Onder lichte belasting kan het het zich veroorloven genereus te verifiëren, terwijl het onder zware gelijktijdigheid het verificatiebudget van het doelmodel alleen naar tokens met het hoogste verwachte rendement stuurt, waardoor de ineenstorting van de doorvoer wordt vermeden die voortkomt uit het besteden van batchcapaciteit aan tokens met een lage waarschijnlijkheid.

Resultaten onder live gebruikersverkeer

De meest consequente cijfers komen uit de productie. Het team implementeerde DSpark in het DeepSeek-V4-bedieningssysteem dat live gebruikersverkeer bedient en vergeleek het met de eerdere productiebasislijn van het bedrijf, een multi-token-voorspellingsmethode die bekend staat als MTP-1.

Volgens het artikel versnelt DSpark consequent de generatiesnelheden per gebruiker met 60% tot 85% voor DeepSeek-V4-Flash en met 57% tot 78% voor DeepSeek-V4-Pro bij een overeenkomende totale doorvoer. Onder strikte service-level-overeenkomsten waarbij de capaciteit van de basislijn ernstig verslechtert, het equivalent van 120 tokens per seconde voor Flash en 50 tokens per seconde voor Pro, beperkt DSpark de verificatieoverhead om een ​​robuuste doorvoer te behouden. Door deze prestatieklif te overwinnen, stellen de auteurs dat het strikte interactiviteitsniveaus ontsluit die voorheen onbereikbaar waren, waardoor de Pareto-grens van LLM-diensten effectief naar buiten verschuift.

Dat onderscheid is van belang voor exploitanten. Een hogere snelheid per gebruiker bij dezelfde totale doorvoer betekent responsievere assistenten en agentische workflows zonder dat er meer hardware hoeft te worden aangeschaft, terwijl het overleven van strikte latentie-SLA's onder belasting een onderzoeksdemo onderscheidt van een systeem dat stand kan houden tijdens verkeerspieken.

Open source voor de gemeenschap

DeepSeek geeft de getrainde DSpark-controlepunten vrij voor zowel de DeepSeek-V4-Flash als DeepSeek-V4-Pro preview-modellen. De bijbehorende DeepSpec-repository, gepubliceerd onder de tolerante MIT-licentie, wordt beschreven als een full-stack, algoritmegestuurde trainings- en evaluatiecodebasis voor speculatieve decodering. Het omvat hulpprogramma's voor gegevensvoorbereiding, implementaties van conceptmodellen, trainingsscripts en evaluatieharnassen, en wordt geleverd met drie conceptmodelalgoritmen: DSpark, DFlash en Eagle3.

De release verlaagt de drempel voor andere laboratoria en infrastructuurteams om hun eigen conceptmodellen te trainen en te vergelijken met een gestandaardiseerde pijplijn. Het evaluatiepakket van DeepSpec omvat gevestigde benchmarks, waaronder GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval en Arena-Hard-v2.

Waarom het ertoe doet

Inferentiekosten en latentie behoren nu tot de bepalende beperkingen van de AI-industrie en bepalen alles, van hoe agressief bedrijven AI-agenten inzetten tot de vraag of kleinere aanbieders kunnen concurreren met hyperscalers op het gebied van de eenheidseconomie. De bijdrage van DSpark is niet zozeer een enkel nieuw algoritme als wel een demonstratie dat het zorgvuldig samen ontwerpen van het conceptmodel en de verificatieplanner, en het behandelen van de verificatielengte als een functie van de live systeemstatus, de naald in echte implementaties betekenisvol kan bewegen.

Voor DeepSeek, dat zijn reputatie heeft opgebouwd op efficiënte, openlijk vrijgegeven systemen, is DSpark een ander datapunt in een argument dat het lab al meer dan een jaar voert: dat grensverleggende dienstverlening kan worden bereikt door slimmere engineering in plaats van alleen door onbewerkte rekenkracht. Het feit dat de winsten werden gemeten onder live verkeer, in plaats van in een synthetische benchmark, maakt het resultaat voor andere operators gemakkelijker om serieus te nemen terwijl de open-sourcegemeenschap het papier verwerkt en de cijfers begint te reproduceren.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →