DeepSeek a lansat DSpark, un cadru de decodare speculativ open-source despre care compania spune că accelerează inferența modelului de limbă mare (LLM) cu până la 85% sub trafic live, fără nicio pierdere a calității rezultatelor. Descris într-o nouă lucrare de la DeepSeek-AI și de la Universitatea Peking, sistemul rulează deja în interiorul infrastructurii de servire DeepSeek-V4 care gestionează cererile reale ale utilizatorilor.
Lucrarea abordează una dintre cele mai încăpățânate probleme ale AI de producție: inferența este lentă, deoarece modelele generează text câte un simbol, fiecare necesitând o trecere completă prin rețea. Decodificarea speculativă este un remediu popular în care un model de „schiță” mic și rapid propune un bloc de jetoane pe care modelul de dimensiune completă le verifică apoi într-o singură trecere, acceptând cel mai lung prefix corect. Deoarece verificarea este paralelă și exactă din punct de vedere matematic, accelerează lucrurile, păstrând în același timp distribuția modelului original. DSpark, lansat împreună cu depozitul de instruire DeepSpec de pe GitHub, a devenit rapid una dintre cele mai discutate povești de inginerie AI pe Hacker News. For more context on this story, see our ongoing breaking AI news.
De ce decodificarea speculativă existentă lovește un perete
Cercetările recente privind decodificarea speculativă s-au îndreptat către „descrieri paraleli” care generează un întreg bloc de jetoane candidate într-o singură trecere înainte, făcând latența draftului aproape independentă de dimensiunea blocului. Lucrarea DSpark identifică două blocaje care au împiedicat aceste metode să își atingă promisiunea la scară.
Prima este o problemă de calitate. Deoarece redactorii paraleli prezic fiecare poziție în mod independent, ei nu pot modela modul în care jetoanele dintr-un bloc depind unele de altele. Cercetătorii arată că acest lucru duce la „coliziuni multimodale” și la dezintegrarea rapidă a acceptării în pozițiile ulterioare într-un bloc de proiect, un fenomen pe care îl numesc dezintegrare sufix. Cu cât blocul paralel este mai lung, cu atât este mai probabil ca coada lui să fie greșită.
A doua este o problemă la nivel de sistem. În timp ce generarea de blocuri lungi de draft este ieftină, verificarea orbește fiecare token propus risipește o capacitate redusă de lot pentru token-urile care ar putea fi respinse. Sub concurența ridicată a unui sistem de servire real, lungimea ideală de verificare variază de-a lungul a două axe: cererile structurate, cum ar fi codul, susțin rate de acceptare mai mari decât chat-ul deschis, iar verificarea token-urilor suplimentare este aproape gratuită în condiții de sarcină ușoară, dar costisitoare atunci când sistemul este saturat.
Un model de schiță semi-autoregresiv
Pentru a remedia degradarea sufixului, DSpark adoptă ceea ce autorii numesc o arhitectură semi-autoregresivă. Acesta cuplează o coloană vertebrală paralelă grea din punct de vedere computațional, care poate propune mai multe jetoane simultan, cu un modul secvenţial ușor care introduce modelarea dependenței intra-bloc. Design-ul este menit să combine capacitatea mare a modelelor paralele la pozițiile inițiale cu coerența sufixului redactorului autoregresiv tradițional, care generează jetoane unul după altul și respectă în mod natural dependențele.
Pe benchmark-uri controlate offline, care acoperă raționamentul matematic, generarea de cod și chatul zilnic, echipa raportează că DSpark îmbunătățește substanțial durata acceptată pe ciclu de verificare față de liniile de bază puternice. Mai exact, lucrarea afirmă că DSpark îmbunătățește lungimea acceptată față de redactorul autoregresiv Eagle3 cu 30,9%, 26,7% și 30,0% în trei setări și față de desenul paralel DFlash cu 16,3%, 18,4% și 18,3%.
Verificare programată cu încredere, în funcție de încărcare
Jumătatea mai nouă a DSpark este abordarea sa de verificare. În loc să verifice un număr fix de jetoane draft pentru fiecare cerere, DSpark formulează selecția duratei de verificare ca o problemă globală de maximizare a debitului. El împerechează estimări calibrate ale cât de mult timp este probabil să supraviețuiască prefixul unui proiect, ceea ce lucrarea numește probabilități de supraviețuire, cu un planificator care știe hardware care citește sarcina motorului în timp real.
Rezultatul este verificarea programată în funcție de încredere: sistemul adaptează în mod dinamic câte jetoane verifică pentru fiecare cerere, pe baza atât conținutului cererii, cât și stării curente a motorului de servire. În condiții de încărcare ușoară își poate permite să verifice cu generozitate, în timp ce în condiții de concurență puternică, direcționează bugetul de verificare al modelului țintă doar către jetoanele cu cea mai mare rentabilitate așteptată, evitând colapsul debitului care vine din cheltuirea capacității lotului pe jetoane cu probabilitate scăzută.
Rezultate sub Trafic de utilizatori live
Cele mai importante numere provin din producție. Echipa a implementat DSpark în cadrul sistemului de servire DeepSeek-V4 care deservește traficul live al utilizatorilor și l-a comparat cu linia de referință anterioară a companiei, o metodă de predicție multi-token cunoscută sub numele de MTP-1.
Potrivit lucrării, DSpark accelerează în mod constant vitezele de generare per utilizator cu 60% până la 85% pentru DeepSeek-V4-Flash și cu 57% până la 78% pentru DeepSeek-V4-Pro la un debit agregat egal. Conform unor acorduri stricte de nivel de serviciu, în care capacitatea liniei de bază se deteriorează grav, echivalentul a 120 de jetoane pe secundă pentru Flash și 50 de jetoane pe secundă pentru Pro, DSpark atenuează supraîncărcarea de verificare pentru a menține un debit robust. Depășind această stâncă de performanță, autorii susțin că deblochează niveluri stricte de interactivitate care anterior nu erau atinse, schimbând efectiv frontiera Pareto a serviciilor LLM în exterior.
Această distincție contează pentru operatori. O viteză mai rapidă per utilizator la același debit total înseamnă asistenți mai receptivi și fluxuri de lucru agentice fără a cumpăra mai mult hardware, în timp ce supraviețuirea SLA-urilor stricte de latență sub încărcare este ceea ce separă un demo de cercetare de un sistem care poate rezista în timpul creșterilor de trafic.
Deschis pentru comunitate
DeepSeek lansează punctele de control DSpark instruite atât pentru modelele de previzualizare DeepSeek-V4-Flash, cât și pentru DeepSeek-V4-Pro. Depozitul DeepSpec însoțitor, publicat sub licența permisivă MIT, este descris ca o bază de cod de instruire și evaluare bazată pe algoritmi, pentru decodare speculativă. Acesta include utilitare de pregătire a datelor, implementări de modele nefinalizate, scripturi de antrenament și hamuri de evaluare și este livrat cu trei algoritmi de model de schiță: DSpark, DFlash și Eagle3.
Versiunea reduce bariera pentru alte laboratoare și echipe de infrastructură de a-și antrena și compara propriile modele de proiect față de o conductă standardizată. Suita de evaluare a DeepSpec acoperă standarde stabilite, inclusiv GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval și Arena-Hard-v2.
De ce contează
Costurile de inferență și latența se numără acum printre constrângerile definitorii ale industriei AI, modelând totul, de la modul în care companiile implementează agenții AI până la faptul că furnizorii mai mici pot concura cu hiperscalerii în ceea ce privește economia unității. Contribuția DSpark este mai puțin un singur algoritm nou, decât o demonstrație că proiectarea cu atenție a modelului schiță și a planificatorului de verificare și tratarea lungimii verificării ca o funcție a stării sistemului în timp real poate muta în mod semnificativ acul în implementări reale.
Pentru DeepSeek, care și-a construit reputația pe sisteme eficiente, lansate în mod deschis, DSpark este un alt punct de date într-un argument pe care laboratorul l-a susținut de peste un an: că performanța de servire de frontieră poate fi atinsă printr-o inginerie mai inteligentă, mai degrabă decât doar prin calcul brut. Faptul că câștigurile au fost măsurate în trafic live, mai degrabă decât într-un benchmark sintetic, face ca rezultatul să fie mai ușor de luat în serios de către alți operatori, deoarece comunitatea open-source digeră documentul și începe să reproducă cifrele.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →

