DeepSeek випустила DSpark, фреймворк спекулятивного декодування з відкритим вихідним кодом, який, за словами компанії, прискорює визначення великої мовної моделі (LLM) до 85% під час живого трафіку без будь-якої втрати якості виводу. Описана в новій статті DeepSeek-AI і Пекінського університету, система вже працює в інфраструктурі обслуговування DeepSeek-V4, яка обробляє запити реальних користувачів.

Робота вирішує одну з найскладніших проблем у виробництві штучного інтелекту: висновок повільний, оскільки моделі генерують текст по одному токену, кожен з яких потребує повного проходу через мережу. Спекулятивне декодування є популярним засобом, у якому невелика швидка «чорнова» модель пропонує блок токенів, які повнорозмірна модель потім перевіряє за один прохід, приймаючи найдовший правильний префікс. Оскільки верифікація є паралельною та математично точною, вона пришвидшує роботу, зберігаючи вихідний розподіл моделі. DSpark, випущений разом із навчальним репозиторієм DeepSpec на GitHub, швидко став однією з найбільш обговорюваних історій про розробку ШІ на Hacker News. For more context on this story, see our ongoing latest AI developments.

Чому існуюче спекулятивне декодування вражає стіну

Останні спекулятивні дослідження декодування перейшли до «паралельних розробників», які генерують цілий блок токенів-кандидатів за один прохід вперед, роблячи затримку чернетки майже незалежною від розміру блоку. Документ DSpark визначає два вузькі місця, які перешкоджали цим методам виконати свої обіцянки в масштабі.

По-перше, це проблема якості. Оскільки паралельні розробники прогнозують кожну позицію незалежно, вони не можуть моделювати, як токени в блоці залежать один від одного. Дослідники показують, що це призводить до «мультимодальних зіткнень» і швидкого занепаду сприйняття на наступних позиціях чернеткового блоку, явище, яке вони називають розпадом суфікса. Чим довший паралельний блок, тим імовірніше, що його хвіст неправильний.

Друга – проблема системного рівня. Хоча генерувати довгі чернеткові блоки дешево, сліпа перевірка кожного запропонованого токена втрачає обмежену пакетну ємність для токенів, які, ймовірно, будуть відхилені. За високого паралелізму реальної системи обслуговування ідеальна тривалість перевірки змінюється за двома осями: структуровані запити, такі як код, мають вищі показники прийняття, ніж відкритий чат, а перевірка додаткових токенів майже безкоштовна за невеликого навантаження, але дорога, коли система насичена.

Напівавторегресивна модель проекту

Щоб виправити розпад суфіксів, DSpark використовує те, що автори називають напівавторегресійною архітектурою. Він об’єднує важку для обчислень паралельну магістраль, яка може запропонувати багато токенів одночасно, з легким послідовним модулем, який вводить внутрішньоблочне моделювання залежностей. Дизайн призначений для поєднання високої потужності паралельних моделей на ранніх позиціях із узгодженістю суфіксів традиційних редакторів авторегресії, які генерують токени один за одним і природно поважають залежності.

На контрольованих офлайн-тестах, які охоплюють математичні міркування, генерацію коду та щоденний чат, команда повідомляє, що DSpark значно покращує прийнятну тривалість циклу перевірки порівняно з сильними базовими показниками. Зокрема, у документі зазначено, що DSpark покращує прийнятну довжину в порівнянні з авторегресійним проектором Eagle3 на 30,9%, 26,7% і 30,0% у трьох налаштуваннях, а порівняно з паралельним інструментом DFlash на 16,3%, 18,4% і 18,3%.

Достовірно запланована перевірка з урахуванням навантаження

Більш новою частиною DSpark є підхід до перевірки. Замість того, щоб перевіряти фіксовану кількість чернеток маркерів для кожного запиту, DSpark формулює вибір довжини перевірки як проблему максимізації глобальної пропускної здатності. Він поєднує відкалібровані оцінки того, як довго, ймовірно, проживе префікс чернетки, що в газеті називається ймовірністю виживання, з апаратним планувальником, який зчитує навантаження двигуна в реальному часі.

Результатом є достовірна запланована перевірка: система динамічно підбирає кількість токенів, які вона перевіряє для кожного запиту на основі як вмісту запиту, так і поточного стану механізму обслуговування. За невеликих навантажень він може дозволити собі щедру верифікацію, тоді як за інтенсивного паралелізму він спрямовує бюджет верифікації цільової моделі лише на токени з найвищим очікуваним прибутком, уникаючи падіння пропускної здатності, яке виникає через витрачання пакетної потужності на токени з низькою ймовірністю.

Результати під реальним трафіком користувачів

Найбільш значущі цифри надходять від виробництва. Команда розгорнула DSpark у системі обслуговування DeepSeek-V4, яка обслуговує живий трафік користувачів, і порівняла його з попередньою виробничою базою компанії, методом прогнозування з кількома маркерами, відомим як MTP-1.

Згідно з документом, DSpark постійно прискорює швидкість генерації для кожного користувача на 60% до 85% для DeepSeek-V4-Flash і на 57% до 78% для DeepSeek-V4-Pro за відповідної сукупної пропускної здатності. Згідно із суворими угодами про рівень обслуговування, коли базова пропускна здатність значно погіршується, що еквівалентно 120 токенам за секунду для Flash і 50 токенам за секунду для Pro, DSpark зменшує витрати на перевірку, щоб підтримувати надійну пропускну здатність. Автори стверджують, що завдяки подоланню цього падіння продуктивності відкриваються строгі рівні інтерактивності, які раніше були недосяжними, фактично зсуваючи межі Парето для обслуговування LLM назовні.

Ця відмінність має значення для операторів. Вища швидкість для кожного користувача при тій самій загальній пропускній здатності означає більше чутливих помічників і агентських робочих процесів без купівлі додаткового обладнання, а дотримання строгих затримок SLA під навантаженням — це те, що відрізняє дослідницьку демонстрацію від системи, яка може витримати під час стрибків трафіку.

З відкритим кодом для спільноти

DeepSeek випускає навчені контрольні точки DSpark для попередніх моделей DeepSeek-V4-Flash і DeepSeek-V4-Pro. Супровідний репозиторій DeepSpec, опублікований за дозвільною ліцензією MIT, описується як повноцінна, керована алгоритмом база коду для навчання та оцінки для спекулятивного декодування. Він включає в себе утиліти підготовки даних, реалізації чорнових моделей, сценарії навчання та пакети оцінювання, а також поставляється з трьома алгоритмами чорнових моделей: DSpark, DFlash і Eagle3.

Цей випуск знижує бар’єр для інших лабораторій та інфраструктурних команд щодо навчання та порівняння власних чорнових моделей зі стандартизованим конвеєром. Набір оцінок DeepSpec охоплює встановлені тести, включаючи GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval і Arena-Hard-v2.

Чому це важливо

Вартість висновків і затримка зараз є одними з визначальних обмежень індустрії штучного інтелекту, які визначають усе: від того, наскільки агресивно компанії розгортають агентів штучного інтелекту, до того, чи зможуть менші постачальники конкурувати з гіпермасштабувальниками в економіці одиниць. Внесок DSpark полягає не в одному новому алгоритмі, а в демонстрації того, що ретельне спільне проектування чорнової моделі та планувальника перевірки, а також розгляд тривалості перевірки як функції поточного стану системи може суттєво рухати голку в реальних розгортаннях.

Для DeepSeek, який побудував свою репутацію на ефективних відкритих системах, DSpark є ще одним джерелом даних у аргументі, який лабораторія наводить більше року: продуктивність обслуговування передового рівня може бути досягнута за допомогою розумнішої розробки, а не лише за допомогою необроблених обчислень. Той факт, що приріст було виміряно за реальним трафіком, а не за синтетичним тестом, полегшує сприйняття результату іншими операторами серйозно, оскільки спільнота з відкритим кодом перетравлює папір і починає відтворювати цифри.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →