DeepSeek выпустила DSpark, спекулятивную среду декодирования с открытым исходным кодом, которая, по словам компании, ускоряет вывод модели большого языка (LLM) до 85% при реальном трафике без какой-либо потери качества вывода. Как описано в новой статье DeepSeek-AI и Пекинского университета, система уже работает внутри обслуживающей инфраструктуры DeepSeek-V4, которая обрабатывает реальные запросы пользователей.

Работа решает одну из самых сложных проблем в промышленном искусственном интеллекте: вывод выполняется медленно, поскольку модели генерируют текст по одному токену за раз, каждый из которых требует полного прохождения через сеть. Спекулятивное декодирование — популярное средство, при котором небольшая, быстрая «черновая» модель предлагает блок токенов, который полноразмерная модель затем проверяет за один проход, принимая самый длинный правильный префикс. Поскольку проверка является параллельной и математически точной, она ускоряет процесс, сохраняя при этом распределение исходной модели. DSpark, выпущенный вместе с учебным репозиторием DeepSpec на GitHub, быстро стал одной из самых обсуждаемых историй об искусственном интеллекте на Hacker News. Подробнее об этой истории — в нашем последние разработки в ИИ.

Почему существующие спекулятивные методы декодирования терпят неудачу

Недавние спекулятивные исследования декодирования перешли к «параллельным составителям», которые генерируют целый блок токенов-кандидатов за один прямой проход, что делает задержку черновика практически независимой от размера блока. В документе DSpark указаны два узких места, которые не позволяют этим методам выполнить свои обещания в больших масштабах.

Во-первых, это проблема качества. Поскольку параллельные разработчики прогнозируют каждую позицию независимо, они не могут моделировать, как токены внутри блока зависят друг от друга. Исследователи показывают, что это приводит к «мультимодальным коллизиям» и быстрому затуханию принятия на более поздних позициях в черновом блоке, феномену, который они называют распадом суффикса. Чем длиннее параллельный блок, тем больше вероятность, что его хвостик неправильный.

Во-вторых, это проблема системного уровня. Хотя генерирование блоков с длинными черновиками обходится дешево, слепая проверка каждого предлагаемого токена приводит к потере ограниченных мощностей по пакетному выпуску токенов, которые могут быть отклонены. В условиях высокой параллельности реальной обслуживающей системы идеальная длина проверки варьируется по двум осям: структурированные запросы, такие как код, обеспечивают более высокие показатели принятия, чем открытый чат, а проверка дополнительных токенов почти бесплатна при небольшой нагрузке, но дорога, когда система насыщена.

Полуавторегрессионная черновая модель

Чтобы исправить затухание суффикса, DSpark использует то, что авторы называют полуавторегрессионной архитектурой. Он сочетает в себе тяжелую в вычислительном отношении параллельную магистраль, которая может предлагать множество токенов одновременно, с легким последовательным модулем, который обеспечивает моделирование внутриблоковых зависимостей. Проект призван объединить высокую производительность параллельных моделей на ранних позициях с суффиксной связностью традиционных авторегрессионных составителей, которые генерируют токены один за другим и естественным образом учитывают зависимости.

Команда сообщает, что в контролируемых автономных тестах, охватывающих математические рассуждения, генерацию кода и ежедневное общение, DSpark существенно улучшает допустимую длину цикла проверки по сравнению с сильными базовыми показателями. В частности, в документе говорится, что DSpark улучшает принятую длину по сравнению с авторегрессионным редактором Eagle3 на 30,9%, 26,7% и 30,0% по трем настройкам, а по сравнению с параллельным редактором DFlash на 16,3%, 18,4% и 18,3%.

Доверительная проверка с учетом нагрузки

Более новая часть DSpark — это подход к проверке. Вместо проверки фиксированного количества черновых токенов для каждого запроса DSpark формулирует выбор длины проверки как глобальную задачу максимизации пропускной способности. Он сочетает калиброванные оценки того, как долго префикс черновика может сохраняться, то, что в статье называется вероятностью выживания, с аппаратно-ориентированным планировщиком, который считывает загрузку движка в реальном времени.

Результатом является проверка по доверительному расписанию: система динамически адаптирует количество токенов, которые она проверяет, для каждого запроса, основываясь как на содержимом запроса, так и на текущем состоянии обслуживающего механизма. При небольших нагрузках он может позволить себе щедрую проверку, тогда как при интенсивном параллелизме он направляет бюджет проверки целевой модели только на токены с наивысшим ожидаемым доходом, избегая коллапса пропускной способности, который возникает из-за расходования пакетной мощности на токены с низкой вероятностью.

Результаты в реальном трафике пользователей

Наиболее значимые цифры связаны с производством. Команда развернула DSpark внутри обслуживающей системы DeepSeek-V4, обслуживающей живой пользовательский трафик, и сравнила его с предыдущим производственным базовым вариантом компании — методом прогнозирования нескольких токенов, известным как MTP-1.

Согласно документу, DSpark последовательно увеличивает скорость генерации данных для каждого пользователя на 60–85 % для DeepSeek-V4-Flash и на 57–78 % для DeepSeek-V4-Pro при соответствующей совокупной пропускной способности. В соответствии со строгими соглашениями об уровне обслуживания, когда базовая емкость серьезно ухудшается (что эквивалентно 120 токенам в секунду для Flash и 50 токенам в секунду для Pro), DSpark снижает накладные расходы на проверку для поддержания устойчивой пропускной способности. Авторы утверждают, что, преодолев этот обрыв производительности, он открывает строгие уровни интерактивности, которые ранее были недостижимы, эффективно сдвигая границу Парето в сфере обслуживания LLM.

Это различие имеет значение для операторов. Более высокая скорость для каждого пользователя при той же общей пропускной способности означает более отзывчивые помощники и агентские рабочие процессы без необходимости покупки дополнительного оборудования, а соблюдение строгих соглашений об уровне обслуживания по задержке под нагрузкой — это то, что отличает исследовательскую демонстрацию от системы, которая может работать во время пиков трафика.

Открытый исходный код для сообщества

DeepSeek выпускает обученные контрольные точки DSpark для моделей DeepSeek-V4-Flash и DeepSeek-V4-Pro. Сопутствующий репозиторий DeepSpec, опубликованный под разрешительной лицензией MIT, описывается как полнофункциональная, основанная на алгоритмах база кода для обучения и оценки для спекулятивного декодирования. Он включает в себя утилиты подготовки данных, реализации черновых моделей, сценарии обучения и средства оценки, а также поставляется с тремя алгоритмами черновых моделей: DSpark, DFlash и Eagle3.

Этот выпуск снижает барьер для других лабораторий и инфраструктурных команд в обучении и сравнении своих собственных проектов моделей со стандартизированным конвейером. Пакет оценки DeepSpec охватывает установленные тесты, включая GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval и Arena-Hard-v2.

Почему это важно

Стоимость вывода и задержка в настоящее время являются одними из определяющих ограничений индустрии искусственного интеллекта, определяя все, от того, насколько агрессивно компании развертывают агенты искусственного интеллекта, до того, смогут ли более мелкие поставщики конкурировать с гиперскейлерами в юнит-экономике. Вклад DSpark — это не просто новый алгоритм, а демонстрация того, что тщательная совместная разработка черновой модели и планировщика проверки, а также рассмотрение длины проверки как функции состояния работающей системы могут существенно сдвинуть стрелку в реальных развертываниях.

Для DeepSeek, которая заработала свою репутацию на эффективных, открыто выпускаемых системах, DSpark является еще одним аргументом в аргументе, который лаборатория выдвигает уже больше года: производительность обслуживания передового уровня может быть достигнута за счет более разумного проектирования, а не только за счет необработанных вычислений. Тот факт, что прирост измерялся при реальном трафике, а не в синтетических тестах, позволяет другим операторам воспринимать результат всерьез, поскольку сообщество открытого исходного кода переваривает документ и начинает воспроизводить цифры.

---

Будьте в курсе ИИ

Последние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.

Читать больше новостей об ИИ →