DeepSeek ha lanzado DSpark, un marco de decodificación especulativa de código abierto que, según la compañía, acelera la inferencia de modelos de lenguaje grande (LLM) hasta en un 85% con tráfico en vivo, sin ninguna pérdida en la calidad de salida. Descrito en un nuevo artículo de DeepSeek-AI y la Universidad de Pekín, el sistema ya se está ejecutando dentro de la infraestructura de servicio DeepSeek-V4 que maneja solicitudes de usuarios reales.

El trabajo aborda uno de los problemas más persistentes en la producción de IA: la inferencia es lenta porque los modelos generan texto un token a la vez, cada uno de los cuales requiere un paso completo a través de la red. La decodificación especulativa es un remedio popular en el que un modelo "borrador" pequeño y rápido propone un bloque de tokens que el modelo de tamaño completo luego verifica en una sola pasada, aceptando el prefijo correcto más largo. Debido a que la verificación es paralela y matemáticamente exacta, acelera las cosas y al mismo tiempo preserva la distribución del modelo original. DSpark, lanzado junto con el repositorio de capacitación DeepSpec en GitHub, rápidamente se convirtió en una de las historias de ingeniería de IA más discutidas en Hacker News. Para más contexto sobre esta historia, consulta nuestra novedades de IA.

Por qué la decodificación especulativa existente choca contra un muro

Investigaciones recientes sobre decodificación especulativa se han orientado hacia "redactores paralelos" que generan un bloque completo de tokens candidatos en un solo pase hacia adelante, lo que hace que la latencia del borrador sea casi independiente del tamaño del bloque. El artículo de DSpark identifica dos obstáculos que han impedido que estos métodos cumplan su promesa a escala.

El primero es un problema de calidad. Debido a que los redactores paralelos predicen cada posición de forma independiente, no pueden modelar cómo los tokens dentro de un bloque dependen unos de otros. Los investigadores muestran que esto conduce a "colisiones multimodales" y una rápida decadencia de la aceptación en posiciones posteriores en un bloque de calado, un fenómeno que llaman decadencia del sufijo. Cuanto más largo sea el bloque paralelo, más probable es que su cola esté equivocada.

El segundo es un problema a nivel de sistema. Si bien generar bloques de borrador largos es barato, verificar ciegamente cada token propuesto desperdicia la escasa capacidad de lotes en tokens que probablemente serán rechazados. Bajo la alta concurrencia de un sistema de servicio real, la duración ideal de la verificación varía en dos ejes: las solicitudes estructuradas, como el código, mantienen tasas de aceptación más altas que el chat abierto, y la verificación de tokens adicionales es casi gratuita con una carga ligera, pero costosa cuando el sistema está saturado.

Un modelo preliminar semiautoregresivo

Para corregir la decadencia del sufijo, DSpark adopta lo que los autores llaman una arquitectura semiautoregresiva. Combina una columna vertebral paralela computacionalmente pesada, que puede proponer muchos tokens a la vez, con un módulo secuencial liviano que introduce el modelado de dependencia intrabloque. El diseño pretende combinar la alta capacidad de los modelos paralelos en las primeras posiciones con la coherencia de sufijos de los redactores autorregresivos tradicionales, que generan tokens uno tras otro y naturalmente respetan las dependencias.

En puntos de referencia fuera de línea controlados que abarcan razonamiento matemático, generación de código y chat diario, el equipo informa que DSpark mejora sustancialmente la duración aceptada por ciclo de verificación sobre líneas de base sólidas. Específicamente, el documento afirma que DSpark mejora la longitud aceptada con respecto al redactor autorregresivo Eagle3 en un 30,9 %, 26,7 % y 30,0 % en tres configuraciones, y con respecto al redactor paralelo DFlash en un 16,3 %, 18,4 % y 18,3 %.

Verificación basada en la carga y programada con confianza

La mitad más novedosa de DSpark es su enfoque de verificación. En lugar de verificar una cantidad fija de borradores de tokens para cada solicitud, DSpark formula la selección de la duración de la verificación como un problema de maximización del rendimiento global. Combina estimaciones calibradas de cuánto tiempo es probable que sobreviva el prefijo de un borrador, lo que el documento llama probabilidades de supervivencia, con un programador compatible con el hardware que lee la carga del motor en tiempo real.

El resultado es una verificación programada de confianza: el sistema adapta dinámicamente cuántos tokens verifica para cada solicitud en función tanto del contenido de la solicitud como del estado actual del motor de servicio. Bajo cargas ligeras, puede permitirse el lujo de realizar una verificación generosa, mientras que bajo una gran concurrencia dirige el presupuesto de verificación del modelo objetivo solo hacia los tokens con el mayor rendimiento esperado, evitando el colapso del rendimiento que se produce al gastar la capacidad del lote en tokens de baja probabilidad.

Resultados bajo tráfico de usuarios en vivo

Las cifras más importantes provienen de la producción. El equipo implementó DSpark dentro del sistema de servicio DeepSeek-V4 que atiende el tráfico de usuarios en vivo y lo comparó con la línea base de producción anterior de la compañía, un método de predicción de múltiples tokens conocido como MTP-1.

Según el documento, DSpark acelera constantemente las velocidades de generación por usuario entre un 60% y un 85% para DeepSeek-V4-Flash y entre un 57% y un 78% para DeepSeek-V4-Pro con un rendimiento agregado equivalente. Bajo estrictos acuerdos de nivel de servicio donde la capacidad de la línea base se deteriora severamente, el equivalente a 120 tokens por segundo para Flash y 50 tokens por segundo para Pro, DSpark mitiga los gastos generales de verificación para mantener un rendimiento sólido. Al superar ese abismo de rendimiento, los autores argumentan que se desbloquean niveles estrictos de interactividad que antes eran inalcanzables, desplazando efectivamente hacia afuera la frontera de Pareto de la prestación de LLM.

Esa distinción es importante para los operadores. Una velocidad por usuario más rápida con el mismo rendimiento total significa asistentes más receptivos y flujos de trabajo agentes sin comprar más hardware, mientras que sobrevivir a estrictos SLA de latencia bajo carga es lo que separa una demostración de investigación de un sistema que puede resistir durante picos de tráfico.

Código abierto para la comunidad

DeepSeek está lanzando puntos de control DSpark entrenados para los modelos de vista previa DeepSeek-V4-Flash y DeepSeek-V4-Pro. El repositorio DeepSpec adjunto, publicado bajo la licencia permisiva del MIT, se describe como una base de código de evaluación y capacitación basada en algoritmos y de pila completa para decodificación especulativa. Incluye utilidades de preparación de datos, implementaciones de modelos preliminares, scripts de entrenamiento y arneses de evaluación, y se entrega con tres algoritmos de modelos preliminares: DSpark, DFlash y Eagle3.

El lanzamiento reduce la barrera para que otros laboratorios y equipos de infraestructura entrenen y comparen sus propios modelos preliminares con un proceso estandarizado. El conjunto de evaluación de DeepSpec cubre puntos de referencia establecidos que incluyen GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval y Arena-Hard-v2.

Por qué es importante

El costo de la inferencia y la latencia se encuentran ahora entre las limitaciones que definen la industria de la IA y determinan todo, desde la agresividad con la que las empresas implementan agentes de IA hasta si los proveedores más pequeños pueden competir con los hiperescaladores en economía unitaria. La contribución de DSpark no es tanto un nuevo algoritmo como una demostración de que codiseñar cuidadosamente el modelo preliminar y el programador de verificación, y tratar la duración de la verificación como una función del estado activo del sistema, puede mover la aguja de manera significativa en implementaciones reales.

Para DeepSeek, que ha construido su reputación a partir de sistemas eficientes y lanzados abiertamente, DSpark es otro dato en un argumento que el laboratorio ha estado planteando durante más de un año: que se puede lograr un rendimiento de servicio de nivel de vanguardia a través de una ingeniería más inteligente en lugar de solo a través de computación sin procesar. El hecho de que las ganancias se midieran con tráfico real, en lugar de con un punto de referencia sintético, hace que el resultado sea más fácil de tomar en serio para otros operadores a medida que la comunidad de código abierto digiere el documento y comienza a reproducir los números.

---

Mantente al Día con la IA

Las últimas noticias, análisis y avances de inteligencia artificial, en un solo lugar.

Leer más noticias de IA →