DeepSeek은 출력 품질의 손실 없이 실시간 트래픽에서 LLM(대형 언어 모델) 추론을 최대 85% 가속화하는 오픈 소스 추측 디코딩 프레임워크인 DSpark를 출시했습니다. DeepSeek-AI와 Peking University의 새로운 논문에 설명된 이 시스템은 실제 사용자 요청을 처리하는 DeepSeek-V4 제공 인프라 내에서 이미 실행되고 있습니다.

이 작업은 프로덕션 AI의 가장 완고한 문제 중 하나를 해결합니다. 즉, 모델이 한 번에 하나의 토큰씩 텍스트를 생성하고 각각 네트워크를 통한 전체 통과가 필요하기 때문에 추론이 느립니다. 투기적 디코딩은 작고 빠른 "초안" 모델이 토큰 블록을 제안한 다음 전체 크기 모델이 단일 패스에서 확인하고 가장 긴 올바른 접두사를 허용하는 인기 있는 해결 방법입니다. 검증은 병렬적이고 수학적으로 정확하기 때문에 원래 모델의 분포를 유지하면서 작업 속도를 높입니다. GitHub의 DeepSpec 교육 저장소와 함께 출시된 DSpark는 Hacker News에서 가장 많이 논의된 AI 엔지니어링 이야기 중 하나가 되었습니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.

기존 추측 디코딩이 벽에 부딪히는 이유

최근의 추측적 디코딩 연구는 단일 전달 패스에서 후보 토큰의 전체 블록을 생성하는 "병렬 초안 작성기"로 이동하여 초안 대기 시간을 블록 크기와 거의 독립적으로 만듭니다. DSpark 논문은 이러한 방법이 대규모로 약속을 이행하지 못하게 하는 두 가지 병목 현상을 식별합니다.

첫 번째는 품질 문제입니다. 병렬 초안 작성자는 각 위치를 독립적으로 예측하기 때문에 블록 내의 토큰이 서로 어떻게 의존하는지 모델링할 수 없습니다. 연구원들은 이것이 접미사 붕괴라고 부르는 현상인 드래프트 블록의 나중 위치에서 "다중 모드 충돌"과 급속한 수용 붕괴로 이어진다는 것을 보여줍니다. 평행 블록이 길수록 꼬리가 잘못될 가능성이 높아집니다.

두 번째는 시스템 수준의 문제입니다. 긴 초안 블록을 생성하는 것은 저렴하지만, 제안된 모든 토큰을 맹목적으로 검증하는 것은 거부될 가능성이 있는 토큰에 부족한 배치 용량을 낭비하게 됩니다. 실제 서비스 시스템의 높은 동시성 하에서 이상적인 검증 길이는 두 축을 따라 다릅니다. 코드와 같은 구조화된 요청은 개방형 채팅보다 더 높은 수락률을 유지하며 추가 토큰 검증은 가벼운 부하에서는 거의 무료이지만 시스템이 포화되면 비용이 많이 듭니다.

반자동회귀 초안 모델

접미사 부패를 수정하기 위해 DSpark는 저자가 반자동 회귀 아키텍처라고 부르는 것을 채택합니다. 한 번에 많은 토큰을 제안할 수 있는 계산량이 많은 병렬 백본과 블록 내 종속성 모델링을 도입하는 경량 순차 모듈을 결합합니다. 이 디자인은 초기 위치에 있는 병렬 모델의 대용량과 토큰을 차례로 생성하고 자연스럽게 종속성을 존중하는 전통적인 자동 회귀 제도기의 접미사 일관성을 결합하기 위한 것입니다.

수학적 추론, 코드 생성 및 일일 채팅을 포괄하는 통제된 오프라인 벤치마크에서 팀은 DSpark가 강력한 기준에 비해 검증 주기당 허용되는 길이를 크게 향상시킨다고 보고합니다. 구체적으로, 논문에서는 DSpark가 자동 회귀 Eagle3 드래프터에 비해 허용 길이를 3가지 설정에서 30.9%, 26.7%, 30.0% 향상시키고 병렬 DFlash 드래프터에 비해 16.3%, 18.4%, 18.3% 향상시킨다고 밝혔습니다.

신뢰도 예약, 로드 인식 검증

DSpark의 더 새로운 절반은 검증에 대한 접근 방식입니다. 모든 요청에 ​​대해 고정된 수의 초안 토큰을 확인하는 대신 DSpark는 확인 길이 선택을 전역 처리량 최대화 문제로 공식화합니다. 이는 초안의 접두어가 얼마나 오래 지속될 것인지에 대한 보정된 추정치(논문에서 생존 확률이라고 부르는 것)를 실시간 엔진 로드를 읽는 하드웨어 인식 스케줄러와 결합합니다.

결과는 신뢰도 예약 검증입니다. 시스템은 요청 내용과 서비스 엔진의 현재 상태를 기반으로 각 요청에 대해 검증하는 토큰 수를 동적으로 조정합니다. 가벼운 부하에서는 넉넉하게 검증할 수 있는 반면, 동시성이 높으면 대상 모델의 검증 예산을 기대 수익이 가장 높은 토큰에만 라우팅하여 확률이 낮은 토큰에 배치 용량을 소비함으로써 발생하는 처리량 붕괴를 방지합니다.

실시간 사용자 트래픽에 따른 결과

가장 중요한 수치는 생산에서 나옵니다. 팀은 실시간 사용자 트래픽을 제공하는 DeepSeek-V4 제공 시스템 내부에 DSpark를 배포하고 이를 MTP-1로 알려진 다중 토큰 예측 방법인 회사의 이전 생산 기준과 비교했습니다.

논문에 따르면 DSpark는 일치하는 총 처리량에서 DeepSeek-V4-Flash의 경우 사용자당 생성 속도를 60%~85%, DeepSeek-V4-Pro의 경우 57%~78%까지 지속적으로 가속화합니다. 기준 용량이 심각하게 저하되는 엄격한 서비스 수준 계약(Flash의 경우 초당 120개 토큰, Pro의 경우 초당 50개 토큰에 해당)에 따라 DSpark는 확인 오버헤드를 완화하여 강력한 처리량을 유지합니다. 저자는 이러한 성능 절벽을 극복함으로써 이전에는 달성할 수 없었던 엄격한 상호 작용 계층을 잠금 해제하고 LLM 서비스의 파레토 경계를 외부로 효과적으로 이동한다고 주장합니다.

이러한 구별은 운영자에게 중요합니다. 동일한 총 처리량에서 더 빠른 사용자당 속도는 더 많은 하드웨어를 구입하지 않고도 응답성이 더 뛰어난 보조자 및 에이전트 워크플로를 의미하며, 부하가 걸린 엄격한 대기 시간 SLA를 견뎌내는 것은 연구 데모와 트래픽 급증 중에 견딜 수 있는 시스템을 구분하는 요소입니다.

커뮤니티를 위한 오픈 소스

DeepSeek은 DeepSeek-V4-Flash 및 DeepSeek-V4-Pro 미리 보기 모델 모두에 대해 훈련된 DSpark 체크포인트를 출시합니다. 허용된 MIT 라이선스에 따라 게시된 함께 제공되는 DeepSpec 저장소는 추론적 디코딩을 위한 전체 스택, 알고리즘 중심 교육 및 평가 코드베이스로 설명됩니다. 여기에는 데이터 준비 유틸리티, 초안 모델 구현, 교육 스크립트 및 평가 도구가 포함되어 있으며 DSpark, DFlash 및 Eagle3의 세 가지 초안 모델 알고리즘이 함께 제공됩니다.

이 릴리스는 다른 연구실 및 인프라 팀이 표준화된 파이프라인을 기준으로 자체 초안 모델을 교육하고 벤치마킹할 수 있는 장벽을 낮췄습니다. DeepSpec의 평가 제품군은 GSM8K, MATH500, AIME 2025, HumanEval, MBPP, LiveCodeBench, MT-Bench, AlpacaEval 및 Arena-Hard-v2를 비롯한 확립된 벤치마크를 다룹니다.

중요한 이유

추론 비용과 지연 시간은 이제 AI 산업의 정의적 제약 중 하나이며, 기업이 얼마나 적극적으로 AI 에이전트를 배포하는지부터 소규모 제공업체가 단위 경제성에서 하이퍼스케일러와 경쟁할 수 있는지 여부에 이르기까지 모든 것을 형성합니다. DSpark의 기여는 초안 모델과 검증 스케줄러를 신중하게 공동 설계하고 검증 길이를 라이브 시스템 상태의 함수로 처리하여 실제 배포에서 의미 있게 바늘을 움직일 수 있는 데모보다 단일한 새로운 알고리즘이 아닙니다.

효율적이고 공개적으로 출시된 시스템으로 명성을 쌓아온 DeepSeek의 경우 DSpark는 연구소가 1년 넘게 주장해 온 또 다른 데이터 포인트입니다. 즉, 원시 컴퓨팅뿐만 아니라 더 스마트한 엔지니어링을 통해 최첨단 서비스 성능을 달성할 수 있다는 것입니다. 이득이 합성 벤치마크가 아닌 실시간 트래픽에서 측정되었다는 사실은 오픈 소스 커뮤니티가 논문을 소화하고 수치를 재생산하기 시작할 때 다른 운영자가 결과를 더 쉽게 진지하게 받아들일 수 있게 해줍니다.

---

AI 최신 소식

최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.

AI 뉴스 더 보기 →