LLM WikiAccess-protected knowledge portal
← 스터디 홈
22편 · 약 16분

DSpark: DeepSeek가 투기적 디코딩의 두 가지 약점을 동시에 해결한 방법

왜 지금 DSpark를 봐야 하나

2026년 6월 27일 DeepSeek는 두 가지를 동시에 공개했다. 하나는 DSpark라는 추론 최적화 프레임워크이고, 다른 하나는 DeepSpec이라는 draft model 훈련·평가 오픈소스 코드베이스다. 논문(arXiv:2607.05147)은 7월 6일 공개됐다.

DSpark가 흥미로운 이유는 새 모델을 내놓은 게 아니기 때문이다. 기존 DeepSeek-V4 체크포인트를 그대로 쓰면서, 투기적 디코딩의 구조적 약점 두 가지를 서로 다른 설계 레벨에서 동시에 공략한다. 결과는 DeepSeek 자체 프로덕션 측정 기준으로 MTP-1 대비 per-user 생성 속도가 60–85% 빨라졌다는 수치다.

이 글은 DSpark의 기술 구조가 어디에서 기존 방법과 달라지는지, 그리고 그 수치를 어떻게 읽어야 하는지 정리한다.


배경: 투기적 디코딩이 프로덕션에서 느려지는 두 원인

투기적 디코딩의 원리는 단순하다. 작은 draft model이 여러 토큰을 미리 제안하고, target model이 한 번의 forward로 동시에 검증한다. 이론적으로 target model의 forward 횟수가 줄고, 처리량이 올라간다.

실제 프로덕션에서는 두 가지 문제가 이 이득을 깎아낸다.

문제 1: suffix decay (draft 품질 하락)

autoregressive draft model은 토큰을 순서대로 뽑는다. draft block 안에서 앞 토큰에 오차가 생기면, 그 오차가 뒤 토큰에 누적된다. 결국 검증할 때 앞쪽 몇 개만 accept되고 뒤쪽은 버려진다. draft block의 평균 accepted length가 짧아지면, target model forward를 줄이는 효과가 사라진다.

문제 2: 검증 자원의 비효율적 할당

대부분의 speculative decoding은 요청마다 검증 길이(γ)를 고정한다. GPU가 여유 있는 시점에도, 이미 포화 상태인 시점에도 같은 길이로 검증한다. GPU utilization이 낮을 때는 더 긴 block을 검증하면 이득인데, 기회를 날린다. 반대로 GPU가 바쁠 때 긴 block을 검증하면 오히려 latency가 늘어난다.

문제 1: suffix decay
토큰 1 ← 토큰 2 ← 토큰 3 ← …
앞 오차가 뒤에 누적됨
→ 평균 accepted length ↓
문제 2: 고정 γ 할당
GPU idle → γ 늘려도 됨 (이득 기회 낭비)
GPU busy → γ 그대로 → latency 악화
→ 자원 활용 비효율
DSpark 목표
두 문제를
서로 다른 설계 레벨에서
동시에 해결
투기적 디코딩의 두 약점

DSpark 아키텍처: DFlash + sequential head

DSpark의 draft 생성은 두 컴포넌트가 연결된 semi-autoregressive 구조다.

DFlash: 병렬 backbone

DFlash는 draft block 안의 모든 위치에 대한 logits를 한 번의 forward로 병렬 계산한다. autoregressive draft model처럼 토큰을 순서대로 뽑지 않는다. 그래서 draft 생성 시간이 block 길이에 거의 비례하지 않는다. 대신, 각 위치 간의 순차 의존성이 반영되지 않는다.

Sequential head: Markov head 또는 RNN head

DFlash만 쓰면 블록 내 토큰들이 서로 완전히 독립적으로 샘플링되기 때문에 suffix decay가 여전하다. DSpark는 이를 막기 위해 경량 sequential head를 추가한다.

프로덕션 배포에 쓰인 Markov head는 직전 토큰(i−1)에만 조건화한다. 수식으로 쓰면:

logit_final[i] = logit_dflash[i] + bias(token[i-1])

bias 함수는 학습된 경량 행렬이다. 순차 RNN보다 훨씬 적은 비용으로 인접 토큰 간 의존성을 주입해, suffix decay를 줄인다. 논문에는 더 많은 컨텍스트를 유지하는 RNN head 변형도 실험됐다.

프로덕션 설정은 γ = 5(DSpark-5), Markov head, STS(Sequential Token Scheduler) 기반 confidence head를 조합한다.


Confidence-Scheduled Verification

draft 품질을 높인 것만으로는 충분하지 않다. 검증 자원의 낭비도 해결해야 한다.

DSpark는 검증 전에 confidence head가 각 draft 위치의 acceptance 확률을 추정한다. 구체적으로는 prefix survival probability를 계산한다: "앞 위치가 실제로 accept된다고 가정했을 때, i번 위치도 accept될 기대 확률"이다.

이 추정치와 현재 GPU utilization 상태를 결합해, load-aware scheduler가 이번 요청의 검증 길이를 동적으로 결정한다.

GPU 상태acceptance 추정검증 길이 결정
idle높음늘림 (더 많은 토큰 한 번에 처리)
idle낮음줄임 (어차피 reject 많으면 비효율)
busy높음적당히 유지
busy낮음줄임 (overhead 최소화)

요청마다 최적 검증 길이가 다르기 때문에, 고정 γ보다 자원 효율이 올라간다.

DSpark: semi-autoregressive draft + confidence-scheduled verification 입력 컨텍스트 prompt + KV cache DFlash 병렬 backbone 모든 위치 logits를 1 forward로 Markov head prefix-dependent bias 주입 logit[i] += bias(token[i-1]) Draft tokens γ = 5 (DSpark-5) Confidence Head prefix survival probability 각 위치의 acceptance 기대값 STS-calibrated GPU Utilization 실시간 load 상태 idle / busy Load-aware Scheduler 동적 검증 길이 결정 Target Model 검증 (verification) 1 forward로 γ 위치 동시 검증 rejected 이후 tail 재생성 Accepted Tokens V4-Flash: avg 60–85% 가속 성능 수치 (DeepSeek 자체 측정, 2026-06-27 기준) V4-Flash (80 tok/s/user) per-user 속도 +60–85% 집계 throughput +51% V4-Pro (35 tok/s/user) per-user 속도 +57–78% 집계 throughput +52% 주의 MTP-1 대비 비교 (일반 AR baseline 아님) 독립 제3자 검증 없음 (2026-07-18 기준)
DSpark 아키텍처 — draft에서 검증까지

DeepSpec: draft model 훈련·평가 오픈소스

DSpark와 함께 공개된 DeepSpec는 draft model 전체 훈련 파이프라인을 담은 MIT 라이선스 코드베이스다.

주요 내용:

  • DSpark, DFlash, Eagle3 스타일 draft model 훈련 지원
  • DeepSeek 전용이 아니라 Qwen, Gemma 등 다른 모델군에도 적용 가능
  • draft model acceptance rate 평가 유틸리티 포함
  • deepseek-ai/DeepSeek-V4-Flash-DSpark, deepseek-ai/DeepSeek-V4-Pro-DSpark 모델 HuggingFace 공개

DeepSpec의 의미는 단순한 코드 공개 이상이다. 이전까지 speculative decoding에서 "좋은 draft model"을 만드는 방법은 서비스 회사가 내부에서만 알고 있었다. DeepSpec는 그 방법론을 외부로 꺼냈다.


DSpark와 기존 방법 비교

방법suffix decay 해결검증 비용 조절draft 생성 병렬성
표준 speculative decoding✗ (고정 γ)✗ (순차)
MTP (Multi-Token Prediction)부분적△ (예측 head)
Eagle3
DFlash 단독
DSpark✓ (Markov head)✓ (confidence scheduler)✓ (DFlash)

논문 기준으로 Eagle3의 accepted length보다 약 27–31% 길고, DFlash 단독보다 16–18% 길다.


운영자를 위한 판단 기준

이미 DeepSeek API를 쓰고 있다면 2026-06-27 기준, DSpark는 DeepSeek 공식 API에서 이미 활성화돼 있다. 별도로 켤 필요가 없다.

자체 호스팅(self-hosted) 환경이라면 현재 vLLM이나 SGLang에 DSpark를 바로 올리는 공식 통합은 없다. deepseek-ai/DeepSeek-V4-Flash-DSpark 또는 DeepSeek-V4-Pro-DSpark 모델을 불러와 서빙하는 방식으로 시도해야 한다.

다른 모델에 적용하려면 DeepSpec 코드베이스에서 다른 모델군의 draft model을 훈련할 수 있다. 다만 훈련 데이터 구성, tokenizer 정렬, confidence head calibration은 직접 해야 한다.

측정해야 할 항목

  • average accepted length (draft block 중 실제로 accept된 평균 토큰 수)
  • target model forward 횟수 감소율 (이론적 이득 확인)
  • end-to-end tokens/sec (draft 생성 오버헤드 포함)
  • confidence head 추가 latency
  • GPU busy/idle 구간별 실제 accept rate 분포

이 릴리스를 한 문장으로 요약하면

DSpark는 새 모델 없이 기존 LLM 추론 파이프라인 안에서, draft quality와 검증 비용 할당이라는 두 가지 약점을 동시에 공략하는 구조적 접근이다.

속도 수치는 DeepSeek 자체 측정이고 독립 검증은 아직 없지만, 아키텍처 설계 방향은 speculative decoding 연구의 자연스러운 다음 단계에 해당한다. DeepSpec 오픈소스와 함께 공개됐다는 점은, 이 접근이 DeepSeek 단독 최적화로 끝나지 않을 수 있다는 신호다.

References

  • DeepSeek DSpark blog post (2026-06-27): https://deepseek.ai/blog/deepseek-dspark-speculative-decoding
  • arXiv:2607.05147 — DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation (2026-07-06): https://arxiv.org/abs/2607.05147
  • DeepSpec GitHub (MIT license): https://github.com/deepseek-ai/DeepSpec
  • VentureBeat: DeepSeek open sources DSpark (2026-06-30): https://venturebeat.com/orchestration/deepseek-open-sources-dspark-a-new-framework-to-speed-up-llm-inference-by-up-to-85
  • HuggingFace model: deepseek-ai/DeepSeek-V4-Flash-DSpark: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-DSpark
  • ThePlanetTools — DSpark: DeepSeek Claims 85% Faster. Nobody Verified It. (2026-07): https://theplanettools.ai/blog/deepseek-dspark-speculative-decoding-85-percent-faster-inference-2026
  • MarkTechPost: DeepSeek Releases DSpark (2026-06-27): https://www.marktechpost.com/2026/06/27/deepseek-releases-dspark-a-speculative-decoding-framework-that-accelerates-deepseek-v4-per-user-generation-60-85-over-mtp-1/