LLM WikiAccess-protected knowledge portal

WIKI

SpectrumKV: Prefill-Decode 분리 서빙에서 토큰마다 다른 정밀도로 KV 캐시 전송 대역폭을 절반으로 줄이는 방법

KV 캐시가 네트워크 페이로드가 되는 순간 Prefill Decode PD 분리 추론은 프롬프트 계산 prefill 과 토큰 생성 decode 을 서로 다른 GPU 풀에서 실행하는 아키텍처다. Prefill 노드가 입력을 처리해 KV 캐시를 만들고, 그 결과를 Decode 노드로 전송해 생성을 이어간다. 계산은 분리되었지만 네트워크에 KV 캐시 전체를 실어 보내야 한다 는 병목이 생긴다. 긴 컨텍스트 요청일수록 문제가 두드러진

경로human/study/content/ai-frontier/89-spectrumkv-per-token-mixed-precision-kv-transfer-pd-disaggregation.md
카테고리Study
태그#disaggregation #mixed #precision #study #token #transfer

KV 캐시가 네트워크 페이로드가 되는 순간

Prefill-Decode(PD) 분리 추론은 프롬프트 계산(prefill)과 토큰 생성(decode)을 서로 다른 GPU 풀에서 실행하는 아키텍처다. Prefill 노드가 입력을 처리해 KV 캐시를 만들고, 그 결과를 Decode 노드로 전송해 생성을 이어간다. 계산은 분리되었지만 네트워크에 KV 캐시 전체를 실어 보내야 한다는 병목이 생긴다.

긴 컨텍스트 요청일수록 문제가 두드러진다. 시퀀스 길이 32K 이상의 요청에서 KV 캐시는 수백 MB를 넘기도 한다. GPU 간 대역폭이 아무리 높아도 이 전송은 TTFT(Time-To-First-Token)를 직접 늘린다.

기존 접근법인 PDTrim 같은 방식은 이진 선택으로 이 문제에 대응했다. 중요도 점수가 높은 토큰은 FP16 정밀도로 전송하고, 낮은 토큰은 전송하지 않는다. 전송량은 줄지만 전송되지 않은 토큰의 정보가 완전히 소실된다. 결과적으로 품질 저하가 크다.

2026년 6월 7일 arXiv에 공개된 SpectrumKV(arXiv:2606.08635)는 이 이진 결정을 세 단계 스펙트럼으로 확장한다. 토큰을 버리는 대신 중요도에 따라 정밀도를 다르게 할당한다. 중요한 토큰은 FP16 그대로, 중간은 INT8, 낮은 건 INT4로 압축해 전송한다. 정보를 보존하면서 대역폭을 줄인다.


3단계 정밀도 정책

SpectrumKV의 핵심은 토큰 중요도를 세 구간으로 분류하고 각 구간에 맞는 정밀도를 할당하는 것이다.

구간정밀도대상 토큰
HighFP16Attention sink, 중요도 최상위 토큰
MidINT8중간 중요도 토큰
LowINT4중요도 낮은 토큰 (모델이 허용하는 경우)

Attention sink는 어텐션 연산에서 항상 높은 가중치를 받는 특수 토큰이다(시퀀스 초반의 토큰들이 대표적). 이 토큰의 KV를 양자화하면 전체 품질이 크게 떨어진다. SpectrumKV는 이 토큰을 항상 FP16으로 보호한다.

중요도 점수는 Prefill 워커에서 계산된다. 각 레이어에서 어텐션 스코어를 집계해 토큰별 중요도를 산출하고, 분위수 기준으로 세 구간에 배정한다. 중요도 점수와 양자화 모두 네트워크 전송 전 Prefill 쪽에서 마무리된다. Decode 워커는 수신 후 역양자화(테이블 룩업)만 수행하면 된다.


배포 시점 모델 호환성 탐침

INT4 양자화에 대한 내성은 모델마다 크게 다르다. 논문이 테스트한 모델들의 반응은 극명히 갈린다.

이 차이를 자동으로 탐지하기 위해 SpectrumKV는 배포 시점 NIAH 탐침을 실행한다. NIAH(Needle-In-A-Haystack) 테스트 3회를 3단계 정책 아래서 진행한다. 탐침을 통과하면 FP16+INT8+INT4 전부를 사용하고, 실패하면 FP16+INT8로만 동작한다.

탐침은 배포 시점에 한 번만 실행되므로 운영 중 추가 오버헤드가 없다.


시스템 아키텍처

SpectrumKV 시스템 아키텍처 — Prefill 워커와 Decode 워커의 역할 분리 Prefill 워커 (GPU Pool A) 입력 처리 — KV 캐시 생성 시퀀스 길이에 비례하는 계산량 토큰 중요도 점수 산출 레이어별 어텐션 스코어 집계 Attention Sink 자동 식별 (항상 FP16) 3구간 정밀도 할당 FP16 High 중요도 INT8 Mid 중요도 INT4 Low 중요도 구간별 양자화 수행 압축된 KV 캐시 패킷 조립 배포 시점 NIAH 탐침 → INT4 호환성 확인 (1회) 네트워크 혼합 정밀도 KV 패킷 50~62% 절감 (b=0.5 기준) Decode 워커 (GPU Pool B) 역양자화 — 테이블 룩업 INT8→FP16, INT4→FP16 변환 가벼운 연산, GPU 계산 비용 낮음 KV 캐시 어텐션 적용 복원된 KV 기반 어텐션 계산 긴 컨텍스트에서 메모리 대역폭 이점 자기회귀 토큰 생성 처리량 안정 또는 향상 (긴 컨텍스트) 성능 결과 요약 TTFT 감소 50~62% (b=0.5, 모든 테스트 모델) 품질 (WikiText-2) 퍼플렉서티 변화 +1.97% ~ -0.44% PDTrim(이진 선택) vs SpectrumKV(3단계 정밀도) 품질 비교 — WikiText-2 퍼플렉서티 변화 (b=0.5) PDTrim — Qwen2.5-7B: +25.85% PDTrim — Mistral-7B: +22.07% PDTrim — Gemma-2-9B: +35.63% SpectrumKV — Qwen2.5-7B: +1.97% (FP16+INT8) SpectrumKV — Mistral-7B: -0.44% (FP16+INT8+INT4) SpectrumKV — Gemma-2-9B: 유사 수준 (FP16+INT8+INT4)
SpectrumKV — Prefill-Decode 분리 서빙에서 3단계 혼합 정밀도 KV 전송 흐름

왜 이진 선택이 품질을 크게 떨어뜨리는가

PDTrim이 품질 손실이 큰 이유는 전송하지 않는 토큰의 정보가 완전히 사라지기 때문이다. Decode 워커는 해당 토큰들이 없다는 사실도 모른 채 어텐션을 계산한다. 중요하지 않다고 판단했지만 실제로는 일부 정보를 담고 있던 토큰들의 기여가 제로가 된다.

SpectrumKV는 낮은 중요도 토큰을 INT4로 압축하지만 전송은 한다. INT4는 FP16 대비 4분의 1 크기지만 정보를 보존한다. Decode 워커는 역양자화 후 그 토큰의 근사 KV를 어텐션에 사용할 수 있다.

이 차이가 WikiText-2 결과에서 그대로 나타난다. PDTrim은 퍼플렉서티가 22~35% 올라가지만, SpectrumKV는 ±2% 이내를 유지한다.


토큰 중요도 점수와 양자화 경계

중요도 점수 계산은 각 어텐션 레이어에서 해당 토큰이 받는 어텐션 가중치를 모든 헤드와 레이어에 걸쳐 집계한 값을 쓴다. 점수 분포의 분위수를 기준으로 세 구간의 경계를 설정한다.

분위수 임계값 q_high, q_low는 목표 전송 대역폭 b에 따라 조정된다. b=0.5는 원래 FP16 대비 절반 수준의 전송량을 뜻한다.

Attention sink 처리는 별도 규칙으로 관리된다. 시퀀스 앞쪽 일부 토큰(보통 처음 몇 개)은 중요도 점수와 무관하게 항상 FP16으로 분류된다.


INT4 내성 탐침의 설계

배포 시점 탐침은 3회의 NIAH(Needle-In-A-Haystack) 시험을 3단계 정책 아래서 실행한다.

NIAH 시험은 긴 문서에 숨겨진 정보를 찾아내는 과제로, KV 캐시 품질에 민감하다. INT4 양자화로 KV 정밀도가 떨어지면 숨겨진 정보를 놓치기 쉽다. 3회 시험을 모두 통과하면 해당 모델은 3단계(FP16+INT8+INT4) 정책을 쓴다. 실패하면 2단계(FP16+INT8)로 낙하(fallback)한다.

이 탐침은 서비스 시작 전 정적으로 실행되어 그 결과가 서빙 설정에 기록된다. 추론 요청 처리 중 동적으로 재실행되지 않는다.


성능 실험 결과

논문에서 보고한 핵심 수치는 b=0.5(FP16 대비 50% 전송량) 기준이다.

지표결과
TTFT 감소50~62% (모든 모델/길이 조합)
WikiText-2 퍼플렉서티 변화+1.97% ~ -0.44%
PDTrim 대비 품질 우위퍼플렉서티 기준 20~35%p 개선
Decode 처리량안정 또는 향상 (긴 컨텍스트에서 메모리 대역폭 압력 완화)
역양자화 오버헤드테이블 룩업 수준으로 낮음

TTFT 감소폭이 50~62%로 일관적인 것은 KV 캐시 전송이 TTFT의 지배적 요인임을 보여준다. 네트워크 전송량이 절반으로 줄면 전송 시간이 거의 절반으로 줄어드는 직접적 관계다.


운영 시사점

PD 분리 서빙을 운영 중이거나 도입을 검토 중인 팀이 SpectrumKV에서 주목할 부분은 다음과 같다.

배포 전 탐침 실행 필수: 모델마다 INT4 호환성이 다르다. 운영할 모델에 대해 배포 전 NIAH 탐침을 실행해 정책을 결정해야 한다. 탐침 없이 3단계 정책을 적용하면 Qwen2.5-7B 같은 모델에서 품질 급락을 겪을 수 있다.

전송 예산 b 조정: b=0.5는 논문의 기준점이지, 최적값이 아니다. 네트워크 대역폭 여유와 품질 요구 사항에 따라 b를 조정할 수 있다. b를 높이면 품질이 좋아지지만 대역폭 절감이 줄고, b를 낮추면 대역폭을 더 줄이지만 품질이 떨어진다.

모델 교체 시 재탐침: 동일 아키텍처라도 파인튜닝 버전이나 가중치가 달라지면 INT4 내성이 달라질 수 있다. 모델을 교체할 때마다 탐침을 재실행하는 것이 안전하다.

기존 PD 분리 인프라와 호환: SpectrumKV의 양자화·역양자화는 Prefill/Decode 워커에 각각 추가되는 전처리/후처리 단계다. KV 전송 프로토콜의 페이로드 형식만 바꾸면 되므로, 기존 PD 분리 파이프라인에 레이어로 올릴 수 있다.

Open question: 논문이 테스트한 세 모델 외 아키텍처(특히 MoE 기반 모델)에서의 INT4 내성과 중요도 점수 분포 특성은 아직 보고되지 않았다. 대규모 MoE 모델에 적용할 경우 전문가 라우팅 경로별로 중요도 점수 분포가 달라질 수 있어 추가 검증이 필요하다.


References