TaiChi: PD 집계와 분리를 통합해 LLM 서빙 굿풋을 77% 높이는 방법 (arXiv:2508.01989)
요약
LLM 서빙 인프라를 선택할 때 팀마다 다른 결론을 내리는 이유가 있다. 어떤 팀은 PD 집계(aggregation)—프리필과 디코딩을 같은 GPU에서 처리하는 방식—를 선택하고, 다른 팀은 PD 분리(disaggregation)—프리필과 디코딩을 별도 GPU 풀에서 처리하는 방식—를 선택한다. 둘 다 틀리지 않았다.
TaiChi(arXiv:2508.01989, 2026년 8월)는 이 선택이 애초에 잘못된 이분법이었다고 주장한다. 두 방식은 서로 다른 SLO 체계에서 각각 최적이기 때문에, 단일 아키텍처가 두 방식을 모두 지원하면서 SLO 환경에 맞게 동적으로 전환해야 한다.
결과: TTFT와 TPOT SLO가 균형을 이루는 환경에서 최신 기준선 대비 굿풋 최대 77% 향상.
- arXiv:2508.01989 · 2026년 8월
- 저자: Chao Wang, Pengfei Zuo (교신), Zhangyu Chen, Yunkai Liang, Zhou Yu, Ming-Chang Yang
- 소속: The Chinese University of Hong Kong · Huawei Cloud · Sun Yat-sen University
배경: 두 진영의 논쟁
PD 집계 — 같은 GPU에서 모두 처리
청크형 프리필(Sarathi-Serve, OSDI 2024)을 핵심 기반으로 한다. 긴 프리필 요청을 작은 청크로 나눠 디코딩 스텝과 인터리브하면 Head-of-Line(HoL) 블로킹을 방지할 수 있다. KV 캐시를 네트워크로 전송할 필요가 없으므로 TTFT가 낮다는 것이 핵심 장점이다.
단점은 GPU 내부 간섭이다. 같은 배치에서 컴퓨트 집약적인 프리필과 메모리 대역폭 집약적인 디코딩이 경쟁하면, 고부하 상황에서 디코딩 속도(TPOT)가 저하된다.
PD 분리 — 전담 GPU 풀로 나누기
DistServe(OSDI 2024)가 대표 시스템이다. 프리필을 담당하는 P-노드와 디코딩을 담당하는 D-노드를 완전히 분리한다. 두 단계가 간섭하지 않으므로 TPOT이 안정적이고 예측 가능하다.
단점은 KV 캐시 전송 비용이다. 프리필이 완료된 후 생성된 KV 캐시를 P-노드에서 D-노드로 GPU-to-GPU 전송해야 한다. 이 전송은 수백 밀리초가 걸릴 수 있어 TTFT가 악화된다.
어느 쪽이 맞는가
둘 다 맞다. TaiChi가 제시하는 핵심 분석:
| SLO 체계 | 최적 방식 |
|---|---|
| 타이트한 TTFT, 느슨한 TPOT | 집계 (KV 전송 없음) |
| 타이트한 TPOT, 느슨한 TTFT | 분리 (단계 간섭 없음) |
| TTFT와 TPOT 균형 | 어느 쪽도 최적이 아님 |
중간 체계에서는 두 방식 모두 한쪽 SLO를 희생해 다른 쪽을 충족한다. TaiChi는 이 영역에서 두 방식을 초월한다.
TaiChi 아키텍처
핵심 메커니즘 상세
차별화된 GPU 인스턴스
TaiChi는 클러스터 내 GPU를 두 역할로 나눈다.
프리필 집약 인스턴스(Prefill-Heavy Instance)는 큰 청크 크기를 사용해 프리필을 빠르게 처리한다. 디코딩과의 간섭이 발생하더라도 KV 캐시 전송이 없으므로 TTFT를 낮게 유지할 수 있다. TTFT SLO가 타이트하고 TPOT SLO는 여유가 있는 요청을 주로 처리한다.
디코딩 집약 인스턴스(Decode-Heavy Instance)는 디코딩 처리에 집중하고 프리필은 작은 청크로만 처리한다. 배치 내 단계 간섭을 최소화해 TPOT을 일정하게 유지한다. TPOT SLO가 타이트한 요청을 처리한다.
세 가지 설정 파라미터로 전체 동작을 제어한다:
- 프리필 집약 인스턴스 비율 대 디코딩 집약 인스턴스 비율
- 프리필 집약 인스턴스에서 사용할 청크 크기
- 디코딩 집약 인스턴스에서 허용할 청크 크기
이 파라미터 조합이 100% 프리필 집약으로 수렴하면 시스템은 Sarathi-Serve(집계)처럼 동작한다. 100% 디코딩 집약으로 수렴하면 DistServe(분리)처럼 동작한다. 중간 값들이 TaiChi 고유의 하이브리드 영역이다.
레이턴시 시프팅
기존 LLM 서빙 시스템은 모든 요청의 평균 지연 또는 p99 지연을 최소화하는 방향으로 GPU를 할당한다. TaiChi는 다른 목표를 추구한다: SLO를 충족하는 요청 수(굿풋)를 최대화한다.
이 차이는 중요하다. SLO에 여유가 생긴 요청(예: TTFT 목표 2초인데 0.8초면 완료될 것이 예측되는 요청)에 추가 GPU 자원을 쏟아봤자 굿풋은 달라지지 않는다. 그 자원을 SLO 위반 직전의 요청에 이전하면 전체 굿풋이 올라간다.
이 자원 이전을 레이턴시 시프팅이라 부른다. 두 스케줄링 알고리즘이 이를 구현한다.
Flow Decode Scheduling은 각 요청의 디코딩 토큰 처리율을 조절한다. 한 요청이 GPU 대역폭을 독점해 다른 요청의 TPOT SLO를 위협하는 것을 막는다. 초당 처리할 수 있는 디코딩 토큰 수를 요청 단위로 제어해, 자원이 필요한 요청에 재배분할 기회를 만든다.
Length-Aware Prefill Scheduling은 프롬프트 길이를 기준으로 요청을 프리필 인스턴스에 배정한다. 짧은 프롬프트가 긴 프롬프트 뒤에서 기다리다 TTFT SLO를 위반하는 상황을 방지한다. 각 인스턴스의 현재 부하와 요청의 프롬프트 길이를 동시에 고려해 배정 결정을 내린다.
두 알고리즘은 새 요청이 들어올 때마다 공동으로 작동한다. 스케줄러는 인스턴스 유형과 청크 크기 조합별로 해당 요청이 TTFT와 TPOT SLO를 동시에 충족할 가능성을 추정하고, 가장 가능성이 높은 경로로 라우팅한다.
기존 시스템과 비교
| 시스템 | 방식 | 한계 | TaiChi의 대응 |
|---|---|---|---|
| DistServe (OSDI '24) | PD 분리 | 높은 TTFT (KV 전송) | 프리필 집약 인스턴스로 KV 전송 회피 가능 |
| Sarathi-Serve (OSDI '24) | PD 집계 (청크형 프리필) | 고부하 시 TPOT 저하 | 디코딩 집약 인스턴스로 단계 간섭 격리 |
| DynaServe | 분리 기반 반응형 | 반응적 조정, 단일 아키텍처 | 선제적 SLO 인식 자원 재배분 |
| vLLM (집계 기본값) | 단일 인스턴스 유형 | 하드웨어 역할 고정 | 동적 인스턴스 비율 + 두 알고리즘 조합 |
성능 결과
TaiChi의 벤치마크에서 핵심 지표는 굿풋(goodput)이다. 굿풋은 TTFT와 TPOT SLO를 동시에 만족하는 상태에서 달성하는 실질적인 처리량으로, 한쪽 SLO를 희생해 얻은 처리량은 계산하지 않는다.
균형 잡힌 TTFT + TPOT SLO 환경에서 최신 기준선 대비 최대 77% 굿풋 향상을 달성했다. 비교 기준선은 vLLM(PD 집계 모드)과 DistServe 방식의 PD 분리 시스템이다.
SLO 체계별 동작:
- TTFT 중심 체계: 프리필 집약 인스턴스 비율을 높여 집계 모드에 근접. KV 전송 없이 빠른 TTFT 유지.
- TPOT 중심 체계: 디코딩 집약 인스턴스 비율을 높여 분리 모드에 근접. 단계 간섭 최소화로 TPOT 안정화.
- 균형 체계: 두 인스턴스 유형을 혼합하고 레이턴시 시프팅을 적극 활용. 기존 두 방식 모두가 놓쳤던 굿풋을 회수.
운영자 관점: 배포 고려사항
SLO 체계 먼저 파악하라
TaiChi 도입 전에 서비스의 실제 TTFT/TPOT 요구사항을 측정해야 한다. 챗봇처럼 사용자가 즉각 반응을 기다리는 인터랙티브 서비스는 TTFT가 중요하다. 대규모 배치 처리나 스트리밍 응답이 긴 서비스는 TPOT이 중요하다. 두 요구가 균형을 이룰 때 TaiChi의 효과가 가장 크다.
인스턴스 비율 설정
초기 배포에서는 50:50 혼합으로 시작하고, 실제 SLO 위반 패턴을 관측해 비율을 조정하는 것이 권장된다. TTFT 위반이 많다면 프리필 집약 인스턴스 비율을 높이고, TPOT 위반이 많다면 디코딩 집약 인스턴스를 늘린다.
기존 시스템과의 관계
TaiChi는 프리필 CDN(KV 캐시 사전 계산 및 재사용)이나 RadixAttention(KV 캐시 공유)과 직교하는 기술이다. 캐시 히트가 없는 새 요청을 처리하는 방식을 개선한다. 기존 캐싱 최적화와 함께 사용할 수 있다.
관련 연구: Prefill Deflection
같은 달 arXiv에 게재된 "Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving"(arXiv:2607.02043, Microsoft Research)은 보완적 접근을 취한다. 기존 분리 클러스터에서 프리필 큐가 밀릴 때 디코딩 노드로 프리필 청크를 분산시켜 P95 TTFT를 최대 81% 줄인다. 새 클러스터를 처음 구성하는 경우라면 TaiChi, 기존 분리 클러스터를 운영 중이라면 Prefill Deflection을 먼저 검토할 수 있다.
체크리스트
- [ ] 현재 서비스의 P50/P95/P99 TTFT와 TPOT을 측정했는가
- [ ] TTFT와 TPOT 중 어느 쪽이 더 자주 SLO를 위반하는가 파악했는가
- [ ] 현재 시스템이 순수 집계(vLLM 기본값)인지 분리(DistServe 방식)인지 확인했는가
- [ ] 균형 SLO 환경이라면 TaiChi 논문 및 코드 레포(공개 예정) 추적 중인가
- [ ] 기존 캐싱(RadixAttention, prefix caching) 최적화와의 조합 계획을 수립했는가
References
- arXiv:2508.01989 — TaiChi: Unifying Prefill-Decode Aggregation and Disaggregation for Goodput-Optimized LLM Serving: https://arxiv.org/abs/2508.01989
- DistServe (OSDI 2024): https://www.usenix.org/conference/osdi24/presentation/zhong-yinmin
- Sarathi-Serve (OSDI 2024): https://arxiv.org/abs/2308.16369
- arXiv:2607.02043 — Towards Load-Aware Prefill Deflection: https://arxiv.org/abs/2607.02043
- vLLM 청크형 프리필 문서: https://docs.vllm.ai/en/latest/serving/chunked_prefill.html