LLM WikiAccess-protected knowledge portal

WIKI

HYPIC: 하이브리드 어텐션 LLM 서빙에서 포지션 독립적 캐싱으로 TTFT를 2.45배 낮추는 방법

긴 프롬프트를 조립하는 비용 RAG 파이프라인과 에이전트 워크플로우가 일상이 된 LLM 서빙 환경에서는 요청 하나가 독립적인 여러 세그먼트로 구성된다. 사용자 질문, 검색된 문서 조각 여러 개, 시스템 프롬프트, 이전 대화 이력—이것들이 조합되어 하나의 긴 컨텍스트가 된다. 이런 구조에서 프리필 prefill 단계 가 지배적인 비용이 된다. 타깃 모델이 입력 전체를 처리해 KV 캐시를 생성하는 이 단계에서, 프롬프트 길이에 비

경로human/study/content/ai-frontier/88-hypic-hybrid-attention-position-independent-caching-llm-serving.md
카테고리Study
태그#ai-review #caching #independent #llm #position #serving #study

긴 프롬프트를 조립하는 비용

RAG 파이프라인과 에이전트 워크플로우가 일상이 된 LLM 서빙 환경에서는 요청 하나가 독립적인 여러 세그먼트로 구성된다. 사용자 질문, 검색된 문서 조각 여러 개, 시스템 프롬프트, 이전 대화 이력—이것들이 조합되어 하나의 긴 컨텍스트가 된다.

이런 구조에서 프리필(prefill) 단계가 지배적인 비용이 된다. 타깃 모델이 입력 전체를 처리해 KV 캐시를 생성하는 이 단계에서, 프롬프트 길이에 비례해 계산량이 올라간다. 여러 요청이 동일한 문서 세그먼트를 포함하더라도 매번 처음부터 계산한다면 낭비가 크다.

포지션 독립적 캐싱(Position-Independent Caching, PIC) 은 이 문제의 해결책으로 자리 잡았다. 각 세그먼트를 독립적으로 캐싱해두면, 동일한 세그먼트가 다른 요청에서 다시 등장해도 재계산 없이 캐시를 불러온다. 세그먼트가 컨텍스트의 어느 위치에 배치되든—포지션이 달라지든—재사용 가능하다는 것이 핵심이다.

그런데 최근 하이브리드 어텐션 모델이 등장하면서 PIC에 근본적인 문제가 생겼다. 2026년 7월 1일 arXiv에 공개된 논문 HYPIC(arXiv:2607.01299)은 이 충돌을 분석하고 해결책을 제시한다.


하이브리드 어텐션 모델의 구조

현대 하이브리드 어텐션 모델은 전통적인 풀 어텐션(full attention) 레이어와 선형 어텐션(linear attention) 레이어를 섞어 쓴다. Mamba, RWKV, Griffin, Jamba 같은 모델들이 이 방식을 채택한다.

이 혼합이 매력적인 이유는 계산 복잡도다. 풀 어텐션은 시퀀스 길이 N에 대해 O(N²) 계산량이 필요하지만, 선형 어텐션은 O(N)으로 줄어든다. 대부분의 레이어를 선형 어텐션으로 대체하면 긴 컨텍스트에서 계산량이 크게 줄어든다.

그런데 두 레이어 타입의 상태 표현 방식이 근본적으로 다르다.

레이어 타입상태 표현재사용 단위
풀 어텐션토큰별 Key-Value 쌍토큰 단위 KV 캐시
선형 어텐션요청 전체의 순환 상태(recurrent state)요청 단위 상태 벡터

풀 어텐션의 KV 캐시는 세그먼트 단위로 저장하고 불러올 수 있다. 세그먼트 A의 KV를 캐싱해두면, 다른 요청이 세그먼트 A를 포함할 때 그 KV를 재사용하면 된다. 세그먼트의 위치가 달라져도 KV는 독립적으로 유효하다.

반면 선형 어텐션의 순환 상태는 입력 전체를 순서대로 처리한 누적 결과다. 세그먼트 A 다음에 B가 오는 경우의 상태와, C 다음에 A가 오는 경우의 상태가 다르다. 기존 PIC 방식처럼 세그먼트 단위로 캐싱해도 다른 요청에서 그 상태를 직접 이어 붙일 수 없다.

이것이 하이브리드 어텐션 모델에 PIC가 작동하지 않는 이유다.


HYPIC의 핵심 아이디어

HYPIC 캐싱 아키텍처 — 풀 어텐션과 선형 어텐션 처리 비교 세그먼트 A 시스템 프롬프트 세그먼트 B 검색 문서 #1 세그먼트 C 사용자 질문 HYPIC 캐시 세그먼트 A KV 캐시 (풀 어텐션) 전이 연산자 T_A (선형) 세그먼트 B KV 캐시 (풀 어텐션) 전이 연산자 T_B (선형) 캐시 미스: 콜드 프리필 분산 병렬 처리 (8 워커) 하이브리드 어텐션 모델 풀 어텐션 레이어 KV 캐시 직접 주입 경계 솔기 윈도우로 연결부 보정 → 토큰 단위 재사용 유지 선형 어텐션 레이어 세그먼트 누적 전이 연산자 합성 T_A ⊕ T_B = T_AB zero-start 종료 상태 캐싱 상수 시간 상태 복원 O(1) → 순환 상태 재사용 가능 대부분 레이어 = 선형 어텐션 소수 레이어 = 풀 어텐션 HYPIC 성능 결과 TTFT 2.45× 감소 기존 서빙 시스템 대비, 동일 SLO 처리량 2.0× 향상 피크 처리량, 동일 SLO 기준 정확도 풀 재계산 대비 -3.3p 콜드 프리필 8 워커 6.1× 가속 4개 하이브리드 어텐션 모델 5개 워크로드에서 일관된 결과 핵심 혁신 요약 풀 어텐션: 기존 PIC의 토큰 단위 KV 재사용 유지 + 경계 솔기 윈도우로 세그먼트 연결부 보정 선형 어텐션: 세그먼트 누적 전이 연산자(T)를 새 캐싱 단위로 도입 → O(1) 상태 합성 캐시 미스(콜드): 세그먼트 자기완결성을 이용해 다수 워커에게 분산 처리
HYPIC — 하이브리드 어텐션 서빙의 포지션 독립적 캐싱 구조

HYPIC의 핵심 통찰은 두 레이어 타입 각각에 맞는 캐싱 단위를 새롭게 정의하는 것이다.


세그먼트 누적 전이 연산자

선형 어텐션의 순환 상태는 행렬 연산으로 표현할 수 있다. 세그먼트 S를 처리하면 상태가 다음과 같이 변한다.

h_out = T_S · h_in + e_S

여기서 T_S전이 행렬(transition matrix), e_S누적 효과(effect vector)다. 중요한 것은 T_Se_S입력 상태 h_in과 독립적이라는 점이다. 세그먼트의 내용만으로 결정된다.

HYPIC은 이것을 이용한다. 각 세그먼트에 대해:

세그먼트 A, B, C를 순서대로 처리하는 상태는 다음과 같이 합성된다.

T_ABC = T_C · T_B · T_A
e_ABC = T_C · (T_B · e_A + e_B) + e_C

각 세그먼트의 전이 연산자가 캐싱되어 있다면, 이 합성은 세그먼트 내용을 재계산하지 않고도 상수 시간에 완료된다. 어떤 순서로 세그먼트를 조합해도 캐시를 재사용할 수 있다.


경계 솔기 윈도우

풀 어텐션 레이어에서도 문제가 있다. 각 세그먼트를 독립적으로 처리해 KV를 캐싱하면, 세그먼트 A와 B가 합쳐질 때 연결부에서 어텐션이 끊긴다. A의 마지막 토큰들이 B의 첫 토큰들을 볼 수 없게 된다.

HYPIC은 이 문제를 경계 솔기 윈도우(boundary seam window) 로 해결한다. 세그먼트 경계마다 작은 겹침 영역을 두어, 해당 구간의 어텐션을 소량 재계산한다. 솔기 윈도우의 크기는 작게 유지되므로 전체 비용에 미치는 영향은 미미하다.


병렬 콜드 프리필

캐시가 없는 새 세그먼트(콜드 캐시 미스)를 처음 처리할 때, HYPIC은 세그먼트의 자기완결성(self-containment) 을 활용한다. 선형 어텐션에서 세그먼트 내부 처리는 외부 컨텍스트 없이도 완전히 계산할 수 있다. 따라서 하나의 세그먼트를 여러 조각으로 나누어 다수의 워커에게 병렬 처리하고, 결과를 전이 연산자 합성으로 결합한다.

8개 워커를 사용하면 단일 워커 대비 6.1배 빠른 콜드 프리필을 달성한다고 논문은 보고한다.


성능 실험 결과

논문은 네 가지 하이브리드 어텐션 모델과 다섯 가지 워크로드에서 기존 서빙 시스템과 비교했다.

지표HYPIC vs 기존 시스템
TTFT2.45× 감소
피크 처리량 (동일 SLO)2.0× 향상
정확도 (풀 재계산 대비)-3.3점 이내
콜드 프리필 (8워커)6.1× 가속

정확도 손실이 -3.3점 이내라는 것은 전이 연산자 합성이 근사(near-exact) 임을 의미한다. 완전한 재계산과 동일하지 않지만, 실용적 범위에서 정밀도를 유지한다.


운영 시사점

HYPIC이 제안하는 설계는 하이브리드 어텐션 모델이 LLM 서빙 인프라에서 점유율을 높여감에 따라 중요해진다. 현재 운영 관점에서 고려할 점은 다음과 같다.

서빙 시스템 호환성: HYPIC은 기존 vLLM 같은 풀 어텐션 서빙 시스템을 확장하는 형태로 설계되었다. 하이브리드 어텐션 모델로 전환할 때 기존 서빙 프레임워크가 PIC를 지원해도, 그 PIC가 선형 어텐션 레이어를 올바르게 처리하는지 확인해야 한다.

세그먼트 캐시 관리: 전이 연산자 (T_S, e_S) 는 세그먼트당 추가 저장 공간을 요구한다. 크기는 선형 어텐션의 상태 차원에 비례하므로, 캐시 용량 계획 시 이 오버헤드를 포함해야 한다.

워크로드 적합성: HYPIC의 이득은 세그먼트 재사용률이 높을수록 크다. 동일한 문서 청크를 여러 요청이 공유하는 RAG 환경이나, 동일 시스템 프롬프트를 여러 에이전트가 공유하는 환경에서 효과가 두드러진다.

경계 조건: 논문 기준 정확도 손실은 -3.3점 이내지만, 이 수치는 특정 모델군과 워크로드에서 측정된 것이다. 정밀도 요구사항이 엄격한 응용에서는 직접 검증이 필요하다.

Open question: HYPIC의 전이 연산자 합성이 모든 선형 어텐션 변형 아키텍처에 동일하게 적용되는지는 현재 명확하지 않다. 논문에서 테스트한 네 가지 모델 이외의 구조에서의 동작은 추가 확인이 필요하다.


References