요약
vLLM 0.27.0이 2026년 8월 9일 릴리스됐다. 242명의 기여자가 561건의 커밋을 제출한 이번 릴리스는 하드웨어 지원, 커널 성능, 모델 범위라는 세 축에서 동시에 전진했다.
하드웨어 측면에서는 NVIDIA Rubin(sm_107) GPU와 NVLink, AMD ROCm gfx1250(Radeon RX 9000 시리즈)을 새롭게 지원한다. 커널 측면에서는 DeepSeek-V4 전용 커널이 V3 대비 약 2배의 처리 속도를 보이고, FlashAttention4(FA4)가 SM100(H100·H200·Blackwell)에서 FP8 정밀도와 headdim-256을 동시에 지원한다. 모델 범위에서는 Model Runner V2(MRv2)가 디코더 전용 LLM을 넘어 인코더 모델, 임베딩, 분류 태스크를 단일 서빙 경로로 처리한다. Rust gRPC 프런트엔드의 첫 번째 버전도 이번 릴리스에 포함됐다.
릴리스 맥락
vLLM은 매달 마이너 버전을 출시하는 빠른 개발 사이클을 유지한다. 0.27은 0.26 직후 나온 릴리스지만, 세 가지 독립적인 방향을 동시에 진전시켰다는 점에서 단순 누적 이상이다.
배경이 된 압력들:
- 2026년 하반기부터 NVIDIA Rubin 기반 HGX 시스템의 초기 배포가 시작되며 서빙 프레임워크의 sm_107 지원 필요성이 생겼다.
- AMD Instinct 시리즈와 소비자용 Radeon RX 9000 시리즈가 AI 워크로드에 진입하며 ROCm 경로에 대한 요구가 실질화됐다.
- DeepSeek-V4 모델이 V3 대비 아키텍처 변화가 있어 전용 커널 최적화가 필요해졌다.
- 임베딩과 분류 모델을 LLM 서빙 인프라와 별도로 운영하는 비용이 높아짐에 따라, 단일 vLLM 인스턴스에서 다양한 모델 타입을 처리하려는 수요가 커졌다.
하드웨어 지원 확장
NVIDIA Rubin (sm_107) · NVLink
NVIDIA Rubin은 Blackwell(sm_100) 다음 세대 아키텍처다. vLLM 0.27에서 sm_107 연산 코드와 NVLink 텐서 전송 경로를 지원해, 멀티 GPU 서빙에서 GPU 간 KV 캐시 이동이 NVLink 대역폭을 직접 활용한다.
실제 이 기능을 사용하려면 Rubin GPU를 탑재한 HGX 또는 DGX 시스템이 필요하다. 단일 GPU 서버에서는 차이가 없다.
AMD ROCm gfx1250
gfx1250은 AMD Radeon RX 9000 시리즈 GPU에 해당하는 GPU 코드네임이다. 소비자용 GPU에서 vLLM을 구동할 수 있다는 의미로, 대규모 클라우드 배포보다는 연구 환경이나 소규모 온프레미스 환경에 더 직접적인 영향을 미친다.
FlashAttention4: FP8과 headdim-256
FlashAttention3이 SM90(H100)에서 안정화된 이후, FA4는 SM100 이상을 타깃으로 두 가지를 추가했다.
| 기능 | 설명 | 실용적 의미 |
|---|---|---|
| FP8 정밀도 | 어텐션 행렬 연산을 8비트 부동소수점으로 실행 | 메모리 대역폭 사용량 감소, 동일 시간 내 더 긴 시퀀스 처리 가능 |
| headdim-256 | 어텐션 헤드 차원을 256까지 지원 | Gemma 3, Qwen3 등 높은 헤드 차원을 사용하는 최신 모델과 호환성 확보 |
FA4는 SM100 이상에서만 FP8 경로가 활성화된다. H100·H200·Blackwell 이전 GPU에서는 기존 FA3 경로가 사용된다.
Model Runner V2: 디코더를 넘어서
vLLM 0.27 이전까지 vLLM의 내부 실행 경로는 디코더 전용 자기회귀(autoregressive) LLM을 기본 단위로 설계됐다. Model Runner V2(MRv2)는 이 가정을 제거하고 모델 타입에 따라 실행 경로를 분기한다.
0.27에서 MRv2 V1이 포함되며 지원하는 모델 타입:
- 디코더 전용 LLM: 기존과 동일
- 인코더 모델: BERT 계열, 문서 이해 모델 등
- 임베딩 모델: 텍스트 → 벡터 변환, RAG 파이프라인에서 자주 쓰임
- 분류 모델: 텍스트 분류, 감성 분석 등
이 변화의 실용적 의미는 인프라 단순화다. 기존에는 임베딩이나 분류에 별도의 서빙 솔루션(Hugging Face TGI, FastAPI 래퍼 등)을 병행해야 했지만, 이제 단일 vLLM 인스턴스에서 처리할 수 있다.
아키텍처 개요
Rust gRPC 프런트엔드
0.27에서 Rust로 작성된 gRPC 프런트엔드의 V1이 포함됐다. 아직 실험적 단계이며 기존 Python HTTP API를 대체하지 않는다.
Rust gRPC 경로의 목적은 두 가지다. 첫째, 고빈도 요청 처리에서 Python GIL로 인한 직렬화 오버헤드를 줄이는 것. 둘째, gRPC 스트리밍을 통한 실시간 토큰 전송을 정식 인터페이스로 지원하는 것.
V1 단계이므로 프로덕션 적용 전에 구체적인 안정성 문서를 확인해야 한다. 0.28 또는 0.29에서 안정화가 진행될 가능성이 높다.
모델 지원: Kimi K3 · Qwen3.5 MoE
이번 릴리스에서 Kimi K3와 Qwen3.5 MoE 모델이 공식 지원 목록에 추가됐다.
Kimi K3는 Moonshot AI의 최신 모델 계열로, 긴 컨텍스트 처리에 특화된 구조를 가진다. Qwen3.5 MoE는 Alibaba의 Qwen 시리즈 중 Mixture-of-Experts 변형으로, 토큰당 활성화 파라미터 수를 낮게 유지하면서 전체 파라미터 수를 늘리는 방식이다.
두 모델 모두 MRv2 경로가 아닌 기존 디코더 경로에서 지원된다.
운영 관점
즉시 활용 가능한 변경
- DeepSeek-V4 배포 중인 경우: 커널 업데이트로 추가 설정 없이 처리량이 향상된다.
- H100 · H200 · Blackwell 보유 시: FA4 FP8 경로가 자동으로 활성화된다. 단, FP8 수치 정밀도 영향을 모델별로 검증하는 것이 권장된다.
- 임베딩·분류 모델을 별도로 서빙 중인 경우: MRv2를 통해 vLLM으로 통합할 수 있는지 평가해볼 수 있다.
주의할 사항
| 항목 | 상태 | 실행 기준 |
|---|---|---|
| Rust gRPC 프런트엔드 | 실험적 V1 | 기존 HTTP 클라이언트와 병행 테스트 후 전환 |
| FA4 FP8 경로 | SM100+ 전용 | A100 환경에서는 변화 없음 |
| MRv2 V1 인코더 지원 | 부분 커버리지 | 모델 패밀리별 지원 범위 문서 확인 필요 |
정리
vLLM 0.27은 세 가지 축으로 요약된다. 하드웨어 축에서는 Rubin과 gfx1250으로 지원 범위를 넓혔고, 커널 축에서는 FA4 FP8과 DeepSeek-V4 커널로 H100/H200 이상의 처리 효율을 높였다. 모델 타입 축에서는 MRv2로 디코더 전용이라는 암묵적 제약을 제거했다. 매달 빠르게 전진하는 vLLM의 특성상, 이번 릴리스의 실험적 요소들(Rust gRPC, MRv2 V1)은 다음 1~2개 릴리스 사이클에서 안정화될 전망이다.
References
- vLLM Project, "Release v0.27.0," GitHub, August 9, 2026. https://github.com/vllm-project/vllm/releases/tag/v0.27.0
- vLLM Project. https://github.com/vllm-project/vllm
- Dao-AILab, FlashAttention. https://github.com/Dao-AILab/flash-attention
- NVIDIA Rubin Architecture. https://www.nvidia.com/en-us/data-center/rubin/
- AMD ROCm Documentation. https://rocm.docs.amd.com/