요약
2026년 8월 3일, 알리바바 Qwen 팀은 Qwen3.8-Max를 발표했다. 총 2.4조 개의 파라미터, 토큰당 950억 개가 활성화되는 MoE 구조, 100만 토큰 컨텍스트 창, 그리고 텍스트·이미지·비디오를 한 모델에서 처리하는 네이티브 멀티모달을 갖춘다.
발표 시점의 성능:
| 벤치마크 | Qwen3.8-Max | Claude Fable 5 | GPT-5.6 Sol Max |
|---|---|---|---|
| OSWorld-Verified | 86.1 | 85.0 | 83.2 |
OSWorld-Verified는 실제 GUI 조작을 요구하는 에이전트 평가 지표다. 이 점수는 최신 Claude·OpenAI 플래그십을 모두 앞선다.
8월 12일, 가중치가 HuggingFace와 ModelScope에 공개됐다(Qwen/Qwen3.8-2.4T-A95B). Qwen이 Max 클래스 플래그십 가중치를 오픈소스로 공개한 건 이번이 처음이다. 라이선스는 Apache 2.0이다.
- 발표일: 2026년 8월 3일 (API)
- 오픈 가중치 공개: 2026년 8월 12~13일
- 라이선스: Apache 2.0
- API 가격: 입력 $2 / 출력 $6 (백만 토큰당)
아키텍처
규모와 전문가 구성
Qwen3.8-Max는 이전 세대 Qwen3.6-27B(35B-A3B)의 경험을 바탕으로 설계됐다. 차이는 규모와 레이어 구성이다.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.4조 |
| 활성 파라미터 (토큰당) | 950억 |
| 레이어 수 | 92 |
| 전문가 수 | 512 |
| 활성 전문가 | 10 + 공유 1 |
| 컨텍스트 창 | 1,000,000 토큰 |
| 지원 입력 모달 | 텍스트, 이미지, 비디오 |
토큰당 10개의 라우팅 전문가와 1개의 공유 전문가가 활성화된다. 전체 512개의 전문가 중 약 2.1%만 활성화되므로, 추론 비용은 중간 크기 Dense 모델 수준에 가깝다.
하이브리드 어텐션 설계
92개의 레이어는 두 종류의 어텐션이 혼합된다:
- 69 레이어: Gated DeltaNet (선형 어텐션)
- 23 레이어: 표준 전체 어텐션 (Full Attention)
Gated DeltaNet은 Qwen3.6 세대에서 처음 도입된 선형 복잡도 어텐션이다. 긴 컨텍스트에서 Softmax Attention 대비 연산량이 선형적으로 증가해, 100만 토큰 처리 시 비용이 크게 낮아진다. 23개의 전체 어텐션 레이어는 정밀한 토큰 간 관계가 필요한 구간에 집중 배치돼 표현력을 보완한다.
성능
에이전트 벤치마크
Qwen3.8-Max는 에이전트·롱컨텍스트·코딩 벤치마크에서 두드러진 성적을 냈다.
| 벤치마크 | 설명 | 점수 |
|---|---|---|
| OSWorld-Verified | 실제 GUI 에이전트 조작 | 86.1 |
| SWE-bench Verified | 실제 GitHub 이슈 해결 | Open question |
| MMMU | 멀티모달 이해력 | Open question |
| AIME 2025 | 수학 추론 | Open question |
OSWorld-Verified는 마우스 클릭·키보드 입력·화면 인식이 모두 필요한 실제 컴퓨터 조작 태스크로 구성된다. 86.1은 Claude Fable 5(85.0)와 GPT-5.6 Sol Max(83.2)를 앞서는 수치다.
API와 가격
API 가격은 입력 $2, 출력 $6 (백만 토큰당). Grok 4.5($2/$6)과 동일하고 GPT-5.6 Sol($3/$15)보다 저렴하다. 최고 성능 티어 모델 가운데 비용 효율이 높은 편에 속한다.
서빙 및 배포
하드웨어 요구사항
가중치 전체를 BF16으로 올리면 VRAM 약 4.8 TB가 필요하다. 현실적인 배포 경로:
| 설정 | 하드웨어 | 정밀도 |
|---|---|---|
| 최소 클러스터 | 2 × NVIDIA B300 또는 AMD MI355X 노드 | BF16/FP8 |
| 단일 노드 | NVIDIA B200 × 8 | NVFP4/MXFP4 |
| 단일 소비자 GPU | 불가 | — |
FP4 양자화를 쓰면 단일 8×B200 노드에서 서빙이 가능하다. NVFP4와 MXFP4 체크포인트가 함께 공개됐다.
vLLM·SGLang 가이드
vLLM은 오픈 가중치 공개일(8월 12일)에 Day-0 지원을 발표했다. SGLang도 동일 시점에 대응 레시피를 제공했다.
vLLM 서빙 예시 (FP8 체크포인트):
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3.8-2.4T-A95B \
--dtype float8 \
--tensor-parallel-size 16 \
--pipeline-parallel-size 2 \
--max-model-len 32768SGLang 서빙 예시 (Expert Parallelism 활용):
python -m sglang.launch_server \
--model-path Qwen/Qwen3.8-2.4T-A95B \
--tp 8 --ep 16 \
--enable-moe-epSGLang은 TP/DP-Attention과 WideEP(Wide Expert Parallelism)를 함께 지원한다. MoE 모델에서는 Expert Parallelism이 GPU 간 통신 효율을 높여 처리량을 개선한다.
추론 최적화 옵션
| 기능 | 지원 여부 |
|---|---|
| 투기적 디코딩 | 지원 (vLLM DSpark 사전 설정) |
| FP8 KV 캐시 | 지원 |
| PD 분리 (Prefill-Decode) | SGLang WideEP 기반 실험적 지원 |
| Prefix Caching | 지원 |
| NVFP4 / MXFP4 양자화 | 가중치 제공 |
Qwen 세대 흐름
Qwen3.8-Max가 처음부터 Max 클래스를 열었던 게 아니다. 이전 세대와의 관계를 이해하면 설계 선택이 명확해진다.
| 모델 | 출시 | 특징 |
|---|---|---|
| Qwen3.6-27B | 2026-04 | Gated DeltaNet 하이브리드 첫 도입. 35B-A3B MoE. |
| Qwen3.8-27B | 2026-08-14 | Dense. 262K 컨텍스트. 비전-언어 네이티브. Apache 2.0. |
| Qwen3.8-Max | 2026-08-03 | 2.4T MoE 플래그십. 92층 하이브리드. 1M 컨텍스트. |
Qwen3.8-27B는 동일 세대의 더 작은 Dense 모델로, 로컬 실행과 엣지 배포를 겨냥한다. 로컬에서 Qwen3.8-27B로 개발하고 프로덕션에서 Qwen3.8-Max API를 호출하는 패턴이 권장된다.
운영자 관점
Max 클래스를 직접 서빙할 것인가
2×B300 노드 이상이 없다면 자체 서빙은 비현실적이다. 대부분의 팀은 Alibaba Cloud DashScope API 또는 써드파티 추론 API를 사용하게 된다. 오픈 가중치 공개의 의미는 다음 세 가지다:
- 독립 추론 업체가 동일 모델을 낮은 가격에 제공할 가능성.
- 특정 도메인 데이터로 SFT·RLVR 파인튜닝 가능.
- 모델 내부 구조를 연구·분석할 수 있음.
API 비용 계산
대화형 에이전트에서 평균 컨텍스트 길이가 8,000 토큰이고 월 100만 회 요청을 처리한다면:
- 입력: 8B 토큰 × $2/M = $16,000
- 출력 (응답 평균 500 토큰 가정): 500M 토큰 × $6/M = $3,000
- 합계: 월 약 $19,000
Claude Fable 5($10/$50 기준)와 비교하면 입력 기준 5배 저렴하다.
알려진 제한
- 멀티모달 비디오 입력은 API 제공 시점 기준 Preview 상태. 안정성 확인 필요.
- 투기적 디코딩 설정은 vLLM/SGLang 버전에 따라 달라짐. 배포 전 버전 고정 권장.
- NVFP4 양자화는 B200 GPU 이상에서만 유의미한 속도 이득.
체크리스트
- [ ] 서비스 SLO(지연, 처리량)를 정의하고 Qwen3.8-Max API vs. 경쟁 플래그십 비용을 비교했는가
- [ ] 에이전트 태스크(OSWorld 유형 GUI 조작, 코딩)가 주된 사용 사례라면 벤치마크 점수를 실제 태스크로 검증했는가
- [ ] 오픈 가중치 자체 서빙이 필요하다면 2×B300 노드 이상의 GPU 클러스터 계획을 수립했는가
- [ ] FP4 양자화를 쓸 경우 품질 저하를 프로덕션 태스크로 사전 평가했는가
- [ ] Qwen3.8-27B(Dense)를 개발·테스트용으로 병행 사용하는 전략을 검토했는가
References
- Qwen 팀 발표: https://qwen.readthedocs.io/en/latest/
- Qwen3.8-2.4T-A95B HuggingFace: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
- vLLM Day-0 지원 발표: https://vllm.ai/blog/2026-08-12-qwen3.8
- SGLang Qwen3.8 레시피: https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8
- Hyperstack 멀티노드 배포 가이드: https://www.hyperstack.cloud/technical-resources/tutorials/deploy-qwen3.8-max-on-gpu-cloud-for-multi-node-2.4t-inference
- Qwen3.8-Max 벤치마크 비교 (DataCamp): https://www.datacamp.com/blog/qwen3-8-max