LLM WikiAccess-protected knowledge portal
← 스터디 홈
125편 · 약 14분

Qwen3.8-Max: 2.4조 파라미터 오픈 MoE 플래그십이 에이전트 벤치마크 정점에 선 방법

요약

2026년 8월 3일, 알리바바 Qwen 팀은 Qwen3.8-Max를 발표했다. 총 2.4조 개의 파라미터, 토큰당 950억 개가 활성화되는 MoE 구조, 100만 토큰 컨텍스트 창, 그리고 텍스트·이미지·비디오를 한 모델에서 처리하는 네이티브 멀티모달을 갖춘다.

발표 시점의 성능:

벤치마크Qwen3.8-MaxClaude Fable 5GPT-5.6 Sol Max
OSWorld-Verified86.185.083.2

OSWorld-Verified는 실제 GUI 조작을 요구하는 에이전트 평가 지표다. 이 점수는 최신 Claude·OpenAI 플래그십을 모두 앞선다.

8월 12일, 가중치가 HuggingFace와 ModelScope에 공개됐다(Qwen/Qwen3.8-2.4T-A95B). Qwen이 Max 클래스 플래그십 가중치를 오픈소스로 공개한 건 이번이 처음이다. 라이선스는 Apache 2.0이다.

  • 발표일: 2026년 8월 3일 (API)
  • 오픈 가중치 공개: 2026년 8월 12~13일
  • 라이선스: Apache 2.0
  • API 가격: 입력 $2 / 출력 $6 (백만 토큰당)

아키텍처

규모와 전문가 구성

Qwen3.8-Max는 이전 세대 Qwen3.6-27B(35B-A3B)의 경험을 바탕으로 설계됐다. 차이는 규모와 레이어 구성이다.

항목
총 파라미터2.4조
활성 파라미터 (토큰당)950억
레이어 수92
전문가 수512
활성 전문가10 + 공유 1
컨텍스트 창1,000,000 토큰
지원 입력 모달텍스트, 이미지, 비디오

토큰당 10개의 라우팅 전문가와 1개의 공유 전문가가 활성화된다. 전체 512개의 전문가 중 약 2.1%만 활성화되므로, 추론 비용은 중간 크기 Dense 모델 수준에 가깝다.

하이브리드 어텐션 설계

92개의 레이어는 두 종류의 어텐션이 혼합된다:

  • 69 레이어: Gated DeltaNet (선형 어텐션)
  • 23 레이어: 표준 전체 어텐션 (Full Attention)

Gated DeltaNet은 Qwen3.6 세대에서 처음 도입된 선형 복잡도 어텐션이다. 긴 컨텍스트에서 Softmax Attention 대비 연산량이 선형적으로 증가해, 100만 토큰 처리 시 비용이 크게 낮아진다. 23개의 전체 어텐션 레이어는 정밀한 토큰 간 관계가 필요한 구간에 집중 배치돼 표현력을 보완한다.

Qwen3.8-Max 아키텍처 개요 레이어 구성 (92층) Gated DeltaNet (선형 어텐션) 69 레이어 · 75% 복잡도 O(n) — 긴 컨텍스트 효율 100만 토큰에서도 선형 비용 Qwen3.6 세대부터 도입된 설계 표준 전체 어텐션 (Full Attention) 23 레이어 · 25% 복잡도 O(n²) — 정밀한 관계 포착 핵심 추론 구간에 집중 배치 토큰당 10개 라우팅 전문가 + 1개 공유 전문가 활성화 추론 흐름 입력 토큰 (텍스트 / 이미지 / 비디오) 최대 1,000,000 토큰 컨텍스트 Gated DeltaNet 블록 × 69 선형 복잡도 · 긴 컨텍스트 효율 처리 Full Attention 블록 × 23 이차 복잡도 · 정밀 토큰 관계 포착 MoE 라우터 (각 레이어) 512개 중 10개 선택 + 1 공유 → 총 2.1% 활성 출력 (텍스트 / 멀티모달 응답)
Qwen3.8-Max 하이브리드 레이어 구성 (92 레이어)

성능

에이전트 벤치마크

Qwen3.8-Max는 에이전트·롱컨텍스트·코딩 벤치마크에서 두드러진 성적을 냈다.

벤치마크설명점수
OSWorld-Verified실제 GUI 에이전트 조작86.1
SWE-bench Verified실제 GitHub 이슈 해결Open question
MMMU멀티모달 이해력Open question
AIME 2025수학 추론Open question

OSWorld-Verified는 마우스 클릭·키보드 입력·화면 인식이 모두 필요한 실제 컴퓨터 조작 태스크로 구성된다. 86.1은 Claude Fable 5(85.0)와 GPT-5.6 Sol Max(83.2)를 앞서는 수치다.

API와 가격

API 가격은 입력 $2, 출력 $6 (백만 토큰당). Grok 4.5($2/$6)과 동일하고 GPT-5.6 Sol($3/$15)보다 저렴하다. 최고 성능 티어 모델 가운데 비용 효율이 높은 편에 속한다.


서빙 및 배포

하드웨어 요구사항

가중치 전체를 BF16으로 올리면 VRAM 약 4.8 TB가 필요하다. 현실적인 배포 경로:

설정하드웨어정밀도
최소 클러스터2 × NVIDIA B300 또는 AMD MI355X 노드BF16/FP8
단일 노드NVIDIA B200 × 8NVFP4/MXFP4
단일 소비자 GPU불가

FP4 양자화를 쓰면 단일 8×B200 노드에서 서빙이 가능하다. NVFP4와 MXFP4 체크포인트가 함께 공개됐다.

vLLM·SGLang 가이드

vLLM은 오픈 가중치 공개일(8월 12일)에 Day-0 지원을 발표했다. SGLang도 동일 시점에 대응 레시피를 제공했다.

vLLM 서빙 예시 (FP8 체크포인트):

python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen3.8-2.4T-A95B \
  --dtype float8 \
  --tensor-parallel-size 16 \
  --pipeline-parallel-size 2 \
  --max-model-len 32768

SGLang 서빙 예시 (Expert Parallelism 활용):

python -m sglang.launch_server \
  --model-path Qwen/Qwen3.8-2.4T-A95B \
  --tp 8 --ep 16 \
  --enable-moe-ep

SGLang은 TP/DP-Attention과 WideEP(Wide Expert Parallelism)를 함께 지원한다. MoE 모델에서는 Expert Parallelism이 GPU 간 통신 효율을 높여 처리량을 개선한다.

추론 최적화 옵션

기능지원 여부
투기적 디코딩지원 (vLLM DSpark 사전 설정)
FP8 KV 캐시지원
PD 분리 (Prefill-Decode)SGLang WideEP 기반 실험적 지원
Prefix Caching지원
NVFP4 / MXFP4 양자화가중치 제공

Qwen 세대 흐름

Qwen3.8-Max가 처음부터 Max 클래스를 열었던 게 아니다. 이전 세대와의 관계를 이해하면 설계 선택이 명확해진다.

모델출시특징
Qwen3.6-27B2026-04Gated DeltaNet 하이브리드 첫 도입. 35B-A3B MoE.
Qwen3.8-27B2026-08-14Dense. 262K 컨텍스트. 비전-언어 네이티브. Apache 2.0.
Qwen3.8-Max2026-08-032.4T MoE 플래그십. 92층 하이브리드. 1M 컨텍스트.

Qwen3.8-27B는 동일 세대의 더 작은 Dense 모델로, 로컬 실행과 엣지 배포를 겨냥한다. 로컬에서 Qwen3.8-27B로 개발하고 프로덕션에서 Qwen3.8-Max API를 호출하는 패턴이 권장된다.


운영자 관점

Max 클래스를 직접 서빙할 것인가

2×B300 노드 이상이 없다면 자체 서빙은 비현실적이다. 대부분의 팀은 Alibaba Cloud DashScope API 또는 써드파티 추론 API를 사용하게 된다. 오픈 가중치 공개의 의미는 다음 세 가지다:

  1. 독립 추론 업체가 동일 모델을 낮은 가격에 제공할 가능성.
  2. 특정 도메인 데이터로 SFT·RLVR 파인튜닝 가능.
  3. 모델 내부 구조를 연구·분석할 수 있음.

API 비용 계산

대화형 에이전트에서 평균 컨텍스트 길이가 8,000 토큰이고 월 100만 회 요청을 처리한다면:

  • 입력: 8B 토큰 × $2/M = $16,000
  • 출력 (응답 평균 500 토큰 가정): 500M 토큰 × $6/M = $3,000
  • 합계: 월 약 $19,000

Claude Fable 5($10/$50 기준)와 비교하면 입력 기준 5배 저렴하다.

알려진 제한

  • 멀티모달 비디오 입력은 API 제공 시점 기준 Preview 상태. 안정성 확인 필요.
  • 투기적 디코딩 설정은 vLLM/SGLang 버전에 따라 달라짐. 배포 전 버전 고정 권장.
  • NVFP4 양자화는 B200 GPU 이상에서만 유의미한 속도 이득.

체크리스트

  • [ ] 서비스 SLO(지연, 처리량)를 정의하고 Qwen3.8-Max API vs. 경쟁 플래그십 비용을 비교했는가
  • [ ] 에이전트 태스크(OSWorld 유형 GUI 조작, 코딩)가 주된 사용 사례라면 벤치마크 점수를 실제 태스크로 검증했는가
  • [ ] 오픈 가중치 자체 서빙이 필요하다면 2×B300 노드 이상의 GPU 클러스터 계획을 수립했는가
  • [ ] FP4 양자화를 쓸 경우 품질 저하를 프로덕션 태스크로 사전 평가했는가
  • [ ] Qwen3.8-27B(Dense)를 개발·테스트용으로 병행 사용하는 전략을 검토했는가

References

  • Qwen 팀 발표: https://qwen.readthedocs.io/en/latest/
  • Qwen3.8-2.4T-A95B HuggingFace: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
  • vLLM Day-0 지원 발표: https://vllm.ai/blog/2026-08-12-qwen3.8
  • SGLang Qwen3.8 레시피: https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8
  • Hyperstack 멀티노드 배포 가이드: https://www.hyperstack.cloud/technical-resources/tutorials/deploy-qwen3.8-max-on-gpu-cloud-for-multi-node-2.4t-inference
  • Qwen3.8-Max 벤치마크 비교 (DataCamp): https://www.datacamp.com/blog/qwen3-8-max