Qwen3.6: Gated DeltaNet 하이브리드 어텐션으로 27B가 400B를 이기는 방법
27B가 400B를 이기는 이유
2026년 4월 22일, 알리바바 Qwen 팀은 Qwen3.6-27B를 Apache 2.0 라이선스로 공개했다. SWE-bench Verified(소프트웨어 엔지니어링 에이전트 벤치마크)에서 77.2%—자체 전임자인 Qwen3.5(397B MoE)를 넘어서는 수치다. 파라미터 수는 14분의 1인데 코딩 에이전트 작업에서 더 나은 결과를 보였다.
이 차이가 단순히 학습 데이터나 파인튜닝의 결과가 아닌 이유가 있다. Qwen3.6의 아키텍처는 트랜스포머의 핵심 병목—컨텍스트 창이 길어질수록 O(n²)로 늘어나는 어텐션 비용—을 아키텍처 수준에서 직접 해결한다.
하이브리드 어텐션 아키텍처: 블록 구조
Qwen3.6-27B는 64개 레이어로 구성되며, 16개의 반복 블록으로 조직된다. 각 블록은 동일한 패턴을 따른다: Gated DeltaNet 레이어 3개, Gated Attention 레이어 1개, 사이사이 피드포워드 네트워크가 끼어 있다.
전체 어텐션 예산의 3/4이 Gated DeltaNet, 즉 선형 어텐션으로 처리된다. 기존 Self-Attention이 매 레이어에서 O(n²) 연산을 수행하는 반면, Gated DeltaNet은 O(n) 복잡도로 고정 크기의 재귀 상태만 유지한다.
Gated DeltaNet: 선형 복잡도 어텐션의 원리
표준 Self-Attention은 쿼리(Q), 키(K), 밸류(V) 행렬 곱셈에서 n² 복잡도가 발생한다. 토큰이 늘어날수록 연산량과 KV 캐시 메모리가 제곱으로 증가한다.
DeltaNet은 고정 크기의 행렬 상태 S를 유지하고, 새 토큰이 들어올 때마다 델타 업데이트로 상태를 갱신한다.
S_t = S_{t-1} + (v_t − S_{t-1}k_t) ⊗ β_t · k_t k_t^T여기서 β_t는 현재 토큰이 이전 기억을 얼마나 덮어쓸지 결정하는 게이트다. Gated DeltaNet은 입력 종속 게이트를 추가해 표현 능력을 높인다. KV 캐시 없이 상수 크기 상태만 전파하므로, 컨텍스트가 100만 토큰으로 늘어도 DeltaNet 레이어의 메모리 증가는 없다.
Qwen3.6은 3/4 레이어에서 이 선형 어텐션을 사용하므로, KV 캐시를 요구하는 레이어가 전체의 1/4로 줄어든다. 동일한 GPU 메모리로 훨씬 긴 컨텍스트를 처리할 수 있는 이유다.
262K → 100만 토큰: YaRN 컨텍스트 확장
Qwen3.6-27B의 기본 컨텍스트 창은 262,144토큰(약 20만 자)이다. YaRN(위치 보간법) 스케일링을 적용하면 1,010,000토큰까지 확장된다.
기존 트랜스포머에서 컨텍스트를 이렇게 늘리면 GPU 메모리가 폭발적으로 증가한다. Gated DeltaNet의 O(n) 특성이 이 확장을 실용적으로 만든다—KV 캐시는 전체의 1/4에 해당하는 Gated Attention 레이어에서만 축적된다.
Multi-Token Prediction: 투기적 디코딩 내장
Qwen3.6에는 MTP(Multi-Token Prediction) 헤드가 내장된다. MTP는 투기적 디코딩의 드래프터 역할을 한다. 본 모델이 토큰을 예측하는 동시에 MTP 헤드가 다음 몇 토큰을 미리 예측하고, 검증 단계에서 일치하면 한 번의 포워드 패스로 여러 토큰을 출력한다.
vLLM 공식 레시피에서 Qwen3.6-27B와 MTP를 함께 지원한다. 배포 시 --speculative-model "auto" 옵션으로 활성화한다.
Thinking Mode: 하이브리드 추론 전환
Qwen3.6는 Thinking Mode를 기본으로 활성화한다. 모델이 최종 답변을 내기 전에 <think>...</think> 블록으로 추론 흔적(chain-of-thought)을 생성한다. enable_thinking=False 파라미터로 비활성화해 빠른 응답으로 전환할 수 있다.
Thinking Preservation: 대화가 이어지는 동안 이전 추론 흔적이 컨텍스트로 유지된다. 이전 대화에서 도출한 추론을 다시 생성하지 않고 참조하므로, 긴 에이전트 루프에서 추론 품질이 안정적으로 유지된다.
| 모드 | 적합한 상황 | 토큰 비용 |
|---|---|---|
| Thinking On (기본) | 수학, 코딩, 복잡한 판단 | 높음 |
| Thinking Off | 빠른 응답, 단순 지시 이행 | 낮음 |
Qwen3.6 패밀리: Dense와 MoE
Qwen3.6은 두 모델로 구성된다.
Qwen3.6-27B (Dense) — 2026년 4월 22일 공개
- 파라미터: 27B (전체 활성)
- 레이어: 64 (16 블록 × 4 레이어)
- 컨텍스트: 262K 기본 → 1M (YaRN)
- 라이선스: Apache 2.0
- GPU 요구사항: BF16로 약 54 GB VRAM (FP8이면 27 GB)
Qwen3.6-35B-A3B (MoE) — 2026년 4월 16일 공개
- 총 파라미터: 35B, 추론 시 활성 파라미터: 3B
- 추론 비용은 3B 모델 수준이지만 35B 모델의 지식을 보유
- 엣지 배포나 비용 제약 환경에 적합
| Qwen3.6-27B | Qwen3.6-35B-A3B | Qwen3.5(397B) | Claude Opus 4.6 | |
|---|---|---|---|---|
| SWE-bench Verified | 77.2% | - | ~74% | 80.8% |
| 활성 파라미터 | 27B | 3B | ~40B | - |
| 오픈 웨이트 | ✓ (Apache 2.0) | ✓ (Apache 2.0) | ✓ | ✗ |
| 컨텍스트 창 | 262K (1M) | 262K (1M) | 130K | 200K |
배포 고려사항
메모리 요구사항 (Qwen3.6-27B)
| 정밀도 | GPU 메모리 | 권장 구성 |
|---|---|---|
| BF16 | ~54 GB | H100 80GB × 1 |
| FP8 | ~27 GB | A100 80GB × 1 (여유 있음) |
| INT4 (GGUF) | ~18 GB | RTX 4090 24GB × 1 |
공식 FP8 가중치(Qwen/Qwen3.6-27B-FP8)가 HuggingFace에 제공된다. vLLM에서 직접 로드 가능하다.
Thinking Mode와 토큰 관리
Thinking Mode는 사고 흔적 토큰을 추가로 생성하므로 출력 토큰이 상당히 길어진다. 배치 추론에서 max_model_len을 충분히 설정하거나, 사고 흔적을 스트리밍으로 처리해 메모리 압박을 줄여야 한다.
Gated DeltaNet 커널 최적화 현황
CUDA Flash Attention에 비해 Gated DeltaNet GPU 커널의 최적화가 아직 미성숙하다. 짧은 컨텍스트(< 8K 토큰)에서는 표준 어텐션 모델이 더 빠를 수 있다. 컨텍스트가 길어질수록 Gated DeltaNet의 속도 이점이 두드러진다.
운영자 체크리스트
- [ ] SWE-bench 77.2%는 SWE-agent 같은 스캐폴딩을 포함한 수치다. 기본 completions API만 사용하면 수치가 낮아진다—실제 태스크로 직접 검증한다.
- [ ] Thinking Preservation은 긴 대화 컨텍스트를 보관한다. 에이전트 루프에서 컨텍스트 예산을 명시적으로 관리하지 않으면 긴 세션에서 빠르게 소모된다.
- [ ] MoE 모델(35B-A3B)은 3B 활성 파라미터이지만 전체 35B 가중치를 메모리에 올려야 한다—실제 메모리 요구사항은 ~70 GB이다.
- [ ] Gated DeltaNet이 짧은 컨텍스트에서 느릴 수 있다. 주요 워크로드의 평균 컨텍스트 길이를 측정하고 짧은 경우 표준 어텐션 모델과 비교 테스트를 권장한다.
- [ ] YaRN을 활용한 1M 컨텍스트는 기본 262K 범위보다 추론 품질이 하락할 수 있다. 운영에서는 512K 내외에서 품질 테스트를 선행한다.
Qwen3.6을 한 문장으로
Qwen3.6은 Gated DeltaNet 선형 어텐션으로 4 레이어 중 3개를 O(n)으로 바꿔, 100만 토큰 컨텍스트를 단일 GPU에서 실용적으로 만든 오픈 가중치 하이브리드 추론 모델이다.
References
- Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE (MarkTechPost, Apr 2026): https://www.marktechpost.com/2026/04/22/alibaba-qwen-team-releases-qwen3-6-27b-a-dense-open-weight-model-outperforming-397b-moe-on-agentic-coding-benchmarks/
- Qwen/Qwen3.6-27B (HuggingFace Model Card): https://huggingface.co/Qwen/Qwen3.6-27B
- Qwen3.6-27B: 27B Model Beats 397B on Coding (Build Fast with AI): https://www.buildfastwithai.com/blogs/qwen3-6-27b-review-2026
- Qwen3.6-27B vLLM Recipes: https://recipes.vllm.ai/Qwen/Qwen3.6-27B
- Open Weights Wave — Qwen 3.6, Granite 4.1, HiDream-O1 (Insightful AI World, Apr 2026): https://insightfulaiworld.ghost.io/open-weights-wave-qwen-36-granite-41-hidream-april-may-2026/
- Qwen3.6-27B Delivers Flagship Coding in 27B Dense Model (Let's Data Science): https://letsdatascience.com/news/qwen36-27b-delivers-flagship-coding-in-27b-dense-model-fd698bba
- Qwen3.6 Benchmarks & Review (The AI Rankings): https://theairankings.com/alibaba/qwen-3-6/
- Qwen3.6-35B-A3B (HuggingFace Model Card): https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen3 Review: Hybrid Thinking Modes and MoE Architecture Explained (Effloow): https://effloow.com/articles/qwen3-review-hybrid-thinking-moe-guide-2026