LLM WikiAccess-protected knowledge portal

WIKI

Qwen3.6: Gated DeltaNet 하이브리드 어텐션으로 27B가 400B를 이기는 방법

27B가 400B를 이기는 이유 2026년 4월 22일, 알리바바 Qwen 팀은 Qwen3.6 27B를 Apache 2.0 라이선스로 공개했다. SWE bench Verified 소프트웨어 엔지니어링 에이전트 벤치마크 에서 77.2% —자체 전임자인 Qwen3.5 397B MoE 를 넘어서는 수치다. 파라미터 수는 14분의 1인데 코딩 에이전트 작업에서 더 나은 결과를 보였다. 이 차이가 단순히 학습 데이터나 파인튜닝의 결과가

경로human/study/content/ai-frontier/29-qwen3-6-gated-deltanet-hybrid-attention.md
카테고리Study
태그#attention #deltanet #gated #hybrid #qwen3 #study

27B가 400B를 이기는 이유

2026년 4월 22일, 알리바바 Qwen 팀은 Qwen3.6-27B를 Apache 2.0 라이선스로 공개했다. SWE-bench Verified(소프트웨어 엔지니어링 에이전트 벤치마크)에서 77.2%—자체 전임자인 Qwen3.5(397B MoE)를 넘어서는 수치다. 파라미터 수는 14분의 1인데 코딩 에이전트 작업에서 더 나은 결과를 보였다.

이 차이가 단순히 학습 데이터나 파인튜닝의 결과가 아닌 이유가 있다. Qwen3.6의 아키텍처는 트랜스포머의 핵심 병목—컨텍스트 창이 길어질수록 O(n²)로 늘어나는 어텐션 비용—을 아키텍처 수준에서 직접 해결한다.


하이브리드 어텐션 아키텍처: 블록 구조

Qwen3.6-27B는 64개 레이어로 구성되며, 16개의 반복 블록으로 조직된다. 각 블록은 동일한 패턴을 따른다: Gated DeltaNet 레이어 3개, Gated Attention 레이어 1개, 사이사이 피드포워드 네트워크가 끼어 있다.

Qwen3.6-27B: 하이브리드 어텐션 구조 (64 레이어 = 16 블록 × 4 레이어) 반복 블록 (16회 반복, 각 4 레이어) 입력 토큰 (x_t) Gated DeltaNet O(n) — 선형 복잡도 Feed-Forward Network Gated DeltaNet O(n) — 선형 복잡도 Feed-Forward Network Gated DeltaNet O(n) — 선형 복잡도 Feed-Forward Network Gated Self-Attention O(n²) — KV 캐시 사용 Feed-Forward Network ← 각 블록 = DeltaNet×3 + Attention×1 → 3/4 레이어가 선형 복잡도 (Gated DeltaNet) 1/4 레이어만 KV 캐시 사용 (Gated Attention) 메모리 특성 비교 표준 트랜스포머 (전체 레이어 Self-Attention) 1k 토큰 2k 토큰 4k 토큰 8k 토큰 KV 캐시: 컨텍스트 길이 × 모든 레이어 262K 토큰 → ~340 GB KV 캐시 (BF16) Qwen3.6-27B (Gated DeltaNet 3/4) 1k 토큰 4k 토큰 64k 토큰 262k 토큰 DeltaNet 레이어: 상수 크기 재귀 상태 (컨텍스트 무관) KV 캐시: 1/4 레이어만 → 대폭 절감 컨텍스트 창과 추론 가속 기본 컨텍스트: 262,144 토큰 YaRN 확장: 최대 1,010,000 토큰 MTP 헤드 내장: 투기적 디코딩 지원 패밀리: Dense vs MoE Qwen3.6-27B: 27B 전체 활성 (Dense) Qwen3.6-35B-A3B: 35B 총 파라미터, 3B 활성 (MoE)
Qwen3.6-27B 하이브리드 어텐션 블록 구조와 메모리 특성

전체 어텐션 예산의 3/4이 Gated DeltaNet, 즉 선형 어텐션으로 처리된다. 기존 Self-Attention이 매 레이어에서 O(n²) 연산을 수행하는 반면, Gated DeltaNet은 O(n) 복잡도로 고정 크기의 재귀 상태만 유지한다.


Gated DeltaNet: 선형 복잡도 어텐션의 원리

표준 Self-Attention은 쿼리(Q), 키(K), 밸류(V) 행렬 곱셈에서 n² 복잡도가 발생한다. 토큰이 늘어날수록 연산량과 KV 캐시 메모리가 제곱으로 증가한다.

DeltaNet은 고정 크기의 행렬 상태 S를 유지하고, 새 토큰이 들어올 때마다 델타 업데이트로 상태를 갱신한다.

S_t = S_{t-1} + (v_t − S_{t-1}k_t) ⊗ β_t · k_t k_t^T

여기서 β_t는 현재 토큰이 이전 기억을 얼마나 덮어쓸지 결정하는 게이트다. Gated DeltaNet은 입력 종속 게이트를 추가해 표현 능력을 높인다. KV 캐시 없이 상수 크기 상태만 전파하므로, 컨텍스트가 100만 토큰으로 늘어도 DeltaNet 레이어의 메모리 증가는 없다.

Qwen3.6은 3/4 레이어에서 이 선형 어텐션을 사용하므로, KV 캐시를 요구하는 레이어가 전체의 1/4로 줄어든다. 동일한 GPU 메모리로 훨씬 긴 컨텍스트를 처리할 수 있는 이유다.


262K → 100만 토큰: YaRN 컨텍스트 확장

Qwen3.6-27B의 기본 컨텍스트 창은 262,144토큰(약 20만 자)이다. YaRN(위치 보간법) 스케일링을 적용하면 1,010,000토큰까지 확장된다.

기존 트랜스포머에서 컨텍스트를 이렇게 늘리면 GPU 메모리가 폭발적으로 증가한다. Gated DeltaNet의 O(n) 특성이 이 확장을 실용적으로 만든다—KV 캐시는 전체의 1/4에 해당하는 Gated Attention 레이어에서만 축적된다.


Multi-Token Prediction: 투기적 디코딩 내장

Qwen3.6에는 MTP(Multi-Token Prediction) 헤드가 내장된다. MTP는 투기적 디코딩의 드래프터 역할을 한다. 본 모델이 토큰을 예측하는 동시에 MTP 헤드가 다음 몇 토큰을 미리 예측하고, 검증 단계에서 일치하면 한 번의 포워드 패스로 여러 토큰을 출력한다.

vLLM 공식 레시피에서 Qwen3.6-27B와 MTP를 함께 지원한다. 배포 시 --speculative-model "auto" 옵션으로 활성화한다.


Thinking Mode: 하이브리드 추론 전환

Qwen3.6는 Thinking Mode를 기본으로 활성화한다. 모델이 최종 답변을 내기 전에 <think>...</think> 블록으로 추론 흔적(chain-of-thought)을 생성한다. enable_thinking=False 파라미터로 비활성화해 빠른 응답으로 전환할 수 있다.

Thinking Preservation: 대화가 이어지는 동안 이전 추론 흔적이 컨텍스트로 유지된다. 이전 대화에서 도출한 추론을 다시 생성하지 않고 참조하므로, 긴 에이전트 루프에서 추론 품질이 안정적으로 유지된다.

모드적합한 상황토큰 비용
Thinking On (기본)수학, 코딩, 복잡한 판단높음
Thinking Off빠른 응답, 단순 지시 이행낮음

Qwen3.6 패밀리: Dense와 MoE

Qwen3.6은 두 모델로 구성된다.

Qwen3.6-27B (Dense) — 2026년 4월 22일 공개

Qwen3.6-35B-A3B (MoE) — 2026년 4월 16일 공개

Qwen3.6-27BQwen3.6-35B-A3BQwen3.5(397B)Claude Opus 4.6
SWE-bench Verified77.2%-~74%80.8%
활성 파라미터27B3B~40B-
오픈 웨이트✓ (Apache 2.0)✓ (Apache 2.0)
컨텍스트 창262K (1M)262K (1M)130K200K

배포 고려사항

메모리 요구사항 (Qwen3.6-27B)

정밀도GPU 메모리권장 구성
BF16~54 GBH100 80GB × 1
FP8~27 GBA100 80GB × 1 (여유 있음)
INT4 (GGUF)~18 GBRTX 4090 24GB × 1

공식 FP8 가중치(Qwen/Qwen3.6-27B-FP8)가 HuggingFace에 제공된다. vLLM에서 직접 로드 가능하다.

Thinking Mode와 토큰 관리

Thinking Mode는 사고 흔적 토큰을 추가로 생성하므로 출력 토큰이 상당히 길어진다. 배치 추론에서 max_model_len을 충분히 설정하거나, 사고 흔적을 스트리밍으로 처리해 메모리 압박을 줄여야 한다.

Gated DeltaNet 커널 최적화 현황

CUDA Flash Attention에 비해 Gated DeltaNet GPU 커널의 최적화가 아직 미성숙하다. 짧은 컨텍스트(< 8K 토큰)에서는 표준 어텐션 모델이 더 빠를 수 있다. 컨텍스트가 길어질수록 Gated DeltaNet의 속도 이점이 두드러진다.


운영자 체크리스트


Qwen3.6을 한 문장으로

Qwen3.6은 Gated DeltaNet 선형 어텐션으로 4 레이어 중 3개를 O(n)으로 바꿔, 100만 토큰 컨텍스트를 단일 GPU에서 실용적으로 만든 오픈 가중치 하이브리드 추론 모델이다.

References