Qwen3.8-Flash-Next: Qwen4 아키텍처의 사전 공개 — Gated DeltaNet·QSA 하이브리드와 N-gram Embedding의 동작 원리
요약
Alibaba Qwen 팀은 2026년 8월 26일 Qwen3.8-Flash-Next를 공개했다. 총 파라미터 125B이지만 토큰 당 활성 파라미터가 6B에 불과하며, 51B N-gram 임베딩 테이블과 4B 멀티 토큰 예측(MTP) 모듈을 포함하면 실제 가중치 합계는 약 180B다. 이 모델이 주목받는 이유는 성능 수치가 아니라 Qwen4가 사용할 아키텍처를 먼저 공개한다는 전략에 있다. Gated DeltaNet(선형 어텐션)과 Qwen Sparse Attention(QSA)을 1M 토큰 컨텍스트에서 결합한 하이브리드 구조, N-gram 임베딩으로 파라미터 용량을 저비용으로 확장하는 방식, 그리고 Muon 옵티마이저와 워밍업 없는 배치 사이즈 스케줄—이 세 가지가 Qwen4 아키텍처의 핵심이다.
1. 왜 지금, 왜 이런 방식으로 공개하는가
오픈 소스 LLM 개발에서 플래그십 모델을 출시하기 전에 차기 아키텍처의 핵심 구성 요소를 별도 모델로 먼저 공개하는 것은 이례적이다. Qwen 팀은 이 전략을 두 가지 이유로 선택했다.
첫째, 에코시스템 준비 시간 확보다. Gated DeltaNet은 표준 Transformer 어텐션과 달리 KV 캐시가 아닌 고정 크기 은닉 상태를 사용한다. 이 구조를 vLLM, SGLang 같은 추론 엔진에서 지원하려면 커스텀 커널 작업이 필요하다. 모델을 먼저 공개함으로써 프레임워크 개발자들이 Qwen4 출시 전에 최적화를 완료할 수 있다.
둘째, 정량화 도구와 서빙 파이프라인 검증이다. Flash-Next의 BF16 체크포인트는 335.28 GiB, FP8은 172.78 GiB다. GB300 기준 최소 TP2, 권장은 TP4다. 이 수치를 가능한 빨리 배포자들이 경험하게 해 Qwen4 출시 때 운영 마찰을 줄이는 것이 목표다.
2. 48레이어 하이브리드 아키텍처: 3:1 반복 패턴
Qwen3.8-Flash-Next의 레이어 구성은 36개의 Gated DeltaNet 레이어와 12개의 QSA 레이어가 3:1 비율로 반복되는 패턴이다.
Gated DeltaNet (GDN)은 선형 어텐션의 일종이다. 전통적인 Softmax 어텐션이 O(N²) 연산과 N × d 크기의 KV 캐시를 필요로 하는 것과 달리, GDN은 고정 크기의 은닉 상태 행렬을 점진적으로 업데이트한다. 컨텍스트 길이가 길어져도 KV 캐시 크기가 선형 증가하지 않는다.
Qwen Sparse Attention (QSA)는 토큰 수준이 아닌 마이크로 블록 수준에서 관련 컨텍스트를 선택한다. 전통적인 Sliding Window Attention이 고정 창을 유지하는 것과 달리, QSA는 마이크로 블록 단위로 가장 관련성 높은 블록들을 동적으로 선택해 전체 컨텍스트에서 정확한 글로벌 정보를 유지한다. Qwen 팀이 발표한 수치에 따르면 1M 토큰 컨텍스트에서 프리필 7.6배, 디코드 4.9배 커널 속도 향상을 달성한다.
왜 두 가지 어텐션을 혼합하는가? GDN만으로는 특정 위치의 정확한 정보 검색(precise recall)에서 Full Attention 대비 품질 저하가 발생할 수 있다. QSA를 4번째 레이어마다 배치해 전역 컨텍스트 접근을 보장하고, 나머지 3개 레이어에서는 GDN의 비용 효율성을 활용한다.
3. Gated Residual: 정보 흐름 제어의 세분화
기존 Transformer의 잔차 연결(residual connection)은 단순히 입력을 출력에 더한다:
h' = h + F(h)Qwen3.8-Flash-Next는 이를 데이터 의존적 게이팅으로 대체한다:
h' = α · h + β · F(h)여기서 α는 입력에서 계산된 원소별(element-wise) 읽기 게이트, β는 브랜치별 스칼라 쓰기 게이트다. 두 게이트 모두 학습 파라미터가 아닌 현재 은닉 상태에서 동적으로 결정된다.
이 설계의 장점:
- 레이어마다 얼마나 많은 이전 정보를 유지하고 새 정보를 반영할지 모델이 스스로 조절
- 깊은 레이어에서도 기울기 소실(gradient vanishing) 완화
- 훈련 안정성을 유지하면서 표현력 확장
4. N-gram 임베딩 테이블 (51B): 저비용 용량 확장
Qwen3.8-Flash-Next의 가장 독특한 구성 요소 중 하나는 51B짜리 N-gram 임베딩 테이블이다.
기존 임베딩: 각 토큰 ID를 벡터로 매핑 (단일 토큰 단위). N-gram 임베딩: 주변 토큰의 문맥을 고려한 위치 의존적 임베딩 생성.
토큰 t의 최종 임베딩은 단일 토큰 임베딩에 N-gram 컨텍스트 임베딩이 합산된다. 이 51B 테이블은 다음 두 가지 특성 덕분에 실용적이다:
- 호스트 메모리 오프로드 가능: 실제 계산 중에 GPU에 있을 필요가 없다. 임베딩 조회는 계산 병렬로 비동기 프리페치 가능.
- 추가 연산 최소: 임베딩 조회는 행렬 곱셈이 아닌 인덱스 조회이므로 FLOPs 증가가 없다.
N-gram 임베딩의 목적은 단순하다. 모델이 같은 토큰이라도 앞뒤 문맥에 따라 다른 초기 표현을 갖게 함으로써 초기 레이어에서의 정보 처리 부담을 줄인다.
5. 멀티 토큰 예측 (MTP) 모듈 (4B)
MTP 모듈은 기존의 투기적 디코딩(speculative decoding)과 다른 방식으로 다중 토큰을 예측한다.
- 별도의 드래프터 모델이 아닌, 주 모델과 함께 학습된 작은 전용 예측 헤드
- 주 모델이 다음 토큰
t+1을 예측하는 동시에 MTP 모듈이t+2,t+3을 미리 예측 - 예측이 틀려도 주 모델의
t+1예측에는 영향 없음 (독립적 경로)
훈련 시 MTP 손실이 주 모델 손실에 추가돼 모델이 미래 토큰을 더 잘 고려하도록 유도하는 보조 학습 신호 역할도 한다.
6. 훈련: Muon + AdamW와 워밍업 없는 스케줄
Qwen3.8-Flash-Next는 두 가지 옵티마이저를 가중치 종류에 따라 분리 적용한다.
| 가중치 유형 | 옵티마이저 |
|---|---|
| 쿼리/키/밸류/출력 프로젝션 | Muon |
| 임베딩, MTP, 일부 GDN 가중치 | AdamW |
Muon은 행렬 가중치에 Nesterov 모멘텀을 적용하고 뉴턴-슐츠 반복(Newton-Schulz iteration)으로 업데이트를 직교화(orthogonalize)한다. 이 덕분에 학습률을 높여도 발산 없이 더 빠른 수렴이 가능하다.
두 번째 핵심은 배치 사이즈 워밍업 제거다. 기존 대형 모델 훈련에서는 초기 수천 스텝 동안 배치 사이즈를 작게 유지했다가 목표 크기까지 점진적으로 키우는 워밍업 단계가 일반적이다. Qwen 팀은 목표 배치 사이즈에서 직접 시작해 총 최적화 스텝 수를 줄이면서도 더 큰 학습률을 사용할 수 있었다고 밝혔다.
7. 컨텍스트 확장: 262K → 1M (YaRN)
Flash-Next의 기본 컨텍스트 길이는 262,144 토큰이다. YaRN(Yet another RoPE extensioN)을 사용하면 약 1,048,576 토큰(1M)까지 확장된다.
QSA가 1M 컨텍스트에서 7.6배 프리필 속도 향상을 달성한다는 점이 실용적으로 중요하다. Full Attention이라면 1M 토큰에서 O(N²) 연산이 감당 불가능한 수준이 되지만, QSA의 마이크로 블록 선택 덕분에 에이전트 워크로드에서 실제 서빙이 가능해진다.
8. 배포와 서빙 고려사항
# 최소 구성 (FP8, TP2, GB300 2개)
FP8 체크포인트: 172.78 GiB
TP2 최소 → GPU당 약 86 GiB
# 권장 구성 (FP8, TP4, GB300 4개)
FP8 체크포인트: 172.78 GiB
TP4 권장 → GPU당 약 43 GiB + KV 캐시 여유서빙 엔진 호환성: Gated DeltaNet의 선형 어텐션 구조는 표준 PagedAttention KV 캐시와 다르다. GDN 레이어는 고정 크기 은닉 상태를 관리해야 한다. vLLM, SGLang 모두 2026년 9월 기준으로 Flash-Next 지원 추가 중이며, 모델 카드에서 최신 호환 버전을 확인해야 한다.
라이선스: qwen-community-1.0 라이선스. Apache 2.0보다 일부 제약이 있으므로 상업적 사용 전 검토 필요.
| 항목 | 값 |
|---|---|
| 총 파라미터 | 125B (+ 51B N-gram + 4B MTP = ~180B 가중치) |
| 활성 파라미터/토큰 | 6B |
| 레이어 구성 | 48 (36 GDN + 12 QSA) |
| 기본 컨텍스트 | 262,144 tokens |
| 최대 컨텍스트 | 1,048,576 tokens (YaRN) |
| BF16 체크포인트 | 335.28 GiB |
| FP8 체크포인트 | 172.78 GiB |
| 최소 TP (FP8) | 2 (GB300) |
| 권장 TP | 4 |
| 릴리스일 | 2026-08-26 |
| 라이선스 | qwen-community-1.0 |
9. Qwen4로 가는 길: Flash-Next가 보여주는 방향
Flash-Next가 미리 공개한 아키텍처 결정들은 Qwen4에서 무엇이 중요해질지를 시사한다.
선형 어텐션의 대폭 확대: 36/48 레이어(75%)를 GDN으로 채운 것은 단순한 실험이 아니다. 장기 에이전트 워크로드에서 KV 캐시 메모리가 병목이 되는 상황에서, 선형 어텐션이 실용적 대안임을 선언하는 것이다.
N-gram 임베딩의 표준화: 51B 테이블이 FLOPs 증가 없이 모델 용량을 늘릴 수 있다면, Qwen4는 이보다 큰 N-gram 테이블을 사용할 가능성이 높다.
Muon 옵티마이저: 대형 모델 훈련에서 Muon이 AdamW 대비 수렴 속도 이점을 보인다면, 차세대 모델 훈련의 기본 옵티마이저가 바뀔 수 있다.