Nemotron 3 Super 120B: LatentMoE·Mamba2 하이브리드·NVFP4 사전 학습으로 12B 활성 파라미터에서 120B 성능을 내는 방법
왜 지금 봐야 하나
2026년 4월, NVIDIA가 Nemotron 3 Super를 공개했다. 외형적 숫자는 120.6B 파라미터지만, 추론 시 포워드 패스당 활성화되는 파라미터는 12.7B에 불과하다. 구조적 설계 세 가지가 이 효율을 가능하게 한다.
첫째, NVFP4 사전 학습: 양자화를 사후에 적용하는 대신, 첫 번째 그래디언트 업데이트부터 4비트 산술 제약 안에서 모델을 학습시켰다. 모델이 4비트 표현의 오차를 학습 과정에서 직접 보정한다.
둘째, 별도 드래프트 모델 없는 투기적 디코딩: MTP(Multi-Token Prediction) 레이어를 아키텍처 내부에 내장해, 외부 드래프트 모델 없이도 투기적 디코딩의 처리량 이점을 얻는다. VRAM 절약과 운영 단순화 모두 얻는다.
셋째, Mamba2-Transformer 하이브리드 MoE: 대부분의 레이어가 Mamba2 State Space Model로 처리되고, 전역 어텐션은 전략적으로 배치된 소수의 "앵커" 레이어에만 집중된다. 시퀀스 길이에 대한 선형 복잡도로 최대 1M 토큰 컨텍스트를 처리한다.
이 글은 세 가지 아키텍처 설계의 작동 방식, NVFP4 학습 경계, 투기적 디코딩 구조, 배포 기준을 다룬다.
모델 스펙 요약
| 항목 | 값 |
|---|---|
| 총 파라미터 | 120.6B |
| 포워드 패스당 활성 파라미터 | 12.7B (임베딩 제외 12.1B) |
| 레이어 수 | 88 |
| 모델 차원(d\_model) | 4096 |
| 레이어당 전문가 수 | 512 (top-22 활성) |
| MoE 라우팅 잠재 차원 | 1024 |
| 최대 컨텍스트 길이 | 1M 토큰 |
| 사전 학습 양자화 | NVFP4 (대부분 선형 레이어) |
| 공개 | 2026-04-15 (arXiv 2604.12374) |
| 라이선스 | NVIDIA Open Model License |
아키텍처 1: LatentMoE — 압축된 잠재 공간에서 전문가를 선택한다
기존 MoE 라우팅의 비용
표준 MoE 아키텍처는 d\_model 차원(이 모델의 경우 4096) 전체 벡터를 보고 전문가 게이팅 결정을 내린다. 512개 전문가 중 상위 22개를 선택해야 하므로, 게이팅 네트워크 자체가 적지 않은 계산과 메모리 접근 비용을 차지한다.
LatentMoE의 접근
LatentMoE는 게이팅 전에 토큰을 더 작은 잠재 차원(1024)으로 투영한다. 게이팅 네트워크는 4096 대신 1024 차원 벡터를 보고 22개 전문가를 선택한다. 실제 전문가 계산은 여전히 전체 차원에서 수행된다.
이 설계의 실질적 효과:
- 같은 계산 예산에서 표준 MoE 대비 약 4배 더 많은 전문가를 활성화할 수 있다
- 라우팅 메모리 접근 패턴이 압축되어 캐시 효율이 높아진다
- 잠재 투영 레이어는 BF16/MXFP8으로 유지되어 정밀도를 보호한다
d_model = 4096
4096 → 1024
(BF16/MXFP8)
top-22 of 512
in 1024-dim space
활성
활성
비활성
활성
전문가 계산 자체는 d_model = 4096에서 수행
아키텍처 2: Mamba2-Transformer 하이브리드 인터리빙
왜 Mamba2인가
표준 Transformer 셀프 어텐션의 시간·공간 복잡도는 시퀀스 길이 L에 대해 O(L²)다. 1M 토큰 컨텍스트에서 이것은 치명적이다. Mamba2(State Space Model, SSM)는 선형 복잡도 O(L)로 시퀀스를 처리하며, 추론 시 상태 크기가 고정되어 KV 캐시처럼 토큰 수에 비례해 메모리가 늘지 않는다.
하이브리드 인터리빙 패턴
Nemotron 3 Super의 88개 레이어는 세 종류 블록이 주기적으로 반복되는 구조다.
- Mamba2 블록: 대부분을 차지한다. 지역적 시퀀스 패턴을 선형 복잡도로 처리한다
- MoE 레이어: Mamba2 블록 사이에 배치된다. LatentMoE 라우팅으로 용량을 확장한다
- 전역 어텐션 앵커: 소수의 레이어. 전체 시퀀스에 걸친 장거리 의존성을 처리한다
전역 어텐션 레이어는 "앵커" 역할로 전략적으로 삽입돼, Mamba2의 선형 복잡도를 유지하면서도 Transformer의 전역 정보 접근 능력을 보완한다.
#1
#2
#3
#4
앵커
#6
#7
#8
아키텍처 3: NVFP4 사전 학습
기존 방식 — 사후 양자화의 한계
표준 워크플로는 FP16/BF16으로 학습을 완료한 뒤 INT8, FP8, 또는 INT4로 변환한다. 사후 양자화는 원래 가중치가 고정밀도에서 최적화됐기 때문에, 4비트 수준에서는 전문가 라우팅 패턴이 흔들리거나 특정 레이어의 활성화 분포가 왜곡될 수 있다.
NVFP4 사전 학습의 구조
Nemotron 3 Super는 Nemotron 3 계열 최초로 첫 번째 그래디언트 업데이트부터 NVFP4 제약 안에서 학습됐다. 가중치가 4비트 표현의 한계를 직접 보정하는 방향으로 최적화된다.
구체적 적용 경계:
| 레이어 유형 | 적용 정밀도 | 이유 |
|---|---|---|
| 대부분의 선형 레이어 | NVFP4 (가중치·활성화·그래디언트) | 계산 효율 극대화 |
| 잠재 투영 레이어 | MXFP8 | 라우팅 정밀도 보호 |
| MTP 레이어 | BF16 | 드래프트 안정성 |
| QKV·어텐션 투영 | BF16/MXFP8 | 어텐션 수치 안정성 |
| 임베딩 레이어 | BF16 | 토큰 표현 정밀도 보호 |
NVFP4는 NVIDIA Blackwell(B200/B100) GPU에서 가장 높은 성능을 낸다. Hopper(H100) 이하 환경에서는 FP8 체크포인트가 현실적 선택이다.
아키텍처 4: MTP를 통한 네이티브 투기적 디코딩
전통적 투기적 디코딩의 부담
투기적 디코딩은 소형 드래프트 모델이 다음 N개 토큰을 먼저 생성하고, 대형 타깃 모델이 이를 한 번에 검증하는 방식이다. 출력 품질을 유지하면서 처리량을 높이지만, 드래프트 모델을 별도 메모리에 올리고 두 모델의 배포를 함께 관리해야 한다.
MTP 레이어: 아키텍처 내장 드래프터
Nemotron 3 Super는 MTP(Multi-Token Prediction) 레이어를 메인 아키텍처에 직접 내장했다. MTP 레이어는 현재 숨겨진 상태에서 다음 여러 토큰을 동시에 예측한다. 추론 시 이 예측이 드래프트 역할을 하고, 메인 포워드 패스가 검증한다.
실용적 의미:
- 별도 드래프트 모델 불필요 → VRAM 절약, 배포 복잡도 감소
- 드래프트와 검증이 같은 가중치 공간에서 이루어지므로 정렬이 더 좋다
- 독립 학습된 오프셋 헤드 방식보다 긴 드래프트 길이에서 더 안정적이다 (MTP는 공동 학습됐기 때문)
- MTP 레이어 자체가 학습 신호 품질도 향상시킨다 (다음 토큰 외에 n+1, n+2 토큰까지 예측하도록 훈련)
성능 벤치마크
| 벤치마크 | Nemotron 3 Super |
|---|---|
| MMLU-Pro | 83.73 |
| LiveCodeBench v6 (2024-08 ~ 2025-05) | 78.69 |
| LiveCodeBench v5 (2024-07 ~ 2024-12) | 81.19 |
12.7B 활성 파라미터 기준으로 비교하면, 완전한 70B 밀집 모델에 준하는 성능이다. NVIDIA는 agentic reasoning 벤치마크에서 오픈 소스 최상위급과 경쟁한다고 밝혔다.
배포 방법
NIM 마이크로서비스 (온프레미스)
docker run --gpus all --rm -p 8000:8000 \
nvcr.io/nim/nvidia/nemotron-3-super-120b-a12b-fp8:latestOpenAI 호환 API 엔드포인트를 제공한다. FP8 체크포인트 기준 4× H100 80GB 이상이 필요하다.
클라우드 API
build.nvidia.com: 공식 NVIDIA API 게이트웨이- Hugging Face Inference Endpoints
- Together AI, Fireworks AI, DeepInfra, Modal, CoreWeave
사용 가능한 체크포인트
| 체크포인트 | 권장 환경 |
|---|---|
| NVIDIA-Nemotron-3-Super-120B-A12B-BF16 | 정밀도 우선, A100/H100 |
| NVIDIA-Nemotron-3-Super-120B-A12B-FP8 | 성능/정밀도 균형, H100/B200 |
| NVIDIA-Nemotron-3-Super-120B-A12B-GGUF (unsloth) | CPU·저사양 로컬 환경 |
운영 판단 기준
이 모델이 적합한 경우
- 오픈 소스 라이선스가 필요하면서 120B급 성능을 원할 때
- 긴 컨텍스트(32K ~ 1M 토큰) 처리가 핵심인 에이전트 추론 워크로드
- Blackwell/Hopper 인프라에서 NVFP4/FP8 네이티브 성능을 활용하려 할 때
- 별도 드래프트 모델 없이 투기적 디코딩의 처리량 이점을 얻고 싶을 때
주의해야 할 경우
- BF16 전체 모델은 4× A100 80GB 이상이 필요하다 — 가능하면 FP8 체크포인트 사용
- Mamba2 아키텍처는 일부 추론 프레임워크에서 지원이 제한될 수 있다 — vLLM 0.24+, TensorRT-LLM 1.3+를 확인한다
- GGUF 변환 후 MTP 레이어 동작은 커뮤니티 검증 중
Open Questions
- 1M 토큰 컨텍스트에서 Mamba2 상태 크기의 실제 메모리 한계는 공개 문서화 전
- 정확한 레이어별 Mamba2 vs 전역 어텐션 비율은 논문에서 "소수(small ratio)"로만 표현됨
- GGUF 변환 후 MTP 투기적 디코딩 활성화 방법은 별도 검증 필요
References
- Nemotron 3 Super: arXiv 2604.12374
- NVIDIA Nemotron 3 Super Technical Report (PDF)
- NVIDIA Developer Blog: Introducing Nemotron 3 Super
- HuggingFace: nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16
- DeepInfra: Nemotron 3 Super 120B API Benchmarks
- Medium: Papers Explained 558: Nemotron 3 Super (Ritvik Rastogi)
- NVFP4 Inference on Blackwell SM120 GPUs