LLM WikiAccess-protected knowledge portal
← 스터디 홈
59편 · 약 18분

Nemotron 3 Super 120B: LatentMoE·Mamba2 하이브리드·NVFP4 사전 학습으로 12B 활성 파라미터에서 120B 성능을 내는 방법

왜 지금 봐야 하나

2026년 4월, NVIDIA가 Nemotron 3 Super를 공개했다. 외형적 숫자는 120.6B 파라미터지만, 추론 시 포워드 패스당 활성화되는 파라미터는 12.7B에 불과하다. 구조적 설계 세 가지가 이 효율을 가능하게 한다.

첫째, NVFP4 사전 학습: 양자화를 사후에 적용하는 대신, 첫 번째 그래디언트 업데이트부터 4비트 산술 제약 안에서 모델을 학습시켰다. 모델이 4비트 표현의 오차를 학습 과정에서 직접 보정한다.

둘째, 별도 드래프트 모델 없는 투기적 디코딩: MTP(Multi-Token Prediction) 레이어를 아키텍처 내부에 내장해, 외부 드래프트 모델 없이도 투기적 디코딩의 처리량 이점을 얻는다. VRAM 절약과 운영 단순화 모두 얻는다.

셋째, Mamba2-Transformer 하이브리드 MoE: 대부분의 레이어가 Mamba2 State Space Model로 처리되고, 전역 어텐션은 전략적으로 배치된 소수의 "앵커" 레이어에만 집중된다. 시퀀스 길이에 대한 선형 복잡도로 최대 1M 토큰 컨텍스트를 처리한다.

이 글은 세 가지 아키텍처 설계의 작동 방식, NVFP4 학습 경계, 투기적 디코딩 구조, 배포 기준을 다룬다.


모델 스펙 요약

항목
총 파라미터120.6B
포워드 패스당 활성 파라미터12.7B (임베딩 제외 12.1B)
레이어 수88
모델 차원(d\_model)4096
레이어당 전문가 수512 (top-22 활성)
MoE 라우팅 잠재 차원1024
최대 컨텍스트 길이1M 토큰
사전 학습 양자화NVFP4 (대부분 선형 레이어)
공개2026-04-15 (arXiv 2604.12374)
라이선스NVIDIA Open Model License

아키텍처 1: LatentMoE — 압축된 잠재 공간에서 전문가를 선택한다

기존 MoE 라우팅의 비용

표준 MoE 아키텍처는 d\_model 차원(이 모델의 경우 4096) 전체 벡터를 보고 전문가 게이팅 결정을 내린다. 512개 전문가 중 상위 22개를 선택해야 하므로, 게이팅 네트워크 자체가 적지 않은 계산과 메모리 접근 비용을 차지한다.

LatentMoE의 접근

LatentMoE는 게이팅 전에 토큰을 더 작은 잠재 차원(1024)으로 투영한다. 게이팅 네트워크는 4096 대신 1024 차원 벡터를 보고 22개 전문가를 선택한다. 실제 전문가 계산은 여전히 전체 차원에서 수행된다.

이 설계의 실질적 효과:

  • 같은 계산 예산에서 표준 MoE 대비 약 4배 더 많은 전문가를 활성화할 수 있다
  • 라우팅 메모리 접근 패턴이 압축되어 캐시 효율이 높아진다
  • 잠재 투영 레이어는 BF16/MXFP8으로 유지되어 정밀도를 보호한다
입력 토큰
d_model = 4096
잠재 투영
4096 → 1024
(BF16/MXFP8)
게이팅 네트워크
top-22 of 512
in 1024-dim space
↓ 선택된 22개 전문가
Expert #37
활성
Expert #89
활성
Expert #142
비활성
Expert #203
활성
… 490개 비활성
22개 전문가 결과 가중 합산 → 다음 레이어로
전문가 계산 자체는 d_model = 4096에서 수행
LatentMoE 라우팅: 압축 공간에서 전문가 선택 후 전체 차원 계산

아키텍처 2: Mamba2-Transformer 하이브리드 인터리빙

왜 Mamba2인가

표준 Transformer 셀프 어텐션의 시간·공간 복잡도는 시퀀스 길이 L에 대해 O(L²)다. 1M 토큰 컨텍스트에서 이것은 치명적이다. Mamba2(State Space Model, SSM)는 선형 복잡도 O(L)로 시퀀스를 처리하며, 추론 시 상태 크기가 고정되어 KV 캐시처럼 토큰 수에 비례해 메모리가 늘지 않는다.

하이브리드 인터리빙 패턴

Nemotron 3 Super의 88개 레이어는 세 종류 블록이 주기적으로 반복되는 구조다.

  • Mamba2 블록: 대부분을 차지한다. 지역적 시퀀스 패턴을 선형 복잡도로 처리한다
  • MoE 레이어: Mamba2 블록 사이에 배치된다. LatentMoE 라우팅으로 용량을 확장한다
  • 전역 어텐션 앵커: 소수의 레이어. 전체 시퀀스에 걸친 장거리 의존성을 처리한다

전역 어텐션 레이어는 "앵커" 역할로 전략적으로 삽입돼, Mamba2의 선형 복잡도를 유지하면서도 Transformer의 전역 정보 접근 능력을 보완한다.

88개 레이어의 반복 패턴 (개략 표현)
Mamba2
#1
Mamba2
#2
MoE
#3
Mamba2
#4
Attn
앵커
Mamba2
#6
MoE
#7
Mamba2
#8
→ ···
Mamba2
O(L) 복잡도, 고정 상태 크기, KV 캐시 없음
MoE
LatentMoE 라우팅, 512 전문가 중 top-22 활성
Attn 앵커
전역 어텐션, 장거리 의존성 처리 (소수 레이어)
Nemotron 3 Super 레이어 구조: 주기적 Mamba2·MoE·어텐션 인터리빙

아키텍처 3: NVFP4 사전 학습

기존 방식 — 사후 양자화의 한계

표준 워크플로는 FP16/BF16으로 학습을 완료한 뒤 INT8, FP8, 또는 INT4로 변환한다. 사후 양자화는 원래 가중치가 고정밀도에서 최적화됐기 때문에, 4비트 수준에서는 전문가 라우팅 패턴이 흔들리거나 특정 레이어의 활성화 분포가 왜곡될 수 있다.

NVFP4 사전 학습의 구조

Nemotron 3 Super는 Nemotron 3 계열 최초로 첫 번째 그래디언트 업데이트부터 NVFP4 제약 안에서 학습됐다. 가중치가 4비트 표현의 한계를 직접 보정하는 방향으로 최적화된다.

구체적 적용 경계:

레이어 유형적용 정밀도이유
대부분의 선형 레이어NVFP4 (가중치·활성화·그래디언트)계산 효율 극대화
잠재 투영 레이어MXFP8라우팅 정밀도 보호
MTP 레이어BF16드래프트 안정성
QKV·어텐션 투영BF16/MXFP8어텐션 수치 안정성
임베딩 레이어BF16토큰 표현 정밀도 보호

NVFP4는 NVIDIA Blackwell(B200/B100) GPU에서 가장 높은 성능을 낸다. Hopper(H100) 이하 환경에서는 FP8 체크포인트가 현실적 선택이다.


아키텍처 4: MTP를 통한 네이티브 투기적 디코딩

전통적 투기적 디코딩의 부담

투기적 디코딩은 소형 드래프트 모델이 다음 N개 토큰을 먼저 생성하고, 대형 타깃 모델이 이를 한 번에 검증하는 방식이다. 출력 품질을 유지하면서 처리량을 높이지만, 드래프트 모델을 별도 메모리에 올리고 두 모델의 배포를 함께 관리해야 한다.

MTP 레이어: 아키텍처 내장 드래프터

Nemotron 3 Super는 MTP(Multi-Token Prediction) 레이어를 메인 아키텍처에 직접 내장했다. MTP 레이어는 현재 숨겨진 상태에서 다음 여러 토큰을 동시에 예측한다. 추론 시 이 예측이 드래프트 역할을 하고, 메인 포워드 패스가 검증한다.

실용적 의미:

  • 별도 드래프트 모델 불필요 → VRAM 절약, 배포 복잡도 감소
  • 드래프트와 검증이 같은 가중치 공간에서 이루어지므로 정렬이 더 좋다
  • 독립 학습된 오프셋 헤드 방식보다 긴 드래프트 길이에서 더 안정적이다 (MTP는 공동 학습됐기 때문)
  • MTP 레이어 자체가 학습 신호 품질도 향상시킨다 (다음 토큰 외에 n+1, n+2 토큰까지 예측하도록 훈련)

성능 벤치마크

벤치마크Nemotron 3 Super
MMLU-Pro83.73
LiveCodeBench v6 (2024-08 ~ 2025-05)78.69
LiveCodeBench v5 (2024-07 ~ 2024-12)81.19

12.7B 활성 파라미터 기준으로 비교하면, 완전한 70B 밀집 모델에 준하는 성능이다. NVIDIA는 agentic reasoning 벤치마크에서 오픈 소스 최상위급과 경쟁한다고 밝혔다.


배포 방법

NIM 마이크로서비스 (온프레미스)

docker run --gpus all --rm -p 8000:8000 \
  nvcr.io/nim/nvidia/nemotron-3-super-120b-a12b-fp8:latest

OpenAI 호환 API 엔드포인트를 제공한다. FP8 체크포인트 기준 4× H100 80GB 이상이 필요하다.

클라우드 API

  • build.nvidia.com: 공식 NVIDIA API 게이트웨이
  • Hugging Face Inference Endpoints
  • Together AI, Fireworks AI, DeepInfra, Modal, CoreWeave

사용 가능한 체크포인트

체크포인트권장 환경
NVIDIA-Nemotron-3-Super-120B-A12B-BF16정밀도 우선, A100/H100
NVIDIA-Nemotron-3-Super-120B-A12B-FP8성능/정밀도 균형, H100/B200
NVIDIA-Nemotron-3-Super-120B-A12B-GGUF (unsloth)CPU·저사양 로컬 환경

운영 판단 기준

이 모델이 적합한 경우

  • 오픈 소스 라이선스가 필요하면서 120B급 성능을 원할 때
  • 긴 컨텍스트(32K ~ 1M 토큰) 처리가 핵심인 에이전트 추론 워크로드
  • Blackwell/Hopper 인프라에서 NVFP4/FP8 네이티브 성능을 활용하려 할 때
  • 별도 드래프트 모델 없이 투기적 디코딩의 처리량 이점을 얻고 싶을 때

주의해야 할 경우

  • BF16 전체 모델은 4× A100 80GB 이상이 필요하다 — 가능하면 FP8 체크포인트 사용
  • Mamba2 아키텍처는 일부 추론 프레임워크에서 지원이 제한될 수 있다 — vLLM 0.24+, TensorRT-LLM 1.3+를 확인한다
  • GGUF 변환 후 MTP 레이어 동작은 커뮤니티 검증 중

Open Questions

  • 1M 토큰 컨텍스트에서 Mamba2 상태 크기의 실제 메모리 한계는 공개 문서화 전
  • 정확한 레이어별 Mamba2 vs 전역 어텐션 비율은 논문에서 "소수(small ratio)"로만 표현됨
  • GGUF 변환 후 MTP 투기적 디코딩 활성화 방법은 별도 검증 필요

References