LLM WikiAccess-protected knowledge portal

WIKI

Nemotron 3 Super 120B: LatentMoE·Mamba2 하이브리드·NVFP4 사전 학습으로 12B 활성 파라미터에서 120B 성능을 내는 방법

왜 지금 봐야 하나 2026년 4월, NVIDIA가 Nemotron 3 Super를 공개했다. 외형적 숫자는 120.6B 파라미터지만, 추론 시 포워드 패스당 활성화되는 파라미터는 12.7B에 불과하다. 구조적 설계 세 가지가 이 효율을 가능하게 한다. 첫째, NVFP4 사전 학습 양자화를 사후에 적용하는 대신, 첫 번째 그래디언트 업데이트부터 4비트 산술 제약 안에서 모델을 학습시켰다. 모델이 4비트 표현의 오차를 학습 과정

경로human/study/content/ai-frontier/59-nemotron-3-super-120b-latentmoe-mamba2-nvfp4.md
카테고리Study
태그#120b #latentmoe #mamba2 #nvfp4 #security #study #super

왜 지금 봐야 하나

2026년 4월, NVIDIA가 Nemotron 3 Super를 공개했다. 외형적 숫자는 120.6B 파라미터지만, 추론 시 포워드 패스당 활성화되는 파라미터는 12.7B에 불과하다. 구조적 설계 세 가지가 이 효율을 가능하게 한다.

첫째, NVFP4 사전 학습: 양자화를 사후에 적용하는 대신, 첫 번째 그래디언트 업데이트부터 4비트 산술 제약 안에서 모델을 학습시켰다. 모델이 4비트 표현의 오차를 학습 과정에서 직접 보정한다.

둘째, 별도 드래프트 모델 없는 투기적 디코딩: MTP(Multi-Token Prediction) 레이어를 아키텍처 내부에 내장해, 외부 드래프트 모델 없이도 투기적 디코딩의 처리량 이점을 얻는다. VRAM 절약과 운영 단순화 모두 얻는다.

셋째, Mamba2-Transformer 하이브리드 MoE: 대부분의 레이어가 Mamba2 State Space Model로 처리되고, 전역 어텐션은 전략적으로 배치된 소수의 "앵커" 레이어에만 집중된다. 시퀀스 길이에 대한 선형 복잡도로 최대 1M 토큰 컨텍스트를 처리한다.

이 글은 세 가지 아키텍처 설계의 작동 방식, NVFP4 학습 경계, 투기적 디코딩 구조, 배포 기준을 다룬다.


모델 스펙 요약

항목
총 파라미터120.6B
포워드 패스당 활성 파라미터12.7B (임베딩 제외 12.1B)
레이어 수88
모델 차원(d\_model)4096
레이어당 전문가 수512 (top-22 활성)
MoE 라우팅 잠재 차원1024
최대 컨텍스트 길이1M 토큰
사전 학습 양자화NVFP4 (대부분 선형 레이어)
공개2026-04-15 (arXiv 2604.12374)
라이선스NVIDIA Open Model License

아키텍처 1: LatentMoE — 압축된 잠재 공간에서 전문가를 선택한다

기존 MoE 라우팅의 비용

표준 MoE 아키텍처는 d\_model 차원(이 모델의 경우 4096) 전체 벡터를 보고 전문가 게이팅 결정을 내린다. 512개 전문가 중 상위 22개를 선택해야 하므로, 게이팅 네트워크 자체가 적지 않은 계산과 메모리 접근 비용을 차지한다.

LatentMoE의 접근

LatentMoE는 게이팅 전에 토큰을 더 작은 잠재 차원(1024)으로 투영한다. 게이팅 네트워크는 4096 대신 1024 차원 벡터를 보고 22개 전문가를 선택한다. 실제 전문가 계산은 여전히 전체 차원에서 수행된다.

이 설계의 실질적 효과:

입력 토큰
d_model = 4096
잠재 투영
4096 → 1024
(BF16/MXFP8)
게이팅 네트워크
top-22 of 512
in 1024-dim space
↓ 선택된 22개 전문가
Expert #37
활성
Expert #89
활성
Expert #142
비활성
Expert #203
활성
… 490개 비활성
22개 전문가 결과 가중 합산 → 다음 레이어로
전문가 계산 자체는 d_model = 4096에서 수행
LatentMoE 라우팅: 압축 공간에서 전문가 선택 후 전체 차원 계산

아키텍처 2: Mamba2-Transformer 하이브리드 인터리빙

왜 Mamba2인가

표준 Transformer 셀프 어텐션의 시간·공간 복잡도는 시퀀스 길이 L에 대해 O(L²)다. 1M 토큰 컨텍스트에서 이것은 치명적이다. Mamba2(State Space Model, SSM)는 선형 복잡도 O(L)로 시퀀스를 처리하며, 추론 시 상태 크기가 고정되어 KV 캐시처럼 토큰 수에 비례해 메모리가 늘지 않는다.

하이브리드 인터리빙 패턴

Nemotron 3 Super의 88개 레이어는 세 종류 블록이 주기적으로 반복되는 구조다.

전역 어텐션 레이어는 "앵커" 역할로 전략적으로 삽입돼, Mamba2의 선형 복잡도를 유지하면서도 Transformer의 전역 정보 접근 능력을 보완한다.

88개 레이어의 반복 패턴 (개략 표현)
Mamba2
#1
Mamba2
#2
MoE
#3
Mamba2
#4
Attn
앵커
Mamba2
#6
MoE
#7
Mamba2
#8
→ ···
Mamba2
O(L) 복잡도, 고정 상태 크기, KV 캐시 없음
MoE
LatentMoE 라우팅, 512 전문가 중 top-22 활성
Attn 앵커
전역 어텐션, 장거리 의존성 처리 (소수 레이어)
Nemotron 3 Super 레이어 구조: 주기적 Mamba2·MoE·어텐션 인터리빙

아키텍처 3: NVFP4 사전 학습

기존 방식 — 사후 양자화의 한계

표준 워크플로는 FP16/BF16으로 학습을 완료한 뒤 INT8, FP8, 또는 INT4로 변환한다. 사후 양자화는 원래 가중치가 고정밀도에서 최적화됐기 때문에, 4비트 수준에서는 전문가 라우팅 패턴이 흔들리거나 특정 레이어의 활성화 분포가 왜곡될 수 있다.

NVFP4 사전 학습의 구조

Nemotron 3 Super는 Nemotron 3 계열 최초로 첫 번째 그래디언트 업데이트부터 NVFP4 제약 안에서 학습됐다. 가중치가 4비트 표현의 한계를 직접 보정하는 방향으로 최적화된다.

구체적 적용 경계:

레이어 유형적용 정밀도이유
대부분의 선형 레이어NVFP4 (가중치·활성화·그래디언트)계산 효율 극대화
잠재 투영 레이어MXFP8라우팅 정밀도 보호
MTP 레이어BF16드래프트 안정성
QKV·어텐션 투영BF16/MXFP8어텐션 수치 안정성
임베딩 레이어BF16토큰 표현 정밀도 보호

NVFP4는 NVIDIA Blackwell(B200/B100) GPU에서 가장 높은 성능을 낸다. Hopper(H100) 이하 환경에서는 FP8 체크포인트가 현실적 선택이다.


아키텍처 4: MTP를 통한 네이티브 투기적 디코딩

전통적 투기적 디코딩의 부담

투기적 디코딩은 소형 드래프트 모델이 다음 N개 토큰을 먼저 생성하고, 대형 타깃 모델이 이를 한 번에 검증하는 방식이다. 출력 품질을 유지하면서 처리량을 높이지만, 드래프트 모델을 별도 메모리에 올리고 두 모델의 배포를 함께 관리해야 한다.

MTP 레이어: 아키텍처 내장 드래프터

Nemotron 3 Super는 MTP(Multi-Token Prediction) 레이어를 메인 아키텍처에 직접 내장했다. MTP 레이어는 현재 숨겨진 상태에서 다음 여러 토큰을 동시에 예측한다. 추론 시 이 예측이 드래프트 역할을 하고, 메인 포워드 패스가 검증한다.

실용적 의미:


성능 벤치마크

벤치마크Nemotron 3 Super
MMLU-Pro83.73
LiveCodeBench v6 (2024-08 ~ 2025-05)78.69
LiveCodeBench v5 (2024-07 ~ 2024-12)81.19

12.7B 활성 파라미터 기준으로 비교하면, 완전한 70B 밀집 모델에 준하는 성능이다. NVIDIA는 agentic reasoning 벤치마크에서 오픈 소스 최상위급과 경쟁한다고 밝혔다.


배포 방법

NIM 마이크로서비스 (온프레미스)

docker run --gpus all --rm -p 8000:8000 \
  nvcr.io/nim/nvidia/nemotron-3-super-120b-a12b-fp8:latest

OpenAI 호환 API 엔드포인트를 제공한다. FP8 체크포인트 기준 4× H100 80GB 이상이 필요하다.

클라우드 API

사용 가능한 체크포인트

체크포인트권장 환경
NVIDIA-Nemotron-3-Super-120B-A12B-BF16정밀도 우선, A100/H100
NVIDIA-Nemotron-3-Super-120B-A12B-FP8성능/정밀도 균형, H100/B200
NVIDIA-Nemotron-3-Super-120B-A12B-GGUF (unsloth)CPU·저사양 로컬 환경

운영 판단 기준

이 모델이 적합한 경우

주의해야 할 경우


Open Questions


References