왜 Puzzle이 주목받는가
대규모 언어 모델의 훈련 비용은 내려가고 있지만 추론 비용은 여전히 높다. 120B짜리 MoE 모델이 아무리 정확해도 서빙 하드웨어 비용이 감당하기 어렵다면 실제 배포에는 한계가 있다. NVIDIA는 이 문제를 정면에서 다루기 위해 Iterative Puzzle이라는 압축 방법론을 공개하고, 이를 적용한 Nemotron-Labs-3-Puzzle-75B-A9B를 2026년 7월 9일 arXiv에 발표했다(2607.04371).
결과는 단순하다. 120.7B → 75.3B 총 파라미터, 12.8B → 9.3B 활성 파라미터. 8xB200 노드에서 2.03배 높은 서버 처리량, 단일 H100에서 100만 토큰 컨텍스트 동시 처리 요청 수 1 → 8로 증가했다. 무게(weight) 크기도 70GB → 44.5GB(BF16 기준)로 줄었다.
이 챕터는 arXiv:2607.04371(2026-07-09 공개)과 Hugging Face 모델 카드를 기준으로 한다. 특별한 언급이 없으면 FP8 기준 수치이며 하드웨어와 서빙 설정에 따라 달라질 수 있다.
부모 모델: Nemotron-3-Super-120B-A12B
Puzzle-75B를 이해하려면 부모 모델의 구조를 먼저 알아야 한다. Nemotron-3-Super는 NVIDIA의 하이브리드 MoE+Mamba 아키텍처다.
- 총 파라미터: 120.7B, 활성 파라미터: 12.8B (토큰당)
- 블록 구성: 88블록 — Mamba 블록 40개, MoE 블록 40개, 어텐션 블록 8개
- 핵심 특성: Mamba는 시퀀스 길이에 선형으로 확장되는 상태 공간 모델(SSM)이다. 어텐션과 달리 긴 컨텍스트에서도 KV 캐시가 늘지 않는다
이 아키텍처 자체는 이미 효율적이다. 활성 파라미터가 12.8B뿐이어서 같은 크기의 일반 모델보다 토큰당 연산이 훨씬 적다. Puzzle의 목적은 이 위에서 한 번 더 압축하는 것이다.
Iterative Puzzle: 반복 압축 방법론
기존 모델 압축의 두 가지 주류 접근법은 서로 트레이드오프가 있다.
- 단일 단계 가지치기(One-shot pruning): 한 번에 목표 크기까지 구조를 잘라낸다. 빠르지만 품질 손실이 크다.
- 지식 증류(Knowledge Distillation, KD): 교사 모델의 출력을 학생 모델이 모방하도록 훈련한다. 품질이 좋지만 대형 모델에서는 연산 비용이 크다.
Iterative Puzzle은 두 접근을 교대로 반복한다. 압축 라운드마다 제한된 가지치기를 수행한 뒤 짧은 지식 증류로 품질을 회복하고, 목표 크기에 도달할 때까지 반복한다. 내부 ablation 실험에서 단일 단계 압축 대비 평균 0.57점 더 높은 벤치마크 점수를 보였다.
압축의 핵심: 무엇을 잘라내나
MoE 블록과 Mamba 블록은 압축 전략이 다르다.
MoE 전문가 가지치기: MoE 레이어는 여러 전문가(expert) MLP 중 일부만 활성화된다. 라우터가 선택하지 않는 전문가는 훈련 효과가 낮다. Iterative Puzzle은 활성화 빈도와 기여도를 기준으로 덜 중요한 전문가를 제거한다. 전문가 수가 줄어도 라우팅 패턴과 88블록 구조는 그대로 유지된다.
Mamba 상태 병합: Mamba 상태 공간 모델은 숨김 상태(hidden state) 벡터를 관리한다. 유사한 상태를 합치면 Mamba 레이어 내부 차원이 줄어든다. 시퀀스 길이에 무관한 고정 메모리라는 장점은 그대로 보존된다.
파라미터 수보다 활성 파라미터 수가 중요한 이유
전체 파라미터(75.3B)보다 활성 파라미터(9.3B)가 더 중요하다. 토큰 하나를 생성할 때 실제로 연산에 참여하는 파라미터 수가 9.3B이기 때문이다. 연산량, 메모리 대역폭 사용량, 배치 처리 효율 모두 활성 파라미터에 비례한다.
| 지표 | Nemotron-3-Super | Puzzle-75B-A9B |
|---|---|---|
| 총 파라미터 | 120.7B | 75.3B |
| 활성 파라미터 | 12.8B | 9.3B |
| 무게 크기(BF16) | 70GB | 44.5GB |
| 8xB200 서버 처리량 | 기준 | 2.03× |
| 단일 H100 1M 컨텍스트 동시 요청 | 1 | 8 |
| MMLU-Pro (FP8) | ~82+ | 82.0 |
| 10개 벤치마크 평균 | 68.48 | 69.05 |
| Arena-Hard-V2 | 기준 | -4.2 |
| SWE-Bench | 기준 | -2.6 |
흥미로운 점은 10개 평균에서 압축된 모델이 부모보다 0.57점 높다는 것이다. KD 복구 단계와 RL 미세조정이 일부 벤치마크에서 오히려 품질을 끌어올렸다. 반면 Arena-Hard-V2(-4.2)와 SWE-Bench(-2.6)에서는 소폭 하락이 있다. 대화 품질과 코딩 능력을 중시하는 서비스라면 배포 전 자체 평가가 필요하다.
하이브리드 MoE+Mamba 아키텍처의 운영 특성
어텐션만 있는 모델과 운영 방식이 다르다.
KV 캐시 구조: 어텐션 블록 8개만 KV 캐시를 사용한다. Mamba 40개 블록은 고정 크기 상태를 유지하므로, 긴 컨텍스트에서도 메모리 요구량이 선형으로 증가하지 않는다. 단일 H100에서 1M 토큰 컨텍스트를 8개 동시에 처리할 수 있는 이유다.
배치 효율: 어텐션 블록 비중이 낮아서 Mamba 커널과 MoE 라우팅 커널이 더 많은 비중을 차지한다. TensorRT-LLM, vLLM, SGLang 등 서빙 프레임워크가 Mamba+MoE 하이브리드 아키텍처를 실제로 지원하는지 배포 전에 확인해야 한다.
양자화 선택지: NVFP4는 NVIDIA Blackwell(B200) 이상에서 지원된다. H100 환경이라면 FP8, A100 환경이라면 BF16이 실용적인 선택이다.
도입 전 확인사항
정리
Nemotron-Labs-3-Puzzle-75B-A9B의 의미는 두 가지다.
첫째, Iterative Puzzle 방법론의 검증. 한 번에 크게 자르는 대신 압축과 회복을 반복한다는 아이디어가 평균 0.57점 품질 향상으로 이어졌다. 향후 다른 대형 모델에도 같은 방법론이 적용될 가능성이 높다.
둘째, 하이브리드 MoE+Mamba가 장거리 배포에 유리하다는 실증. 1M 토큰 동시 처리 수 1 → 8은 RAG, 장문 문서 분석, 코드 리뷰 등 긴 컨텍스트 서빙에서 비용 구조를 바꿀 수 있다.
운영자의 핵심 판단 기준은 단순하다. "Nemotron-3-Super 대비 같은 품질을 절반 비용으로 낼 수 있는가?" 대부분의 작업에서 답은 "예"다. 단, 대화 품질과 코딩 작업에서의 소폭 하락과 서빙 프레임워크의 Mamba 지원 여부는 배포 전에 반드시 확인해야 한다.
References
- Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs — arXiv:2607.04371 (2026-07-09)
- NVIDIA Releases Nemotron-Labs-3-Puzzle-75B-A9B — Remio.ai (2026-07-09)
- Meet Nemotron Labs 3 Puzzle 75B A9B — MarkTechPost (2026-07-09)
- nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 — Hugging Face
- nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-FP8 — Hugging Face
- nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 — Hugging Face