LLM WikiAccess-protected knowledge portal

WIKI

MiniMax M3: MSA 희소 어텐션으로 1M 토큰 컨텍스트와 네이티브 멀티모달을 동시에 여는 방법

왜 지금 봐야 하나 LLM 추론에서 1M 토큰 컨텍스트는 기술적으로 가능하다고 알려져 있지만, 실제로 쓸 수 있는 상태로 배포하기는 전혀 다른 문제다. 어텐션 연산은 컨텍스트 길이에 대해 O n² 복잡도를 가지므로, 1M 토큰에서 단순 GQA Grouped Query Attention 로 추론하면 짧은 컨텍스트 대비 추론 비용이 수백 배로 늘어난다. 대부분의 오픈웨이트 모델이 "1M 컨텍스트 지원"을 주장하면서도 실제로 1M을

경로human/study/content/ai-frontier/53-minimax-m3-msa-sparse-attention-native-multimodal-moe.md
카테고리Study
태그#ai-review #attention #moe #multimodal #native #sparse #study

왜 지금 봐야 하나

LLM 추론에서 1M 토큰 컨텍스트는 기술적으로 가능하다고 알려져 있지만, 실제로 쓸 수 있는 상태로 배포하기는 전혀 다른 문제다. 어텐션 연산은 컨텍스트 길이에 대해 O(n²) 복잡도를 가지므로, 1M 토큰에서 단순 GQA(Grouped Query Attention)로 추론하면 짧은 컨텍스트 대비 추론 비용이 수백 배로 늘어난다. 대부분의 오픈웨이트 모델이 "1M 컨텍스트 지원"을 주장하면서도 실제로 1M을 활용하면 비실용적인 지연과 비용이 나타나는 이유다.

MiniMax는 2026년 6월 1일 MiniMax M3를 공개했다. 핵심 주장은 MSA(MiniMax Sparse Attention)라는 새로운 희소 어텐션 메커니즘으로 1M 토큰 컨텍스트에서 GQA 대비 어텐션 연산량을 28.4배 줄이면서 품질을 유지한다는 것이다. 동시에 텍스트·이미지·비디오를 처음 훈련 단계부터 하나의 분포에서 함께 학습하는 네이티브 멀티모달 설계를 채택했다. 428B 파라미터 오픈웨이트 MoE 모델로, arXiv:2606.13392에 MSA의 기술 보고서가 공개되어 있다.

이 글은 MSA가 어떻게 희소 어텐션을 구현하는지, 네이티브 멀티모달 훈련이 어댑터 기반 접근과 어떻게 다른지, 그리고 실제 운영에서 고려해야 할 경계를 다룬다.


MSA 아키텍처: 블록 단위 희소 선택

MiniMax M3 MSA vs 전체 GQA: 1M 토큰 어텐션 경로 비교 기존 GQA (Full Attention) O(n²) 복잡도 — 1M 토큰에서 비실용 Query (Q) 현재 토큰의 쿼리 벡터 KV Cache (전체, 1M 토큰) ■ 블록 0 ■ 블록 1 ■ 블록 2 ■ 블록 3 ■ 블록 4 ■ 블록 5 ■ … ■ 블록 N 모든 N개 블록에 어텐션 계산 Attention(Q, K_all, V_all) N개 블록 × softmax 전체 계산 비용 1M 토큰: GQA 전체 = 기준 1× Prefill 속도: 기준 1× (H800 기준) MSA (MiniMax Sparse Attention) 28.4× 어텐션 연산 감소 — 1M 토큰에서 실용 Query (Q) 현재 토큰의 쿼리 벡터 Index Branch (경량 채점 모듈) • KV 블록 각각에 점수 부여 • GQA 그룹별 독립적으로 Top-k 블록 선택 • 전체 KV 크기의 일부만 선택 → k/N 비율 KV Cache (선택 블록만) ✓ 블록 0 ✓ 블록 2 ✓ 블록 5 ✓ 블록 7 k개 블록 (k ≪ N) — 관련 블록만 Index Branch가 선택한 블록만 로드 KV outer gather Q 실행 방식 1. KV 블록이 외부 루프 (블록당 1회 로드) 2. 각 블록에 해당하는 Q를 내부에서 집계 3. 메모리 접근이 연속적 → 캐시 친화적 4. flash-moba 대비 4×+ arithmetic intensity 향상 Attention(Q, K_sel, V_sel) k개 선택 블록 × softmax MSA 성능 결과 (109B 모델, H800 기준, 1M 토큰) 어텐션 연산량 GQA 전체 대비 28.4× 감소 품질(perplexity/recall)은 동등 유지 Wall-Clock 속도 Prefill: 14.2× 빠름 Decoding: 7.6× 빠름
MiniMax M3 MSA 아키텍처: 전체 GQA 대비 블록 선택 기반 희소 어텐션의 동작 방식

MSA의 핵심 메커니즘

표준 GQA는 현재 토큰의 Query를 전체 KV Cache에 대해 어텐션을 계산한다. 컨텍스트 길이 n이 늘어날수록 O(n²) 계산이 발생한다.

MSA는 이 경로 앞에 Index Branch라는 경량 채점 모듈을 추가한다. Index Branch는 KV Cache를 블록 단위로 분할하고, 각 블록에 현재 Query와의 관련성 점수를 매긴다. 이 점수를 기준으로 GQA 그룹별로 상위 k개 블록만 선택한다.

선택된 블록에 대해서만 어텐션을 계산하는 방식이 KV outer gather Q다. KV 블록이 외부 루프가 되어 각 블록은 단 한 번만 메모리에서 로드된다. 선택된 블록에 해당하는 Query만 내부에서 집계하므로, 메모리 접근 패턴이 연속적이고 캐시 친화적이 된다. open-source Flash-Sparse-Attention과 flash-moba 대비 arithmetic intensity가 4배 이상 높다.

1M 토큰 컨텍스트에서 109B 파라미터 모델로 측정한 결과, MSA는 GQA 대비 어텐션 연산량을 28.4배 줄이면서 perplexity와 장문 recall 지표를 GQA와 동등하게 유지했다. H800에서 wall-clock prefill은 14.2배, decoding은 7.6배 빠르다.

MSA 구현 커널은 오픈소스로 공개되어 있다. https://github.com/MiniMax-AI/MSA


MiniMax M3 모델 아키텍처

MoE 구성

MiniMax M3는 428B 총 파라미터를 가진 Mixture-of-Experts 모델이다. 토큰당 활성화되는 파라미터는 약 23B다. 전문가 구성은 128개의 routed 전문가와 1개의 shared 전문가로 이루어지며, top-4 라우팅으로 각 토큰이 가장 관련성 높은 4개 전문가를 활성화한다.

Grouped Query Attention을 기본 어텐션 backbone으로 사용하고, 그 위에 MSA가 레이어로 추가된다. MSA는 모든 어텐션 레이어에 적용되는 것이 아니라, 컨텍스트 길이가 일정 임계를 넘을 때 활성화되도록 설계되어 있다. 짧은 컨텍스트에서는 GQA와 동일하게 동작한다.

네이티브 멀티모달 훈련

기존의 많은 멀티모달 LLM은 텍스트만으로 먼저 훈련한 뒤, 별도의 Vision Encoder와 Projection Head를 붙여 시각 정보를 연결하는 방식(어댑터 기반)을 택한다. 이 방식의 한계는 텍스트와 시각 표현이 서로 다른 잠재 공간에 존재한다는 점이다. Projection Head가 두 공간을 연결하지만, 세밀한 멀티모달 추론에서 오해가 발생하기 쉽다.

MiniMax M3는 텍스트, 이미지, 비디오 토큰을 처음 훈련 단계부터 하나의 분포에서 함께 학습했다. Vision Encoder는 ViT(Vision Transformer) 기반이다. 텍스트와 시각 표현이 처음부터 같은 임베딩 공간에서 학습되므로, 두 모달리티 사이의 잠재 공간 불일치가 줄어든다.

모델은 스크린샷 기반의 데스크톱 컴퓨터 사용 기능도 지원한다. 이 기능도 어댑터 없이 동일한 vision pathway에서 처리된다.

어댑터 기반 (기존)
텍스트 전용 사전훈련
↓ 이후 단계
Vision Encoder 추가
Projection Head (어댑터)
멀티모달 파인튜닝
⚠ 텍스트·시각 표현이 별도 잠재 공간에 존재
네이티브 멀티모달 (MiniMax M3)
텍스트 + 이미지 + 비디오 동시 훈련 (Step 0)
↓ 동일 분포에서
공유 임베딩 공간 학습
어댑터 없이 멀티모달 추론
✓ 텍스트·시각 표현이 동일 잠재 공간에 정렬
멀티모달 훈련 비교: 어댑터 기반 vs 네이티브 (step-zero)

벤치마크 성능

MiniMax가 공개한 주요 벤치마크 결과는 다음과 같다.

벤치마크MiniMax M3비고
SWE-bench Verified80.5%오픈웨이트 중 최고 수준 (2026-06 기준)
Terminal-Bench 2.166.0%Claude Sonnet 4.6 수준
SWE-bench Pro59.0%GPT-5.5·Gemini 3.1 Pro 상회

이 수치들은 에이전틱 코딩 벤치마크로, 실제 코드 수정·실행·검증 루프를 포함한다. 장문 컨텍스트가 에이전트 성능에 기여하는 구체적인 경로를 보여준다. 코드베이스 전체를 컨텍스트에 올려놓고 실행 결과를 함께 추론하는 작업에서 1M 컨텍스트가 실질적인 차이를 만든다.


운영 고려사항

로컬 실행의 현실

428B 파라미터 모델은 FP16 기준 약 856GB VRAM을 요구한다. 8×H100(640GB)으로도 부족하다. 실제 로컬 배포는 BF16/INT8 혼합 양자화를 적용하더라도 최소 8×H100 이상이 필요하다. 대부분의 팀에게는 API 접근이 현실적인 경로다.

MiniMax 자체 API, NVIDIA NGC 모델 카드, Fireworks AI 등 몇 가지 접근 경로가 공개되어 있다.

MSA 커널의 독립적 활용

MSA 커널(https://github.com/MiniMax-AI/MSA)은 M3 모델 가중치와 분리된 독립 구현이다. 기존 GQA 기반 모델에 MSA를 적용해 장문 컨텍스트 추론 비용을 줄이는 용도로 활용할 수 있다. 단, 모델이 MSA 패턴으로 훈련되지 않은 경우 품질 손실이 발생할 수 있다는 점을 검증해야 한다.

Open question


References