Mistral Medium 3.5: 세 모델을 하나로 합치고 추론 강도를 요청별로 조정하는 128B 오픈 가중치 모델
왜 지금 봐야 하나
2026년 4월 29일 Mistral AI가 공개한 Mistral Medium 3.5는 단순한 성능 업그레이드가 아니다. Mistral이 오랫동안 유지해온 세 가지 전문 모델 체계를 단일 체크포인트로 통합했다는 점에서 모델 운영 패턴을 바꾸는 릴리스다.
이 시리즈에서 이미 다룬 Magistral(추론 전문)과 Devstral 2(에이전트 코딩 전문)는 Medium 3.5 출시와 함께 공식 퇴역했다. 요청 유형에 따라 세 API 엔드포인트를 분기 호출하던 프로덕션 파이프라인은 이제 하나의 엔드포인트로 단순해진다. 대신 모델 라우팅 결정을 요청별 파라미터(reasoning_effort)로 옮긴다.
이 변화가 중요한 이유는 비용 구조에 있다. 128B 밀집 모델(dense model)을 단일 배포로 유지하면서 추론 강도를 동적으로 조정하는 방식이, 세 모델을 각각 운영하는 것보다 컴퓨트 활용 효율이 높은지, 아니면 낮은지는 워크로드 분포에 따라 달라진다. 이 챕터에서 그 판단 기준을 정리한다.
모델 스펙 요약
| 항목 | 값 |
|---|---|
| 총 파라미터 | 128B (Dense, 전체 활성) |
| 디코더 레이어 수 | 88 |
| Hidden size | 12,288 |
| Attention heads | 96 (query) / 8 (KV, GQA) |
| Head dimension | 128 |
| 최대 컨텍스트 | 262,144 토큰 (256K) |
| 비전 인코더 | Pixtral 스타일, 처음부터 훈련 (가변 종횡비) |
| 기본 추론 경로 | off (CoT 없음) |
| 심층 추론 경로 | reasoning_effort="high" 로 활성화 |
| 투기적 디코딩 | EAGLE 드래프트 헤드 별도 제공 |
| 최소 자체 호스팅 | GPU 4장 |
| 라이선스 | Modified MIT |
| API 가격 | $1.50 / 1M 입력 토큰, $7.50 / 1M 출력 토큰 |
| 출시일 | 2026-04-29 |
아키텍처: Dense 128B와 GQA
Mixture-of-Experts가 아닌 Dense
Mistral의 이전 대형 모델들은 MoE(Mixture-of-Experts) 구조였다. Mistral Large 3(675B 전체, 41B 활성)나 Mixtral 8×22B가 대표적이다. Medium 3.5는 모든 128B 파라미터가 매 토큰마다 활성화되는 밀집 구조다.
밀집 구조의 운영 특성:
- 예측 가능한 메모리 점유: 전문가 라우팅 없이 VRAM 요구량이 일정하다.
- 낮은 배치 레이턴시: 소수 병렬 요청에서 MoE 대비 지연이 안정적이다.
- 단순한 분산 배치: 텐서 병렬(TP) 및 파이프라인 병렬(PP)만으로 4장 이상 GPU에 배치한다.
GQA(Grouped Query Attention)는 96개 쿼리 헤드를 8개 KV 헤드 그룹으로 묶어 KV 캐시 메모리를 줄인다. 긴 컨텍스트(256K)에서 KV 캐시가 지배적인 메모리 소비가 되는 환경에서 GQA는 처리량(throughput) 향상에 결정적이다.
토크나이저 → 임베딩
Pixtral 인코더 → 프로젝터
파라미터
head_dim=128 · hidden=12,288
직접 응답
(기본값)
중간 추론
심층 CoT
추론 경로
vLLM / SGLang
투기적 디코딩
저레이턴시
Pixtral 비전 인코더
Mistral은 비전 인코더를 범용 CLIP 계열에서 가져오지 않고 처음부터 훈련했다. 핵심 특성은 가변 종횡비와 가변 해상도 처리다. 고정 해상도 패치로 이미지를 강제 리사이징하는 방식은 문서, UI 스크린샷, 세로형 사진 등에서 정보 손실을 일으킨다. Pixtral 인코더는 입력 이미지의 원본 비율을 유지하며 패치를 배치한다.
멀티모달 프로젝터가 비주얼 패치 토큰을 LLM 임베딩 공간으로 변환한 뒤, 텍스트 토큰과 동일한 시퀀스로 병합되어 트랜스포머 스택에 입력된다.
핵심 기능: 요청별 추론 강도
세 모델 통합의 실질 의미
Medium 3.5 이전 Mistral의 실전 배포는 세 가지 모델을 상황에 따라 분기 호출하는 방식이었다.
| 역할 | 기존 모델 | API 엔드포인트 |
|---|---|---|
| 일반 지시 따르기 | Mistral Medium 3.1 | open-mistral-medium-3-1 |
| 복잡한 수학·추론 | Magistral | magistral-medium-2506 |
| 에이전트 코딩 | Devstral 2 | devstral-2 |
| 통합 이후 | Medium 3.5 하나 | mistral-medium-3.5 |
이 통합에서 중요한 것은 "하나의 모델이 세 가지를 잘한다"는 것이 아니라 라우팅 결정 자체를 없앤다는 점이다. 입력이 코딩 문제인지 수학 문제인지 일반 질의인지 분류해서 다른 엔드포인트로 보내는 로직을 유지할 필요가 없어진다.
reasoning_effort 파라미터
추론 강도는 API 요청 파라미터로 제어한다.
from mistralai import Mistral
client = Mistral(api_key="...")
# 기본값: 추론 경로 비활성 (직접 응답)
resp_fast = client.chat.complete(
model="mistral-medium-3.5",
messages=[{"role": "user", "content": "Python에서 리스트 정렬 방법은?"}],
)
# 심층 추론 활성화
resp_deep = client.chat.complete(
model="mistral-medium-3.5",
messages=[{"role": "user", "content": "n번째 피보나치 수를 O(log n)에 구하는 방법을 증명하라."}],
reasoning_effort="high", # "off" | "medium" | "high"
)추론 경로가 활성화되면 모델은 응답 전에 내부 사고 과정(Chain-of-Thought)을 생성한다. 출력 토큰 수가 늘어 API 비용이 증가하지만 복잡한 추론 정확도가 오른다. 기본값(off)에서는 사고 과정 없이 직접 응답을 생성한다.
reasoning_effort | 내부 CoT | 적합한 워크로드 |
|---|---|---|
"off" (기본값) | 없음 | 채팅, 코드 자동완성, 단순 분류 |
"medium" | 짧은 추론 | 다단계 SQL 작성, 리팩토링 |
"high" | 전체 추론 | 증명, 수학, 복잡한 에이전트 계획 |
EAGLE 투기적 디코딩 드래프트 헤드
Mistral은 Medium 3.5와 함께 Mistral-Medium-3.5-128B-EAGLE 드래프트 헤드를 별도 공개했다. 이는 EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency) 아키텍처의 투기적 디코딩 드래프터다.
투기적 디코딩의 구조:
- 드래프터(EAGLE 헤드): 다음 k개 토큰 초안을 빠르게 생성한다.
- 검증자(Medium 3.5 전체): 초안을 한 번에 검증하고 수락/수정한다.
단일 요청(낮은 동시성) 환경에서 EAGLE 헤드를 쓰면 수용된 초안 토큰만큼 GPU 연산을 줄여 출력 레이턴시를 줄일 수 있다. 높은 동시성 배치 서빙에서는 효과가 제한적이다.
벤치마크
| 벤치마크 | 점수 | 측정 대상 |
|---|---|---|
| SWE-bench Verified | 77.6% | 실제 GitHub 이슈 해결 (코딩 에이전트) |
| τ³-Telecom | 91.4% | 통신 도메인 전문 추론 |
SWE-bench Verified 77.6%는 이 시리즈에서 Devstral 2가 기록한 72.2%를 넘은 수치다. 에이전트 코딩 전문 모델이었던 Devstral 2를 통합 후에도 능가한다는 점에서 통합 비용이 성능 저하로 이어지지 않았음을 보여준다.
자체 호스팅 배포 고려사항
GPU 요구량
128B 밀집 모델을 bf16로 로드하면 약 256GB VRAM이 필요하다. H100/H200 80GB 4장이 최소 구성이다.
# vLLM 배포 예시 (H100 × 4)
vllm serve mistralai/Mistral-Medium-3.5-128B \
--tensor-parallel-size 4 \
--max-model-len 32768256K 전체 컨텍스트를 활용하려면 KV 캐시 메모리를 추가 확보해야 한다. GQA로 KV 헤드를 96개에서 8개로 줄였으므로, 동일 GPU 구성에서 더 긴 컨텍스트를 수용할 수 있다.
EAGLE 드래프트 헤드 추가 배포
EAGLE 헤드(Mistral-Medium-3.5-128B-EAGLE)는 추가 VRAM이 필요하다. SGLang에서 EAGLE을 지원하므로 투기적 디코딩 서빙이 가능하다.
API와 자체 호스팅 비교
| 항목 | Mistral API | 자체 호스팅 |
|---|---|---|
| 초기 비용 | 없음 | GPU 4장+ |
| 비용 구조 | 토큰당 과금 | 고정 인프라 비용 |
| 컨텍스트 한도 | API 정책 따름 | 자체 조정 가능 |
| 데이터 프라이버시 | 외부 전송 있음 | 완전 자체 처리 |
| 라이선스 | Modified MIT | Modified MIT |
Modified MIT 라이선스는 상업 사용을 허용하지만 일부 조건이 표준 MIT와 다르다. 도입 전 라이선스 원문 확인이 필요하다.
운영 결정 기준
Medium 3.5가 적합한 경우
- 코딩, 추론, 비전 태스크가 혼합된 프로덕션 파이프라인을 단일 엔드포인트로 단순화하고 싶을 때
- 기존 Magistral 또는 Devstral 2를 사용하고 있어 마이그레이션 검토 중일 때
- 오픈 가중치가 필요한 규정·데이터 프라이버시 요건이 있을 때
- 256K 컨텍스트가 필요한 긴 문서 처리 또는 대형 코드베이스 분석을 할 때
대안을 검토해야 하는 경우
- GPU가 4장 미만인 자체 호스팅 환경: 24B 이하 소형 모델이 현실적이다.
- 모든 요청이 단순 지시 수행이고 추론이 불필요한 경우:
$1.50/M도 과잉 스펙일 수 있다. - 이미 MoE 아키텍처(Mistral Large 3 등)로 높은 처리량을 달성하고 있는 경우: Dense 128B는 단일 요청 레이턴시는 낮지만 MoE 대비 서빙 효율이 낮을 수 있다.
Open question
reasoning_effort="medium"의 CoT 깊이가 얼마나 되는지 공식 스펙이 없다. 워크로드에 따라 직접 측정해야 한다.- EAGLE 드래프트 헤드의 수락률(acceptance rate)이 도메인별로 얼마나 다른지 공식 벤치마크가 없다.
- Modified MIT 라이선스의 구체적 조건(특히 재배포 및 파인튜닝 모델 공개 요건)이 표준 MIT와 어떻게 다른지 법률 검토가 필요하다.
References
- Remote agents in Vibe. Powered by Mistral Medium 3.5. — Mistral AI
- Mistral Medium 3.5 on HuggingFace — mistralai/Mistral-Medium-3.5-128B
- Mistral Medium 3.5 EAGLE Draft Head — mistralai/Mistral-Medium-3.5-128B-EAGLE
- Mistral Medium 3.5 on NVIDIA NIM — build.nvidia.com
- Mistral Medium 3.5 SGLang Cookbook — lmsysorg.mintlify.app
- Mistral Medium 3.5: 128B Open-Weight Model Replaces Devstral 2 and Magistral — Let's Data Science
- Mistral Medium 3.5: One Model, Three Jobs, Half the Price — Build Fast With AI