LLM WikiAccess-protected knowledge portal

WIKI

Mistral Medium 3.5: 세 모델을 하나로 합치고 추론 강도를 요청별로 조정하는 128B 오픈 가중치 모델

왜 지금 봐야 하나 2026년 4월 29일 Mistral AI가 공개한 Mistral Medium 3.5는 단순한 성능 업그레이드가 아니다. Mistral이 오랫동안 유지해온 세 가지 전문 모델 체계를 단일 체크포인트로 통합 했다는 점에서 모델 운영 패턴을 바꾸는 릴리스다. 이 시리즈에서 이미 다룬 Magistral 추론 전문 과 Devstral 2 에이전트 코딩 전문 는 Medium 3.5 출시와 함께 공식 퇴역했다. 요청

경로human/study/content/ai-frontier/63-mistral-medium-3-5-unified-reasoning-vision-coding.md
카테고리Study
태그#coding #medium #reasoning #study #unified #vision

왜 지금 봐야 하나

2026년 4월 29일 Mistral AI가 공개한 Mistral Medium 3.5는 단순한 성능 업그레이드가 아니다. Mistral이 오랫동안 유지해온 세 가지 전문 모델 체계를 단일 체크포인트로 통합했다는 점에서 모델 운영 패턴을 바꾸는 릴리스다.

이 시리즈에서 이미 다룬 Magistral(추론 전문)과 Devstral 2(에이전트 코딩 전문)는 Medium 3.5 출시와 함께 공식 퇴역했다. 요청 유형에 따라 세 API 엔드포인트를 분기 호출하던 프로덕션 파이프라인은 이제 하나의 엔드포인트로 단순해진다. 대신 모델 라우팅 결정을 요청별 파라미터(reasoning_effort)로 옮긴다.

이 변화가 중요한 이유는 비용 구조에 있다. 128B 밀집 모델(dense model)을 단일 배포로 유지하면서 추론 강도를 동적으로 조정하는 방식이, 세 모델을 각각 운영하는 것보다 컴퓨트 활용 효율이 높은지, 아니면 낮은지는 워크로드 분포에 따라 달라진다. 이 챕터에서 그 판단 기준을 정리한다.


모델 스펙 요약

항목
총 파라미터128B (Dense, 전체 활성)
디코더 레이어 수88
Hidden size12,288
Attention heads96 (query) / 8 (KV, GQA)
Head dimension128
최대 컨텍스트262,144 토큰 (256K)
비전 인코더Pixtral 스타일, 처음부터 훈련 (가변 종횡비)
기본 추론 경로off (CoT 없음)
심층 추론 경로reasoning_effort="high" 로 활성화
투기적 디코딩EAGLE 드래프트 헤드 별도 제공
최소 자체 호스팅GPU 4장
라이선스Modified MIT
API 가격$1.50 / 1M 입력 토큰, $7.50 / 1M 출력 토큰
출시일2026-04-29

아키텍처: Dense 128B와 GQA

Mixture-of-Experts가 아닌 Dense

Mistral의 이전 대형 모델들은 MoE(Mixture-of-Experts) 구조였다. Mistral Large 3(675B 전체, 41B 활성)나 Mixtral 8×22B가 대표적이다. Medium 3.5는 모든 128B 파라미터가 매 토큰마다 활성화되는 밀집 구조다.

밀집 구조의 운영 특성:

GQA(Grouped Query Attention)는 96개 쿼리 헤드를 8개 KV 헤드 그룹으로 묶어 KV 캐시 메모리를 줄인다. 긴 컨텍스트(256K)에서 KV 캐시가 지배적인 메모리 소비가 되는 환경에서 GQA는 처리량(throughput) 향상에 결정적이다.

입력
텍스트 토큰
토크나이저 → 임베딩
이미지
Pixtral 인코더 → 프로젝터
reasoning_effort
파라미터
Dense Transformer (88 layers)
GQA: 96 query heads / 8 KV heads
head_dim=128 · hidden=12,288
off
직접 응답
(기본값)
medium
중간 추론
high
심층 CoT
추론 경로
서빙 옵션
표준 서빙
vLLM / SGLang
EAGLE 드래프트 헤드
투기적 디코딩
저레이턴시
KV 캐시: GQA로 12배 감소 (96→8 heads) · 256K 컨텍스트에서 VRAM 절감 효과 극대화
Mistral Medium 3.5 아키텍처 개요

Pixtral 비전 인코더

Mistral은 비전 인코더를 범용 CLIP 계열에서 가져오지 않고 처음부터 훈련했다. 핵심 특성은 가변 종횡비와 가변 해상도 처리다. 고정 해상도 패치로 이미지를 강제 리사이징하는 방식은 문서, UI 스크린샷, 세로형 사진 등에서 정보 손실을 일으킨다. Pixtral 인코더는 입력 이미지의 원본 비율을 유지하며 패치를 배치한다.

멀티모달 프로젝터가 비주얼 패치 토큰을 LLM 임베딩 공간으로 변환한 뒤, 텍스트 토큰과 동일한 시퀀스로 병합되어 트랜스포머 스택에 입력된다.


핵심 기능: 요청별 추론 강도

세 모델 통합의 실질 의미

Medium 3.5 이전 Mistral의 실전 배포는 세 가지 모델을 상황에 따라 분기 호출하는 방식이었다.

역할기존 모델API 엔드포인트
일반 지시 따르기Mistral Medium 3.1open-mistral-medium-3-1
복잡한 수학·추론Magistralmagistral-medium-2506
에이전트 코딩Devstral 2devstral-2
통합 이후Medium 3.5 하나mistral-medium-3.5

이 통합에서 중요한 것은 "하나의 모델이 세 가지를 잘한다"는 것이 아니라 라우팅 결정 자체를 없앤다는 점이다. 입력이 코딩 문제인지 수학 문제인지 일반 질의인지 분류해서 다른 엔드포인트로 보내는 로직을 유지할 필요가 없어진다.

reasoning_effort 파라미터

추론 강도는 API 요청 파라미터로 제어한다.

from mistralai import Mistral

client = Mistral(api_key="...")

# 기본값: 추론 경로 비활성 (직접 응답)
resp_fast = client.chat.complete(
    model="mistral-medium-3.5",
    messages=[{"role": "user", "content": "Python에서 리스트 정렬 방법은?"}],
)

# 심층 추론 활성화
resp_deep = client.chat.complete(
    model="mistral-medium-3.5",
    messages=[{"role": "user", "content": "n번째 피보나치 수를 O(log n)에 구하는 방법을 증명하라."}],
    reasoning_effort="high",  # "off" | "medium" | "high"
)

추론 경로가 활성화되면 모델은 응답 전에 내부 사고 과정(Chain-of-Thought)을 생성한다. 출력 토큰 수가 늘어 API 비용이 증가하지만 복잡한 추론 정확도가 오른다. 기본값(off)에서는 사고 과정 없이 직접 응답을 생성한다.

reasoning_effort내부 CoT적합한 워크로드
"off" (기본값)없음채팅, 코드 자동완성, 단순 분류
"medium"짧은 추론다단계 SQL 작성, 리팩토링
"high"전체 추론증명, 수학, 복잡한 에이전트 계획

EAGLE 투기적 디코딩 드래프트 헤드

Mistral은 Medium 3.5와 함께 Mistral-Medium-3.5-128B-EAGLE 드래프트 헤드를 별도 공개했다. 이는 EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency) 아키텍처의 투기적 디코딩 드래프터다.

투기적 디코딩의 구조:

단일 요청(낮은 동시성) 환경에서 EAGLE 헤드를 쓰면 수용된 초안 토큰만큼 GPU 연산을 줄여 출력 레이턴시를 줄일 수 있다. 높은 동시성 배치 서빙에서는 효과가 제한적이다.


벤치마크

벤치마크점수측정 대상
SWE-bench Verified77.6%실제 GitHub 이슈 해결 (코딩 에이전트)
τ³-Telecom91.4%통신 도메인 전문 추론

SWE-bench Verified 77.6%는 이 시리즈에서 Devstral 2가 기록한 72.2%를 넘은 수치다. 에이전트 코딩 전문 모델이었던 Devstral 2를 통합 후에도 능가한다는 점에서 통합 비용이 성능 저하로 이어지지 않았음을 보여준다.


자체 호스팅 배포 고려사항

GPU 요구량

128B 밀집 모델을 bf16로 로드하면 약 256GB VRAM이 필요하다. H100/H200 80GB 4장이 최소 구성이다.

# vLLM 배포 예시 (H100 × 4)
vllm serve mistralai/Mistral-Medium-3.5-128B \
  --tensor-parallel-size 4 \
  --max-model-len 32768

256K 전체 컨텍스트를 활용하려면 KV 캐시 메모리를 추가 확보해야 한다. GQA로 KV 헤드를 96개에서 8개로 줄였으므로, 동일 GPU 구성에서 더 긴 컨텍스트를 수용할 수 있다.

EAGLE 드래프트 헤드 추가 배포

EAGLE 헤드(Mistral-Medium-3.5-128B-EAGLE)는 추가 VRAM이 필요하다. SGLang에서 EAGLE을 지원하므로 투기적 디코딩 서빙이 가능하다.

API와 자체 호스팅 비교

항목Mistral API자체 호스팅
초기 비용없음GPU 4장+
비용 구조토큰당 과금고정 인프라 비용
컨텍스트 한도API 정책 따름자체 조정 가능
데이터 프라이버시외부 전송 있음완전 자체 처리
라이선스Modified MITModified MIT

Modified MIT 라이선스는 상업 사용을 허용하지만 일부 조건이 표준 MIT와 다르다. 도입 전 라이선스 원문 확인이 필요하다.


운영 결정 기준

Medium 3.5가 적합한 경우

대안을 검토해야 하는 경우


Open question


References