LLM WikiAccess-protected knowledge portal
← 스터디 홈
56편 · 약 17분

Claude Opus 5: Frontier-Bench를 다시 쓴 Opus — effort 사다리·mid-conversation 도구 변경·마이그레이션 체크리스트

왜 지금 봐야 하나

2026년 7월 24일 Anthropic이 Claude Opus 5를 출시했다. 출시 직후 눈에 띈 숫자가 있다. 에이전트 코딩 벤치마크인 Frontier-Bench v0.1에서 Opus 5는 43.3%를 기록했다. 같은 벤치마크에서 Claude Fable 5(Mythos급)의 점수는 33.7%이고 Opus 4.8은 18.7%다. Anthropic의 플래그십 모델인 Fable 5보다 에이전트 코딩에서 높은 점수를 낸 모델이, Fable 5 가격의 절반에 출시됐다.

이것이 실용적으로 의미하는 바는 분명하다. 에이전트 코딩 루프와 장기 실행 작업에서 Fable 5를 선택할 근거가 상당 부분 사라졌다. 대신 Opus 5를 쓰면서 비용을 절반으로 줄이거나, 절약한 예산으로 더 많은 요청을 처리할 수 있다.

하지만 Opus 4.8에서 Opus 5로의 전환은 단순히 모델 ID를 바꾸는 일이 아니다. 사고(thinking)가 기본 활성화되고, effort xhigh 또는 max에서 thinking을 끄면 400 에러가 반환되는 등 코드를 깨뜨릴 수 있는 변화가 둘 있다. 그리고 새로운 기능 세 가지(mid-conversation 도구 변경, 기본 폴백 모드, 캐시 최소 길이 축소)도 확인해야 한다.

이 글은 Opus 5가 무엇을 바꿨는지, 어떤 코드가 깨지는지, 어떻게 마이그레이션하는지를 다룬다.


Claude Opus 5의 위치: 모델 패밀리 안에서

Anthropic의 현재 모델 라인업을 짚고 시작한다.

모델API 모델 ID가격 (입력/출력 per MTok)컨텍스트포지셔닝
Claude Fable 5claude-fable-5$10 / $501M최고 지능, 사이버보안
Claude Opus 5claude-opus-5$5 / $251M에이전트 코딩, 일상 작업
Claude Sonnet 5claude-sonnet-5$3 / $151M균형형
Claude Haiku 4.5claude-haiku-4-5-20251001$0.80 / $4200K고빈도 저지연

Opus 5는 Fable 5의 절반 가격에 에이전트 코딩에서 Fable 5를 능가한다. 포지셔닝 문서에서 Anthropic은 이 모델을 "일상 워크호스(everyday workhorse)"라고 표현했다. 대부분의 아키텍처에서 Fable 5를 쓰던 자리에 Opus 5를 넣는 것이 기본 선택이 된다. Fable 5는 사이버보안 태스크나 Mythos급 지능이 요구되는 특수 케이스에 남는다.

Claude 모델 포지셔닝: Frontier-Bench 점수 vs API 가격 API 가격 (출력 per MTok, USD) Frontier-Bench v0.1 (%) 10% 30% 45% $4 $15 $25 $50 Haiku 4.5 ~3% Sonnet 5 ~18% Opus 4.8 18.7% Fable 5 (Mythos) 33.7% Opus 5 ★ NEW 43.3% 가격 절반 코딩 성능↑ 모델 가격 (출력/MTok) Opus 5: $25 Fable 5: $50 원 크기 ∝ 가격 규모 Y축: Frontier-Bench v0.1 (%)
Claude 모델 포지셔닝 맵: 가격 대비 에이전트 코딩 성능

새 기능 세 가지

1. Mid-conversation tool changes (베타)

기존에는 대화 세션 안에서 도구 목록을 변경하면 프롬프트 캐시가 깨졌다. 새 베타 헤더를 붙이면 캐시를 유지하면서 중간에 도구를 추가하거나 제거할 수 있다.

anthropic-beta: mid-conversation-tool-changes-2026-07-01

에이전트 루프에서 작업 단계에 따라 사용 가능한 도구를 동적으로 바꾸는 패턴에 유용하다. 초기 계획 단계에는 계획 도구만 노출하고, 실행 단계에서는 파일 시스템·코드 실행 도구를 추가하는 식이다. 도구 목록을 바꿀 때마다 전체 컨텍스트를 재전송하지 않아도 된다.

2. Default fallbacks mode (베타)

이전 베타(server-side-fallback-2026-06-01)는 폴백 모델 목록을 명시적으로 지정해야 했다. 새 헤더는 "default" 모드를 추가해 Anthropic의 권장 폴백 모델을 자동 적용한다.

anthropic-beta: server-side-fallback-2026-07-01

fallbacks: "default"를 파라미터로 넘기면 요청이 거부될 때 Anthropic이 관리하는 대체 모델로 자동 라우팅된다. 모델 목록을 직접 유지하지 않아도 된다.

3. 프롬프트 캐시 최소 길이 축소

Opus 4.8에서는 1,024 토큰 이상이어야 캐시 항목을 만들 수 있었다. Opus 5에서는 512 토큰으로 낮아졌다. 코드 변경 없이 더 짧은 시스템 프롬프트도 캐싱의 혜택을 받는다.


API 동작 변화: 코드를 깨뜨릴 수 있는 두 가지

변화 1: 사고(Thinking) 기본 활성화

Opus 4.8에서 사고는 명시적으로 켜야 했다.

# Opus 4.8: 사고를 명시적으로 활성화해야 함
thinking={"type": "adaptive"}

Opus 5에서는 사고가 기본 활성화다. thinking 필드를 설정하지 않아도 모델이 스스로 언제 얼마나 생각할지 결정한다.

이 변화가 코드를 깨뜨릴 수 있는 이유: max_tokens는 thinking 토큰과 응답 텍스트 토큰의 합에 대한 상한이다. Opus 4.8에서 사고 없이 사용하던 max_tokens 값을 그대로 쓰면 모델이 충분히 생각하거나 답할 공간이 부족해질 수 있다. Opus 4.8 코드를 그대로 Opus 5로 교체한다면 max_tokens를 재검토한다.

변화 2: thinking 비활성화 제약

Opus 5에서는 effortxhigh 또는 max인 상태에서 thinking: {"type": "disabled"}를 보내면 HTTP 400 에러가 반환된다. 이것은 하위 호환을 깨는 변화다.

# Opus 5에서 이 조합은 400 에러
{
    "model": "claude-opus-5",
    "output_config": {"effort": "xhigh"},
    "thinking": {"type": "disabled"}  # ← 400
}

해결 방법은 두 가지다:

  • thinking을 꺼야 한다면 → efforthigh 이하로 낮춘다.
  • xhigh/max effort를 유지해야 한다면 → thinking 필드를 제거한다(기본 활성화 유지).

Effort 사다리: 비용과 성능을 조율하는 핵심 레버

Opus 5는 effort 수준에 따른 차이가 이전 모델보다 크다. 낮은 effort에서도 품질이 충분히 나오고, 높은 effort로 올릴 때 성능 향상이 실질적이다. 기본값은 high다.

Opus 5 Effort 사다리: 수준별 동작과 추천 시나리오 low 최소 thinking 빠른 응답 최저 토큰 적합한 용도 분류, 라우팅 간단한 Q&A 포맷 변환 정형 데이터 추출 medium 중간 thinking 품질 균형 moderate 비용 적합한 용도 일상 편집·리팩터 요약, 번역 코드 리뷰 (소규모) 단순 데이터 분석 high (기본값) 충분한 thinking 높은 품질 균형잡힌 비용 적합한 용도 대부분 프로덕션 작업 멀티스텝 에이전트 복잡한 코드 생성 문서·분석 작업 xhigh 심화 thinking 높은 정확도 높은 토큰 소비 적합한 용도 멀티파일 리팩터 복잡 버그 분석 에이전트 코딩 루프 Claude Code 내부 max 무제한 thinking 최고 결과 가장 높은 비용 적합한 용도 오프라인 배치 추론 최고 품질 코드 생성 연구 분석 작업 예산 무관 태스크 ⚠ xhigh/max: thinking 비활성화 불가 thinking: disabled + xhigh/max → HTTP 400
Opus 5 effort 사다리: 수준별 동작과 적용 시나리오

output_config 파라미터로 effort를 설정한다:

# 에이전트 코딩 루프에는 xhigh 추천
response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,  # xhigh/max는 max_tokens를 크게 설정
    output_config={"effort": "xhigh"},
    messages=[...]
)

# 분류 작업에는 low로 절약
response = client.messages.create(
    model="claude-opus-5",
    max_tokens=2000,
    output_config={"effort": "low"},
    messages=[...]
)

모델 동작 변화: 코드를 바꾸지 않아도 영향받는 것들

Anthropic 공식 문서가 명시한 행동 변화다.

응답이 더 길어진다. 기본 응답과 문서 작성 결과물이 Opus 4.8보다 길다. 출력 토큰 예산을 기반으로 비용을 추정하고 있었다면 재산정이 필요하다.

자체 검증을 자동으로 수행한다. Opus 5는 명시적 지시 없이도 자기 작업을 확인한다. "최종 검증 단계를 포함하라", "서브에이전트로 검증하라"는 식의 프롬프트가 남아 있으면 이중 검증이 발생한다. Opus 4.8을 위해 추가한 검증 지시는 제거한다.

에이전트 세션에서 진행 상황을 더 자주 보고한다. 멀티에이전트 프레임워크에서 서브에이전트 위임이 더 빈번하게 일어난다. 이 행동이 예상치 못한 경우 시스템 프롬프트로 조정해야 할 수 있다.


벤치마크: 수치로 보는 위치

Anthropic이 공개한 주요 벤치마크 결과다.

벤치마크Opus 5Fable 5Opus 4.8비고
Frontier-Bench v0.143.3%33.7%18.7%에이전트 터미널 코딩
GDPval-AA v2 Elo1,861(Opus 5 위)실경제 태스크 인간 평가

Frontier-Bench는 에이전트가 터미널에서 실제 코딩 작업을 수행하는 벤치마크다. 단순 코드 작성이 아니라 멀티파일 수정, 테스트 실행, 디버깅을 포함한다. Opus 5가 Fable 5보다 9.6%p 높다는 것은 에이전트 코딩 루프에서 실질적인 차이다.

GDPval-AA v2는 실제 경제적 가치를 내는 태스크에서 인간이 결과를 평가하는 Elo 기반 벤치마크다. GPT-5.6 Sol(1,736)과 Fable 5를 모두 앞선다.

사이버보안에서는 Fable 5가 여전히 우위를 유지한다. Opus 5의 시스템 카드는 사이버보안 태스크에서 Mythos 5 대비 제한이 있음을 명시한다.


Fast mode: 2.5배 속도, 두 배 가격

Fast mode는 현재 연구 프리뷰 단계다.

표준Fast mode
입력$5 / MTok$10 / MTok
출력$25 / MTok$50 / MTok
속도기본~2.5×
제공 플랫폼모든 플랫폼Claude API만

비용이 두 배이므로 모든 워크로드에 적용하는 것은 비효율적이다. 실시간 상호작용이나 SLO가 타이트한 작업에 선택적으로 활용한다. AWS Bedrock, Google Cloud, Microsoft Foundry에서는 아직 지원하지 않는다.


Opus 4.8 → Opus 5 마이그레이션 체크리스트

  1. 모델 ID 변경: claude-opus-4-8claude-opus-5
  2. max_tokens 재검토: thinking이 기본 활성화되므로 thinking 토큰 공간을 감안해 값을 높인다. xhigh/max effort 사용 시 최소 32K, 이상적으로는 64K 이상.
  3. thinking 비활성화 코드 확인: thinking: {"type": "disabled"}effort: xhigh/max 조합이 있으면 수정한다.
  4. 검증 지시 제거: 프롬프트 안의 "검증 단계 추가", "서브에이전트로 검증" 지시를 제거한다.
  5. 토큰 예산 재산정: 응답이 길어지므로 비용 모델을 업데이트한다.
  6. budget_tokens 코드 확인: Opus 4.8의 thinking: {"type": "enabled", "budget_tokens": N}은 Opus 5에서 오류를 내지 않지만 권장하지 않는다. output_config: {"effort": ...}로 교체한다.
  7. 베타 기능 활용 여부 검토: mid-conversation tool changes, default fallbacks mode가 아키텍처에 도움이 되는지 확인한다.
  8. 에val 재실행: 응답 길이, 자체 검증 동작, 에이전트 위임 빈도 변화를 측정한다.

결론

Claude Opus 5는 두 가지 사실을 동시에 보여줬다. 첫째, 플래그십 모델(Fable 5)보다 에이전트 코딩에서 높은 성능을 내는 모델을 절반 가격에 공급할 수 있게 됐다. 둘째, effort 사다리가 실제로 작동한다 — 낮은 effort에서도 충분한 품질이 나오고, 높은 effort로 올렸을 때 벤치마크에서 확인할 수 있는 향상이 따라온다.

마이그레이션에서 주의할 핵심은 두 가지다. thinking이 기본 활성화되므로 max_tokens를 키우고, effort: xhigh/maxthinking: disabled의 충돌을 피한다. 이 두 가지만 처리하면 나머지는 대부분 코드 한 줄(모델 ID) 변경으로 끝난다.


References

  • Anthropic, "Introducing Claude Opus 5", 2026-07-24. https://www.anthropic.com/news/claude-opus-5
  • Anthropic Platform Docs, "What's new in Claude Opus 5". https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  • Anthropic Platform Docs, "Effort". https://platform.claude.com/docs/en/build-with-claude/effort
  • Anthropic Platform Docs, "Migration guide". https://platform.claude.com/docs/en/about-claude/models/migration-guide
  • Anthropic Platform Docs, "Prompting Claude Opus 5". https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
  • Anthropic Platform Docs, "Fast mode". https://platform.claude.com/docs/en/build-with-claude/fast-mode
  • Codersera, "Claude Opus 5 Benchmarks Explained: Frontier-Bench, ARC-AGI-3 and SWE-bench (2026)". https://codersera.com/blog/claude-opus-5-benchmarks-explained-2026/amp/
  • MarkTechPost, "Meet the New Claude Opus 5: Frontier-Class Agentic Coding and Computer Use at Unchanged Opus Pricing", 2026-07-24. https://www.marktechpost.com/2026/07/24/meet-the-new-claude-opus-5-frontier-class-agentic-coding-and-computer-use-at-unchanged-opus-pricing/
  • Amplifi Labs, "Claude Opus 5: A Technical Guide for Teams Evaluating It in Production". https://amplifilabs.com/post/claude-opus-5
  • BenchLM.ai, "Claude Opus 5 Benchmarks, Pricing & Speed". https://benchlm.ai/models/claude-opus-5