본문으로 건너뛰기

Claude Opus 5: 실전 가이드

중급

2026년 7월 24일 Anthropic은 Claude Opus 5(claude-opus-5)를 출시했습니다. Sonnet 5(6월 30일), Fable 5 / Mythos 5(6월 9일)에 이어 두 달 만에 나온 네 번째 모델입니다. 헤드라인은 의도적으로 지루합니다. Opus 4.8과 동일한 MTok당 입력 $5 / 출력 $25 가격, 동일한 1M 컨텍스트, 동일한 128k 출력 상한. 흥미로운 부분은 그 변하지 않은 숫자들이 이제 무엇을 사줄 수 있는가입니다. Frontier-Bench v0.1에서 44.4%로 Opus 4.8의 18.7% 대비 두 배 이상, SWE-bench Verified 96.0%, ARC-AGI-3에서 30.16% — GPT-5.6 Sol의 7.78%의 약 세 배, Opus 4.8의 1.52%의 스무 배. Opus 5는 이제 Claude Max의 기본 모델이며 Claude Pro에서 사용할 수 있는 가장 강력한 모델입니다.

이 페이지는 실전 필드 가이드입니다. 그 숫자들이 실제로 여러분의 스택에 무엇을 의미하는지, 순진한 마이그레이션을 400 오류로 만들 두 가지 API 계약 변경 사항, Opus 5가 정당하게 Fable 5를 대체하는 시점(그리고 그렇지 않은 때), 그리고 새로운 xhigh / max effort 계층을 다룹니다.

What you'll learn
  • Opus 5가 무엇인지 알기: 1M 컨텍스트, 128k 출력, MTok당 입력 $5 / 출력 $25 — Opus 4.8과 동일한 형태에 실질적으로 더 나은 숫자
  • 순진한 마이그레이션을 깨뜨리는 두 가지 API 제약을 이해하기: 높은 effort에서 thinking-disabled 제한과 기본으로 켜진 thinking이 max_tokens 예산을 잡아먹는 문제
  • 에이전트 팀 리더가 벤치마크를 읽는 방식으로 읽기 — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — 그리고 어떤 것이 여러분의 워크로드에 의미 있는지 알기
  • 정직한 가격 계산 하기: max effort의 Opus 5가 해결한 태스크당 비용에서 Fable 5를 이기는 때와 그렇지 않은 때
  • 적절한 effort 계층 선택하기 — 새로운 xhigh와 max 계층은 Frontier-Bench와 ARC-AGI-3에서 값어치를 하지만 다른 곳에서는 토큰을 낭비함
  • 2026년 8월 5일 은퇴일 전에 Opus 4.1 → Opus 5 마이그레이션 계획 세우기

한 문단 버전

Opus 5는 가격 중립적인 역량 향상이지 재가격 책정이 아닙니다. Opus 4.8과 동일한 MTok당 $5 / $25, 동일한 1M 토큰 컨텍스트, 동기 Messages API에서 동일한 128k 최대 출력, 그리고 2026년 5월로 이동된 동일하게 신뢰할 수 있는 지식 컷오프. 바뀐 것은 그 토큰들이 하는 일입니다. Frontier-Bench v0.1(Anthropic 자체의 가장 어려운 코딩 에이전트 평가)에서 Opus 5는 **xhigh effort에서 44.4%**를 기록해 Opus 4.8의 18.7% 대비 — 동일한 정가에 두 배 이상입니다. ARC-AGI-3에서 새로운 문제 해결은 1.52%에서 30.16%로 뛰었습니다. 순진한 마이그레이션을 깨뜨릴 두 가지 계약 변경이 있습니다. 적응형 thinking이 기본으로 켜져 있고 응답과 max_tokens 예산을 공유하며, thinking: {"type": "disabled"}가 이제 새로운 xhigh 또는 max effort 계층에서 400을 반환합니다. Opus 5는 Claude Max의 새 기본이고 Claude Pro에서 사용 가능한 가장 강력한 모델이며, Claude API, Bedrock(anthropic.claude-opus-5), Google Cloud(claude-opus-5), Microsoft Foundry, AWS의 Claude Platform을 통해 사용할 수 있습니다.

Opus 4.8 대비 실제로 바뀐 것

Opus 4.8은 2026년 4월에 1M 컨텍스트 창과 기본으로 켜진 적응형 thinking을 가진 최초의 Opus로 출시되었습니다. Opus 5는 그 모든 기본값을 유지하므로 와이어 상의 요청/응답 형태는 거의 동일합니다. 네 가지가 움직였습니다.

  • 숫자. Frontier-Bench v0.1은 18.7%에서 44.4%(xhigh) / 43.3%(max)로. SWE-bench Multimodal은 38.4%에서 59.4%로. OSWorld 2.0은 55.7%에서 70.57%로. Zapier AutomationBench는 17.0%에서 26.0%로. ARC-AGI-3은 high effort에서 1.52%에서 30.16%로.
  • 새로운 max effort 계층xhigh 위에 자리잡고, thinking: {"type": "disabled"}xhigh 또는 max에서 더 이상 작동하지 않습니다(400 오류). 그 계층에서는 여러분이 추론에 명시적으로 비용을 지불하고 있다는 의도이므로, 조용히 비활성화하는 것은 이제 선호가 아닌 버그입니다.
  • 자기 검증이 이제 기본 동작이며 프롬프트된 습관이 아닙니다. Anthropic의 마이그레이션 가이드는 수동 "작업 검토" 지침을 제거하도록 명시적으로 경고합니다 — 그렇지 않으면 이중 검증과 소진된 토큰을 얻게 됩니다. 이는 Opus 4.8에서 돌아가던 Opus 5 코드를 실행하는 첫날에 가장 흔한 놀라움입니다.
  • Prompt caching이 이제 대화 중간 도구 변경에서 무효화되지 않습니다(베타). 여러분의 에이전트 루프가 단계별로 도구 목록을 교체하는 경우, 이제 캐시 접두사가 유지됩니다. Opus 4.8에서는 매번 새 쓰기 비용을 지불했습니다.

마이그레이션을 깨뜨릴 두 가지 400 오류

Guided walkthrough1 of 4
  1. Opus 4.8은 어떤 effort 수준에서도 thinking을 비활성화할 수 있었습니다. Opus 5는 high effort 이하에서만 thinking: {"type": "disabled"}를 허용합니다. xhigh 또는 max와 짝지으면 하드 오류입니다. 항상 thinking을 비활성화하는 래퍼가 있다면(일부 팀은 응답을 간결하게 유지하기 위해 이렇게 함), effort를 high로 낮추거나 thinking 필드를 삭제하고 적응형 thinking이 실행되도록 하세요.

최소한의 안전한 마이그레이션 — Opus 4.8에서 Opus 5로

# Before (Opus 4.8) — worked
response = client.messages.create(
  model="claude-opus-4-8",
  max_tokens=4096,
  extra_body={"effort": "max"},
  thinking={"type": "disabled"},           # allowed on 4.8 at any effort
  system="After answering, verify your work step by step.",
  messages=[...],
)

# After (Opus 5) — three edits
response = client.messages.create(
  model="claude-opus-5",
  max_tokens=16384,                        # thinking now shares this budget
  extra_body={"effort": "max"},
  # thinking={"type": "disabled"}          # 400 at xhigh/max — remove it
  system="Answer the question.",           # drop the verify instruction — Opus 5 self-verifies
  messages=[...],
)

실제로 중요한 벤치마크

Anthropic은 출시일에 많은 숫자를 발표했습니다. 셋은 실제 워크로드에 하중을 지탱하고, 하나는 마케팅 트로피이며, 둘은 Opus 5가 최상의 선택이 아닌 곳을 보여주므로 주의 깊게 읽을 가치가 있습니다.

  • Frontier-Bench v0.1 — 44.4%(xhigh) 대 Opus 4.8의 18.7%. 이는 Anthropic의 가장 어려운 에이전트 코딩 평가입니다 — 모델이 도구를 실행하고, 반복하며, 자기 수정해야 하는 장기 horizon 태스크입니다. 동일한 가격에 2.4배 도약은 마이그레이션할 가장 강력한 단일 이유입니다.
  • SWE-bench Verified — 96.0%. 천장에 가깝습니다. Opus 4.8이나 Fable 5를 SWE-bench 스타일 버그 수정에 사용하고 있었다면, Opus 5는 직접적인 업그레이드입니다. 그러나 SWE-bench Verified는 이제 포화된 벤치마크입니다 — 작은 차이는 예전만큼 모델을 구별하지 못합니다.
  • OSWorld 2.0 — 70.57% 대 Opus 4.8의 55.7%. 컴퓨터 사용 벤치마크. Claude for Chrome, Claude Cowork의 브라우저 모드, 또는 실제 UI를 클릭하는 무엇이든 실행하고 있다면, 이것이 지켜볼 숫자입니다.
  • ARC-AGI-3 — 30.16%(high effort) 대 GPT-5.6 Sol의 7.78% 및 Opus 4.8의 1.52%. 마케팅 트로피. ARC-AGI-3은 암기에 저항하는 새로운 문제 해결을 테스트하며, Opus 5는 다음 최고 모델의 약 3배입니다. 워크로드에 실제 신규성이 있으면 의미 있는 신호이며, 인터넷이 이미 해결한 것의 변형이라면 덜 의미 있습니다.
  • SWE-bench Pro — 79.2% 대 Fable 5의 80.0%. Fable 5는 여전히 더 어려운 SWE-bench Pro에서 Opus 5를 0.8pp 앞섭니다. 대부분의 팀에 대해 Fable 5의 2배 가격을 정당화하기에는 충분하지 않지만, 코드 복잡도의 상위 10분위에 있고 모든 포인트가 중요하다면 이것에 주목하세요.
  • 사이버 보안 익스플로잇 — Opus 5는 Mythos 5 뒤에 있습니다. Anthropic은 Opus 5가 최상위 사이버 모델이 아니라고 명시적으로 말합니다. Project Glasswing을 통해 방어적 사이버 작업을 하고 있다면, Mythos가 여전히 선택입니다.

Opus 5가 Fable 5를 대체하는 시점(그리고 그렇지 않은 때)

이 출시가 강제하는 흥미로운 질문. 언제 실제로 Fable 5의 $10 / $50 가격이 필요한가? Anthropic 자체 주장은 Opus 5가 CursorBench 3.2에서 Fable 5의 정점 대비 0.5% 이내에 절반 비용으로 도달하며, "비용의 약 3분의 1을 조금 넘게" OSWorld 2.0 결과에서 Fable 5와 일치한다는 것입니다. 그것이 강한 버전의 주장입니다. 정직한 버전은 이렇습니다.

  • Opus 5를 선택하세요 에이전트 코딩, 컴퓨터 사용, 비즈니스 자동화, 생명 과학 추론, 그리고 마지막 1-3pp의 품질보다 해결된 태스크당 비용이 더 중요한 무엇이든에서. 이것이 프로덕션 워크로드의 90% 이상입니다.
  • Fable 5를 선택하세요 워크로드가 (a) 주변부 실행이 마지막 퍼센트에서 진정으로 이익을 얻는 장기 실행 에이전트일 때(Anthropic은 Fable 5를 "장기 실행 에이전트를 위한 차세대 지능"으로 프레임함), (b) 실제 격차를 측정한 SWE-bench Pro 스타일의 어려운 코드 태스크, 또는 (c) 이미 2배 비용이 실제 품질을 사주는 정확도 대 비용 곡선 내부에 있는 워크로드일 때.
  • Mythos 5를 선택하세요 Project Glasswing을 통한 초대 전용 방어적 사이버용.

정직한 해결된 태스크당 비용 계산

# Fable 5 on a hard agentic task
#   ~500k input tokens, ~50k output tokens
#   500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run
#   Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $7.50 / 0.46 = ~$16.30

# Opus 5 on the same task
#   Same token budget
#   500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run
#   Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $3.75 / 0.444 = ~$8.45

# Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality.
# Break-even: Fable 5 would need to be 2x cheaper per successful run,
# i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.

새로운 max effort 계층 — 값어치를 하는 때

Opus 5는 xhigh 위의 명시적인 계층으로 max를 도입합니다. 적응형 thinking은 이제 low → medium → high → xhigh → max에 걸쳐 있으며, Claude API와 Claude Code에서 high가 기본입니다. 출시 벤치마크에서 두 가지 관찰:

  • Frontier-Bench v0.1에서 xhigh는 실제로 44.4%를 기록한 반면 max는 43.3% — max는 엄격히 더 나은 것이 아닙니다. 시도당 더 많은 토큰을 소진하지만 추가 추론이 이 평가에서 항상 전환되지는 않습니다.
  • 긴 숙고를 보상하는 태스크에서 — ARC-AGI-3, 새로운 연구 문제, 어려운 수학적 추론(IMO 2026 금메달 수준, 42/42) — 더 높은 계층이 값어치를 합니다.

실용적인 규칙: 기본은 high로, 평가가 측정 가능한 이득을 보여줄 때 xhigh로 이동, 추론 깊이가 처리량보다 더 중요하다고 검증한 워크로드에만 max를 사용하세요. max를 설정하고 희망하지 마세요. 측정하세요.

생명 과학, 안전성, 사이버 자세

고정할 가치가 있는 세 가지 숫자:

  • 생명 과학. Opus 5는 유기 화학에서 Opus 4.8보다 +10.2 퍼센트 포인트, 단백질 예측에서 +7.7pp입니다. 구조 생물학, 생물정보학 또는 합성 계획을 위한 에이전트를 구축하고 있다면, 이것은 실제 도약이지 잡음 내 개선이 아닙니다.
  • 프롬프트 주입 저항성. Gray Swan 벤치마크에서 공격자 성공은 Opus 4.8의 5.5%에서 **2.0%**로 떨어집니다. Claude Cowork 브라우저 환경에서 auto-mode 안전 장치는 Anthropic의 측정에서 브라우저 프롬프트 주입 성공을 **0%**로 가져옵니다. Claude-for-Chrome 스타일 에이전트를 배포하는 누구에게나 의미 있습니다.
  • 사이버 분류기. Opus 5의 사이버 안전 장치는 Fable 5보다 약 85% 덜 자주 개입합니다 — Opus 5가 의도적으로 최상위 사이버 모델이 아니기 때문에, 개입률이 낮게 조정됩니다. Fable 5에서 정당한 보안 연구 프롬프트에 대해 가짜 안전 거부를 보고 있었다면, Opus 5는 눈에 띄게 덜 예민하게 느껴질 것입니다.

계획해야 할 종료 타임라인

  • **Opus 4.1(claude-opus-4-1-20250805)**은 2026년 8월 5일 은퇴합니다 — Opus 5 출시로부터 11일. 프로덕션 표면이 여전히 Opus 4.1에 고정되어 있다면, 이번 주에 마이그레이션하세요.
  • Opus 4.5 / 4.6 / 4.7 / 4.8은 플랫폼 개요에서 "레거시 모델"로 사용 가능하게 유지되지만, 표준 12개월 종료 주기를 예상하세요. 새로운 모든 것의 마이그레이션 대상으로 Opus 5를 취급하세요.
  • Opus 5의 모델 ID는 고정된 스냅샷이며 상록 포인터가 아닙니다. 4.6 세대부터 시작해서, 날짜 없는 ID 형식은 여전히 "고정 스냅샷"을 의미합니다. 미래의 claude-opus-5-1은 새 ID일 것이며 claude-opus-5의 조용한 업그레이드가 아닙니다.

시도해 보세요 — 한 명령

권장 기본값으로 Opus 5 실행

# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()

response = client.messages.create(
  model="claude-opus-5",
  max_tokens=8192,                    # room for adaptive thinking + response
  extra_body={"effort": "high"},      # default; move to xhigh only if evals justify
  system="You are a senior engineer. Answer directly and iterate until the task is complete.",
  messages=[{"role": "user", "content": "..."}],
)

# Claude Code
claude --model claude-opus-5

# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast"  # separate model ID, $10/$50 per MTok

치트 시트

Enter 또는 스페이스 키를 눌러 카드를 뒤집습니다. 좌우 화살표 키로 카드를 이동할 수 있습니다.용어가 표시되었습니다.
1 / 8

이해도 확인

Check yourself

0/5
  1. `model="claude-opus-4-8"`, `effort: "max"`, 그리고 `thinking: {"type": "disabled"}`를 고정한 래퍼를 Opus 5로 마이그레이션합니다. 어떻게 됩니까?
  2. Opus 4.8 프롬프트가 '이제 답을 단계별로 검증하세요'로 끝납니다. Opus 5로 교체하고 어려운 프롬프트에서 대략 두 배의 thinking 토큰 비용을 봅니다. 왜입니까?
  3. 해결률이 중요하고 비용이 실제 제약인 프로덕션 에이전트 코딩 워크로드에 대해, Opus 5의 출시 데이터가 가장 강력하게 지지하는 모델은?
  4. `xhigh`보다 엄격히 더 나은 품질을 기대하며 모든 요청에 `effort: "max"`를 설정합니다. Anthropic의 출시 데이터는 무엇을 시사합니까?
  5. Opus 5 출시 후 계획해야 할 종료일은 다음 중 어느 것입니까?

다음으로 갈 곳

출처 및 추가 자료