Claude Opus 5: 실전 가이드
2026년 7월 24일 Anthropic은 Claude Opus 5(claude-opus-5)를 출시했습니다. Sonnet 5(6월 30일), Fable 5 / Mythos 5(6월 9일)에 이어 두 달 만에 나온 네 번째 모델입니다. 헤드라인은 의도적으로 지루합니다. Opus 4.8과 동일한 MTok당 입력 $5 / 출력 $25 가격, 동일한 1M 컨텍스트, 동일한 128k 출력 상한. 흥미로운 부분은 그 변하지 않은 숫자들이 이제 무엇을 사줄 수 있는가입니다. Frontier-Bench v0.1에서 44.4%로 Opus 4.8의 18.7% 대비 두 배 이상, SWE-bench Verified 96.0%, ARC-AGI-3에서 30.16% — GPT-5.6 Sol의 7.78%의 약 세 배, Opus 4.8의 1.52%의 스무 배. Opus 5는 이제 Claude Max의 기본 모델이며 Claude Pro에서 사용할 수 있는 가장 강력한 모델입니다.
이 페이지는 실전 필드 가이드입니다. 그 숫자들이 실제로 여러분의 스택에 무엇을 의미하는지, 순진한 마이그레이션을 400 오류로 만들 두 가지 API 계약 변경 사항, Opus 5가 정당하게 Fable 5를 대체하는 시점(그리고 그렇지 않은 때), 그리고 새로운 xhigh / max effort 계층을 다룹니다.
- Opus 5가 무엇인지 알기: 1M 컨텍스트, 128k 출력, MTok당 입력 $5 / 출력 $25 — Opus 4.8과 동일한 형태에 실질적으로 더 나은 숫자
- 순진한 마이그레이션을 깨뜨리는 두 가지 API 제약을 이해하기: 높은 effort에서 thinking-disabled 제한과 기본으로 켜진 thinking이 max_tokens 예산을 잡아먹는 문제
- 에이전트 팀 리더가 벤치마크를 읽는 방식으로 읽기 — Frontier-Bench, ARC-AGI-3, SWE-bench Pro, OSWorld 2.0 — 그리고 어떤 것이 여러분의 워크로드에 의미 있는지 알기
- 정직한 가격 계산 하기: max effort의 Opus 5가 해결한 태스크당 비용에서 Fable 5를 이기는 때와 그렇지 않은 때
- 적절한 effort 계층 선택하기 — 새로운 xhigh와 max 계층은 Frontier-Bench와 ARC-AGI-3에서 값어치를 하지만 다른 곳에서는 토큰을 낭비함
- 2026년 8월 5일 은퇴일 전에 Opus 4.1 → Opus 5 마이그레이션 계획 세우기
한 문단 버전
Opus 5는 가격 중립적인 역량 향상이지 재가격 책정이 아닙니다. Opus 4.8과 동일한 MTok당 $5 / $25, 동일한 1M 토큰 컨텍스트, 동기 Messages API에서 동일한 128k 최대 출력, 그리고 2026년 5월로 이동된 동일하게 신뢰할 수 있는 지식 컷오프. 바뀐 것은 그 토큰들이 하는 일입니다. Frontier-Bench v0.1(Anthropic 자체의 가장 어려운 코딩 에이전트 평가)에서 Opus 5는 **xhigh effort에서 44.4%**를 기록해 Opus 4.8의 18.7% 대비 — 동일한 정가에 두 배 이상입니다. ARC-AGI-3에서 새로운 문제 해결은 1.52%에서 30.16%로 뛰었습니다. 순진한 마이그레이션을 깨뜨릴 두 가지 계약 변경이 있습니다. 적응형 thinking이 기본으로 켜져 있고 응답과 max_tokens 예산을 공유하며, thinking: {"type": "disabled"}가 이제 새로운 xhigh 또는 max effort 계층에서 400을 반환합니다. Opus 5는 Claude Max의 새 기본이고 Claude Pro에서 사용 가능한 가장 강력한 모델이며, Claude API, Bedrock(anthropic.claude-opus-5), Google Cloud(claude-opus-5), Microsoft Foundry, AWS의 Claude Platform을 통해 사용할 수 있습니다.
Opus 4.8 대비 실제로 바뀐 것
Opus 4.8은 2026년 4월에 1M 컨텍스트 창과 기본으로 켜진 적응형 thinking을 가진 최초의 Opus로 출시되었습니다. Opus 5는 그 모든 기본값을 유지하므로 와이어 상의 요청/응답 형태는 거의 동일합니다. 네 가지가 움직였습니다.
- 숫자. Frontier-Bench v0.1은 18.7%에서 44.4%(xhigh) / 43.3%(max)로. SWE-bench Multimodal은 38.4%에서 59.4%로. OSWorld 2.0은 55.7%에서 70.57%로. Zapier AutomationBench는 17.0%에서 26.0%로. ARC-AGI-3은 high effort에서 1.52%에서 30.16%로.
- 새로운
maxeffort 계층이xhigh위에 자리잡고,thinking: {"type": "disabled"}가xhigh또는max에서 더 이상 작동하지 않습니다(400 오류). 그 계층에서는 여러분이 추론에 명시적으로 비용을 지불하고 있다는 의도이므로, 조용히 비활성화하는 것은 이제 선호가 아닌 버그입니다. - 자기 검증이 이제 기본 동작이며 프롬프트된 습관이 아닙니다. Anthropic의 마이그레이션 가이드는 수동 "작업 검토" 지침을 제거하도록 명시적으로 경고합니다 — 그렇지 않으면 이중 검증과 소진된 토큰을 얻게 됩니다. 이는 Opus 4.8에서 돌아가던 Opus 5 코드를 실행하는 첫날에 가장 흔한 놀라움입니다.
- Prompt caching이 이제 대화 중간 도구 변경에서 무효화되지 않습니다(베타). 여러분의 에이전트 루프가 단계별로 도구 목록을 교체하는 경우, 이제 캐시 접두사가 유지됩니다. Opus 4.8에서는 매번 새 쓰기 비용을 지불했습니다.
마이그레이션을 깨뜨릴 두 가지 400 오류
- Opus 4.8은 어떤 effort 수준에서도 thinking을 비활성화할 수 있었습니다. Opus 5는 high effort 이하에서만 thinking: {"type": "disabled"}를 허용합니다. xhigh 또는 max와 짝지으면 하드 오류입니다. 항상 thinking을 비활성화하는 래퍼가 있다면(일부 팀은 응답을 간결하게 유지하기 위해 이렇게 함), effort를 high로 낮추거나 thinking 필드를 삭제하고 적응형 thinking이 실행되도록 하세요.
- Sonnet 5 마이그레이션과 같은 함정입니다. max_tokens는 총 출력 — thinking 블록 더하기 응답 텍스트 — 에 대한 하드 상한입니다. thinking이 비활성화된 Opus 4.8에서 '답변만'을 위해 max_tokens를 크기 조정했고, Opus 5에서 비활성화하지 않으면 stop_reason: 'max_tokens'와 함께 잘린 답변을 볼 것입니다. max_tokens를 올리거나, effort를 medium으로 낮추거나, high 이하에서 thinking을 명시적으로 비활성화하세요.
- Opus 4.7에서 상속됨 — thinking: {type: 'enabled', budget_tokens: N}이 400을 반환합니다. 대신 effort를 사용하세요. 요청당 예산을 계산하고 있었다면, 그 로직을 effort 셀렉터로 대체하세요. 적응형 컨트롤러가 이제 태스크 난이도에 따라 얼마나 오래 생각할지 결정합니다.
- 400은 아니지만 조용한 비용 회귀입니다. Opus 5는 프롬프트 없이 반복하고 자기 검증합니다. 4.6 또는 4.8에 추가한 '이제 답을 단계별로 검증하세요' 스캐폴딩은 두 번째 검증 패스를 트리거하고 어려운 프롬프트에서 대략 thinking 토큰을 두 배로 만듭니다. 그 지침을 삭제하고 평가를 다시 실행하세요.
최소한의 안전한 마이그레이션 — Opus 4.8에서 Opus 5로
# Before (Opus 4.8) — worked
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4096,
extra_body={"effort": "max"},
thinking={"type": "disabled"}, # allowed on 4.8 at any effort
system="After answering, verify your work step by step.",
messages=[...],
)
# After (Opus 5) — three edits
response = client.messages.create(
model="claude-opus-5",
max_tokens=16384, # thinking now shares this budget
extra_body={"effort": "max"},
# thinking={"type": "disabled"} # 400 at xhigh/max — remove it
system="Answer the question.", # drop the verify instruction — Opus 5 self-verifies
messages=[...],
)실제로 중요한 벤치마크
Anthropic은 출시일에 많은 숫자를 발표했습니다. 셋은 실제 워크로드에 하중을 지탱하고, 하나는 마케팅 트로피이며, 둘은 Opus 5가 최상의 선택이 아닌 곳을 보여주므로 주의 깊게 읽을 가치가 있습니다.
- Frontier-Bench v0.1 — 44.4%(xhigh) 대 Opus 4.8의 18.7%. 이는 Anthropic의 가장 어려운 에이전트 코딩 평가입니다 — 모델이 도구를 실행하고, 반복하며, 자기 수정해야 하는 장기 horizon 태스크입니다. 동일한 가격에 2.4배 도약은 마이그레이션할 가장 강력한 단일 이유입니다.
- SWE-bench Verified — 96.0%. 천장에 가깝습니다. Opus 4.8이나 Fable 5를 SWE-bench 스타일 버그 수정에 사용하고 있었다면, Opus 5는 직접적인 업그레이드입니다. 그러나 SWE-bench Verified는 이제 포화된 벤치마크입니다 — 작은 차이는 예전만큼 모델을 구별하지 못합니다.
- OSWorld 2.0 — 70.57% 대 Opus 4.8의 55.7%. 컴퓨터 사용 벤치마크. Claude for Chrome, Claude Cowork의 브라우저 모드, 또는 실제 UI를 클릭하는 무엇이든 실행하고 있다면, 이것이 지켜볼 숫자입니다.
- ARC-AGI-3 — 30.16%(high effort) 대 GPT-5.6 Sol의 7.78% 및 Opus 4.8의 1.52%. 마케팅 트로피. ARC-AGI-3은 암기에 저항하는 새로운 문제 해결을 테스트하며, Opus 5는 다음 최고 모델의 약 3배입니다. 워크로드에 실제 신규성이 있으면 의미 있는 신호이며, 인터넷이 이미 해결한 것의 변형이라면 덜 의미 있습니다.
- SWE-bench Pro — 79.2% 대 Fable 5의 80.0%. Fable 5는 여전히 더 어려운 SWE-bench Pro에서 Opus 5를 0.8pp 앞섭니다. 대부분의 팀에 대해 Fable 5의 2배 가격을 정당화하기에는 충분하지 않지만, 코드 복잡도의 상위 10분위에 있고 모든 포인트가 중요하다면 이것에 주목하세요.
- 사이버 보안 익스플로잇 — Opus 5는 Mythos 5 뒤에 있습니다. Anthropic은 Opus 5가 최상위 사이버 모델이 아니라고 명시적으로 말합니다. Project Glasswing을 통해 방어적 사이버 작업을 하고 있다면, Mythos가 여전히 선택입니다.
Opus 5가 Fable 5를 대체하는 시점(그리고 그렇지 않은 때)
이 출시가 강제하는 흥미로운 질문. 언제 실제로 Fable 5의 $10 / $50 가격이 필요한가? Anthropic 자체 주장은 Opus 5가 CursorBench 3.2에서 Fable 5의 정점 대비 0.5% 이내에 절반 비용으로 도달하며, "비용의 약 3분의 1을 조금 넘게" OSWorld 2.0 결과에서 Fable 5와 일치한다는 것입니다. 그것이 강한 버전의 주장입니다. 정직한 버전은 이렇습니다.
- Opus 5를 선택하세요 에이전트 코딩, 컴퓨터 사용, 비즈니스 자동화, 생명 과학 추론, 그리고 마지막 1-3pp의 품질보다 해결된 태스크당 비용이 더 중요한 무엇이든에서. 이것이 프로덕션 워크로드의 90% 이상입니다.
- Fable 5를 선택하세요 워크로드가 (a) 주변부 실행이 마지막 퍼센트에서 진정으로 이익을 얻는 장기 실행 에이전트일 때(Anthropic은 Fable 5를 "장기 실행 에이전트를 위한 차세대 지능"으로 프레임함), (b) 실제 격차를 측정한 SWE-bench Pro 스타일의 어려운 코드 태스크, 또는 (c) 이미 2배 비용이 실제 품질을 사주는 정확도 대 비용 곡선 내부에 있는 워크로드일 때.
- Mythos 5를 선택하세요 Project Glasswing을 통한 초대 전용 방어적 사이버용.
정직한 해결된 태스크당 비용 계산
# Fable 5 on a hard agentic task # ~500k input tokens, ~50k output tokens # 500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run # Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $7.50 / 0.46 = ~$16.30 # Opus 5 on the same task # Same token budget # 500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run # Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $3.75 / 0.444 = ~$8.45 # Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality. # Break-even: Fable 5 would need to be 2x cheaper per successful run, # i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.
새로운 max effort 계층 — 값어치를 하는 때
Opus 5는 xhigh 위의 명시적인 계층으로 max를 도입합니다. 적응형 thinking은 이제 low → medium → high → xhigh → max에 걸쳐 있으며, Claude API와 Claude Code에서 high가 기본입니다. 출시 벤치마크에서 두 가지 관찰:
- Frontier-Bench v0.1에서
xhigh는 실제로 44.4%를 기록한 반면max는 43.3% — max는 엄격히 더 나은 것이 아닙니다. 시도당 더 많은 토큰을 소진하지만 추가 추론이 이 평가에서 항상 전환되지는 않습니다. - 긴 숙고를 보상하는 태스크에서 — ARC-AGI-3, 새로운 연구 문제, 어려운 수학적 추론(IMO 2026 금메달 수준, 42/42) — 더 높은 계층이 값어치를 합니다.
실용적인 규칙: 기본은 high로, 평가가 측정 가능한 이득을 보여줄 때 xhigh로 이동, 추론 깊이가 처리량보다 더 중요하다고 검증한 워크로드에만 max를 사용하세요. max를 설정하고 희망하지 마세요. 측정하세요.
생명 과학, 안전성, 사이버 자세
고정할 가치가 있는 세 가지 숫자:
- 생명 과학. Opus 5는 유기 화학에서 Opus 4.8보다 +10.2 퍼센트 포인트, 단백질 예측에서 +7.7pp입니다. 구조 생물학, 생물정보학 또는 합성 계획을 위한 에이전트를 구축하고 있다면, 이것은 실제 도약이지 잡음 내 개선이 아닙니다.
- 프롬프트 주입 저항성. Gray Swan 벤치마크에서 공격자 성공은 Opus 4.8의 5.5%에서 **2.0%**로 떨어집니다. Claude Cowork 브라우저 환경에서 auto-mode 안전 장치는 Anthropic의 측정에서 브라우저 프롬프트 주입 성공을 **0%**로 가져옵니다. Claude-for-Chrome 스타일 에이전트를 배포하는 누구에게나 의미 있습니다.
- 사이버 분류기. Opus 5의 사이버 안전 장치는 Fable 5보다 약 85% 덜 자주 개입합니다 — Opus 5가 의도적으로 최상위 사이버 모델이 아니기 때문에, 개입률이 낮게 조정됩니다. Fable 5에서 정당한 보안 연구 프롬프트에 대해 가짜 안전 거부를 보고 있었다면, Opus 5는 눈에 띄게 덜 예민하게 느껴질 것입니다.
계획해야 할 종료 타임라인
- **Opus 4.1(
claude-opus-4-1-20250805)**은 2026년 8월 5일 은퇴합니다 — Opus 5 출시로부터 11일. 프로덕션 표면이 여전히 Opus 4.1에 고정되어 있다면, 이번 주에 마이그레이션하세요. - Opus 4.5 / 4.6 / 4.7 / 4.8은 플랫폼 개요에서 "레거시 모델"로 사용 가능하게 유지되지만, 표준 12개월 종료 주기를 예상하세요. 새로운 모든 것의 마이그레이션 대상으로 Opus 5를 취급하세요.
- Opus 5의 모델 ID는 고정된 스냅샷이며 상록 포인터가 아닙니다. 4.6 세대부터 시작해서, 날짜 없는 ID 형식은 여전히 "고정 스냅샷"을 의미합니다. 미래의
claude-opus-5-1은 새 ID일 것이며claude-opus-5의 조용한 업그레이드가 아닙니다.
시도해 보세요 — 한 명령
권장 기본값으로 Opus 5 실행
# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=8192, # room for adaptive thinking + response
extra_body={"effort": "high"}, # default; move to xhigh only if evals justify
system="You are a senior engineer. Answer directly and iterate until the task is complete.",
messages=[{"role": "user", "content": "..."}],
)
# Claude Code
claude --model claude-opus-5
# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast" # separate model ID, $10/$50 per MTok치트 시트
이해도 확인
Check yourself
0/5다음으로 갈 곳
- Claude Sonnet 5: 실전 가이드 — 균형 잡힌 계층이자 Claude Code의 기본; Sonnet 4.6에서의 마이그레이션은 자체 400 함정을 가지고 있습니다
- Fable 5 & Mythos 5: 플래그십 실전 가이드 — 최상위 계층이 실제로 2배 비용을 벌 때
- 2026년에 모델 선택하기 — 전체 Anthropic 라인업에 걸친 결정 트리
- 적응형 Thinking & Effort 튜닝 — effort가 실제 토큰 지출에 어떻게 매핑되는지
- Prompt Caching 경제학 — Opus 5의 헤드라인 가격을 실제 청구서로 바꾸는 캐시 히트 계산
- 현재 모델 및 가격 — 항상 최신인 표; 고정 전에 확인하세요
출처 및 추가 자료
- Claude Opus 5 소개 — Anthropic (2026년 7월 24일) — 출시 포스트, 벤치마크 표, 안전 노트
- Claude Platform 문서 — 모델 개요 — 가격 표, 스냅샷 ID, Bedrock/GCP 식별자, effort 기본값
- 마이그레이션 가이드 — Opus 4.8에서 Opus 5로 — 계약 변경의 공식 목록과 자기 검증 경고
- MarkTechPost — Opus 5 출시 커버리지 (2026년 7월 24일) — SWE-bench, ARC-AGI-3, Chartography 숫자를 포함한 벤치마크별 분석
- Interesting Engineering — Opus 5 코딩 커버리지 — 태스크당 비용 프레이밍
- TheNextWeb — Opus 5 출시 분석 — 출시 케이던스와 Fable 5 비교
- BigGo Finance — Opus 5 가격 분석 — fast 모드 경제학과 prompt-cache 변경
- 모델 종료 — Anthropic — Opus 4.1 은퇴일과 더 넓은 라이프사이클 정책