Claude Opus 5: フィールドガイド
2026 年 7 月 24 日、Anthropic は Claude Opus 5 (claude-opus-5) をリリースしました — Sonnet 5(6 月 30 日)、Fable 5 / Mythos 5(6 月 9 日)に続き、2 か月で 4 番目のモデルです。見出しは意図的に地味です: Opus 4.8 と同じ MTok あたり $5 入力 / $25 出力の価格、同じ 1M コンテキスト、同じ 128k 出力上限。興味深いのは、これらの変わらない数字が今何を買うか: Frontier-Bench v0.1 で 44.4%(Opus 4.8 は 18.7%) で 2 倍以上、SWE-bench Verified で 96.0%、そして ARC-AGI-3 で 30.16% — GPT-5.6 Sol の 7.78% の約 3 倍、Opus 4.8 の 1.52% の約 20 倍。Opus 5 は Claude Max のデフォルトモデルとなり、Claude Pro で利用可能な最強モデルです。
このページは実用フィールドガイド: これらの数字があなたのスタックに実際に何を意味するか、素朴な移行を 400 エラーで壊す 2 つの API 契約変更、Opus 5 が正当に Fable 5 に取って代わる時(そうでない時)、そして新しい xhigh / max 努力段階。
- Opus 5 が何か知る: 1M コンテキスト、128k 出力、MTok あたり $5 入力 / $25 出力 — Opus 4.8 と同じ形、実質的に良い数字
- 素朴な移行を壊す 2 つの API 制約を理解する: 高努力での thinking 無効化の制限、そして max_tokens 予算を食う thinking のデフォルト有効
- エージェントチームリーダーが読むようにベンチマークを読む — Frontier-Bench、ARC-AGI-3、SWE-bench Pro、OSWorld 2.0 — そしてどれがあなたのワークロードに意味があるか知る
- 正直な価格計算をする: Opus 5 の max 努力が解決タスクあたりコストで Fable 5 を打ち負かす時、そうでない時
- 適切な努力段階を選ぶ — 新しい xhigh と max の段階は Frontier-Bench と ARC-AGI-3 で元を取るが、他ではトークンを無駄にする
- Opus 4.1 → Opus 5 の廃止を 2026 年 8 月 5 日の引退日前に計画する
一段落版
Opus 5 は再価格設定ではなく、価格中立の能力向上です。Opus 4.8 と同じ MTok あたり $5 / $25、同じ 1M トークンコンテキスト、同期 Messages API での同じ 128k 最大出力、2026 年 5 月にシフトした同じ信頼できる知識カットオフ。変わったのはこれらのトークンが何をするか: Frontier-Bench v0.1(Anthropic 自身の最も難しいコーディングエージェント評価)で Opus 5 は xhigh 努力で 44.4% vs Opus 4.8 の 18.7% — 同じ表示価格で 2 倍以上。ARC-AGI-3 では、新規問題解決が 1.52% から 30.16% に跳ね上がる。2 つの契約変更が素朴な移行を壊します: 適応的 thinking がデフォルトで有効で max_tokens 予算を応答と共有し、thinking: {"type": "disabled"} は新しい xhigh または max 努力段階で 400 を返すようになりました。Opus 5 は Claude Max の新しいデフォルト、Claude Pro で利用可能な最強のモデル、そして Claude API、Bedrock(anthropic.claude-opus-5)、Google Cloud(claude-opus-5)、Microsoft Foundry、AWS の Claude Platform 経由で利用可能。
Opus 4.8 に対して実際に変わったこと
Opus 4.8 は 1M コンテキストウィンドウとデフォルト有効の適応的 thinking を持つ最初の Opus として 2026 年 4 月に出荷されました。Opus 5 はこれらのデフォルトすべてを維持するので、ワイヤ上のリクエスト/レスポンス形状はほぼ同一です。動いた 4 つ:
- 数字。 Frontier-Bench v0.1 は 18.7% から 44.4%(xhigh)/ 43.3%(max)へ。SWE-bench Multimodal は 38.4% から 59.4%。OSWorld 2.0 は 55.7% から 70.57%。Zapier AutomationBench は 17.0% から 26.0%。ARC-AGI-3 は高努力で 1.52% から 30.16%。
- 新しい
max努力段階がxhighの上に入り、thinking: {"type": "disabled"}はxhighまたはmaxで動作しなくなりました(400 エラー)。意図はこれらの段階では明示的に推論の対価を払っているので、静かに無効化するのは好みではなくバグだということ。 - 自己検証がデフォルト動作になり、プロンプトで促す習慣ではなくなりました。Anthropic の移行ガイドは、手動の「自分の作業をチェックして」指示を削除するよう明示的に警告しています — そうしないと二重検証とトークンの浪費になります。これは Opus 4.8 で動作していたコードを Opus 5 で実行した初日で最もよくある驚きです。
- プロンプトキャッシングは会話中のツール変更で無効にならなくなりました(ベータ)。エージェントループがステップごとにツールリストをスワップする場合、キャッシュプレフィックスは今や生き残ります。Opus 4.8 では毎回新規書き込みを払っていました。
移行を壊す 2 つの 400 エラー
- Opus 4.8 では任意の努力レベルで thinking を無効化できました。Opus 5 では thinking: {"type": "disabled"} は high 努力以下でのみ許可されます。xhigh または max とペアにするとハードエラー。常に thinking を無効化するラッパー(応答を簡潔にするためこうするチームもあります)がある場合、努力を high に落とすか、thinking フィールドを削除して適応的 thinking を走らせる。
- Sonnet 5 移行と同じ罠。max_tokens は総出力のハードキャップ — thinking ブロック + 応答テキスト。Opus 4.8 で thinking 無効の「答えだけ」用に max_tokens をサイズしていて、Opus 5 で無効化しない場合、stop_reason: 'max_tokens' で切り詰められた回答が見えます。max_tokens を上げるか、努力を medium に落とすか、high 以下で thinking を明示的に無効化する。
- Opus 4.7 から継承 — thinking: {type: 'enabled', budget_tokens: N} は 400 を返す。代わりに effort を使う。リクエストごとの予算を計算していた場合、そのロジックを effort セレクタに置き換える。適応的コントローラがタスクの難易度に基づいてどれくらい考えるかを決めるようになりました。
- 400 ではないが、静かなコスト退行。Opus 5 は促されずに反復し自己チェックする。4.6 や 4.8 で追加した「今、あなたの答えをステップごとに検証して」というスキャフォールドは、難しいプロンプトで 2 回目の検証パスをトリガーし、thinking トークンをおおよそ 2 倍にする。これらの指示を削除して評価を再実行する。
最小限の安全な移行 — Opus 4.8 から Opus 5
# Before (Opus 4.8) — worked
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4096,
extra_body={"effort": "max"},
thinking={"type": "disabled"}, # allowed on 4.8 at any effort
system="After answering, verify your work step by step.",
messages=[...],
)
# After (Opus 5) — three edits
response = client.messages.create(
model="claude-opus-5",
max_tokens=16384, # thinking now shares this budget
extra_body={"effort": "max"},
# thinking={"type": "disabled"} # 400 at xhigh/max — remove it
system="Answer the question.", # drop the verify instruction — Opus 5 self-verifies
messages=[...],
)実際に重要なベンチマーク
Anthropic はローンチ日に多くの数字を発表しました。3 つは実ワークロードで負荷を担い、1 つはマーケティングのトロフィー、2 つは注意深く読む価値があります — Opus 5 が最上位選択肢でない場所を示すからです。
- Frontier-Bench v0.1 — 44.4%(xhigh)vs Opus 4.8 の 18.7%。 これは Anthropic の最も難しいエージェンティックコーディング評価 — モデルがツールを実行し、反復し、自己修正する必要がある長期タスク。同じ価格で 2.4 倍のジャンプが、移行の最強の単一理由です。
- SWE-bench Verified — 96.0%。 天井近く。SWE-bench 風のバグ修正で Opus 4.8 または Fable 5 を使っていたなら、Opus 5 は直接のアップグレード。しかし SWE-bench Verified は現在飽和したベンチマークで、小さな差はもうモデルを区別しません。
- OSWorld 2.0 — 70.57% vs Opus 4.8 の 55.7%。 コンピュータ使用ベンチマーク。Claude for Chrome、Claude Cowork のブラウザモード、または実 UI をクリックする他の何かを実行しているなら、これが監視すべき数字。
- ARC-AGI-3 — 30.16%(高努力)vs GPT-5.6 Sol の 7.78% と Opus 4.8 の 1.52%。 マーケティングトロフィー。ARC-AGI-3 は記憶に抵抗する新規問題解決をテストし、Opus 5 は次点モデルの約 3 倍。ワークロードに実際の新規性があるなら意味のあるシグナル。インターネットがすでに解決したものの変種なら意味は薄い。
- SWE-bench Pro — 79.2% vs Fable 5 の 80.0%。 より難しい SWE-bench Pro では Fable 5 が Opus 5 を 0.8pp 上回ります。ほとんどのチームにとって Fable 5 の 2 倍の価格を正当化するには不十分ですが、コード複雑性の上位 10 パーセントにいてすべてのポイントが重要なら注意。
- サイバーセキュリティ攻撃 — Opus 5 は Mythos 5 の後ろ。 Anthropic は Opus 5 が最上位のサイバーモデルではないと明示。Project Glasswing 経由で防御的サイバー作業をしているなら、まだ Mythos が選択肢。
Opus 5 が Fable 5 に取って代わる時(そうでない時)
このローンチが強いる興味深い質問: いつ実際に Fable 5 の $10 / $50 の価格が必要か? Anthropic 自身の主張は、Opus 5 が CursorBench 3.2 で Fable 5 のピークの 0.5% 以内に、半分のコストで到達し、OSWorld 2.0 の結果を「わずか 3 分の 1 強のコスト」で一致させるということ。それが強い版の議論。正直な版:
- Opus 5 を選ぶ — エージェンティックコーディング、コンピュータ使用、ビジネス自動化、生命科学推論、そしてコストあたり解決タスクが最後の 1〜3pp の質より重要なあらゆることに。これは本番ワークロードの 90% 超。
- Fable 5 を選ぶ — ワークロードが (a) 境界の実行が最後のパーセントから真に恩恵を受ける長期実行エージェント(Anthropic は Fable 5 を「長期実行エージェント向けの次世代インテリジェンス」と枠付け)、(b) 実ギャップを測定した SWE-bench Pro 風の難しいコードタスク、または (c) 2 倍のコストが実際の質を買う精度対コスト曲線内にすでにいるワークロード。
- Mythos 5 を選ぶ — Project Glasswing 経由の招待制防御的サイバーに。
正直な解決タスクあたりコスト計算
# Fable 5 on a hard agentic task # ~500k input tokens, ~50k output tokens # 500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run # Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $7.50 / 0.46 = ~$16.30 # Opus 5 on the same task # Same token budget # 500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run # Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh) # Cost per solved task: $3.75 / 0.444 = ~$8.45 # Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality. # Break-even: Fable 5 would need to be 2x cheaper per successful run, # i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.
新しい max 努力段階 — いつ元を取るか
Opus 5 は max を xhigh の上の明示的な段階として導入します。適応的 thinking は今や low → medium → high → xhigh → max にわたり、high が Claude API と Claude Code のデフォルト。ローンチベンチマークからの 2 つの観察:
- Frontier-Bench v0.1 では、
xhighは実際に 44.4% を記録し、maxは 43.3% — max は厳密に良いわけではない。試行あたりより多くのトークンを燃やすが、追加の推論はこの評価では必ずしも変換しない。 - 長い熟考を報いるタスク — ARC-AGI-3、新規研究問題、難しい数学的推論(IMO 2026 金メダルレベル、42/42) — では、高い段階は元を取ります。
実用ルール: デフォルトは high、評価が測定可能な利得を示す場合に xhigh に移動、max は推論深度がスループットより重要と検証したワークロードでのみ使う。 max を設定して希望しない。測定する。
生命科学、安全性、サイバー姿勢
固定する価値のある 3 つの数字:
- 生命科学。 Opus 5 は Opus 4.8 に対して有機化学で +10.2 パーセンテージポイント、タンパク質予測で +7.7pp。構造生物学、バイオインフォマティクス、または合成計画のエージェントを構築しているなら、これは実ジャンプ — ノイズ内の改善ではない。
- プロンプトインジェクション耐性。 Gray Swan ベンチマークで攻撃者成功率は Opus 4.8 の 5.5% から 2.0% に低下。Claude Cowork ブラウザ環境では、自動モードの保護策がブラウザプロンプトインジェクション成功率を Anthropic の測定で 0% に。Claude-for-Chrome 風エージェントを出荷している人には意味がある。
- サイバー分類子。 Opus 5 のサイバー保護策は Fable 5 より約 85% 少ない頻度で介入する — Opus 5 は意図的に最上位のサイバーモデルではないので、介入率が抑えられている。Fable 5 で正当なセキュリティ研究プロンプトに偽陽性の安全拒否を見ていたなら、Opus 5 は明らかに引き金が緩く感じられるでしょう。
計画すべき廃止タイムライン
- **Opus 4.1(
claude-opus-4-1-20250805)**は 2026 年 8 月 5 日に引退 — Opus 5 ローンチから 11 日。本番の何かがまだ Opus 4.1 をピンしているなら、今週移行する。 - Opus 4.5 / 4.6 / 4.7 / 4.8 はプラットフォーム概要で「レガシーモデル」として利用可能なままだが、標準の 12 か月廃止サイクルを予想する。新しいものは Opus 5 を移行ターゲットとして扱う。
- Opus 5 のモデル ID はピンされたスナップショットで、常緑ポインタではない。4.6 世代から、日付なし ID 形式もまだ「固定スナップショット」を意味する。将来の
claude-opus-5-1は新しい ID で、claude-opus-5の静かなアップグレードではない。
試す — 1 コマンド
推奨デフォルトで Opus 5 を実行
# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=8192, # room for adaptive thinking + response
extra_body={"effort": "high"}, # default; move to xhigh only if evals justify
system="You are a senior engineer. Answer directly and iterate until the task is complete.",
messages=[{"role": "user", "content": "..."}],
)
# Claude Code
claude --model claude-opus-5
# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast" # separate model ID, $10/$50 per MTokチートシート
理解を確認する
Check yourself
0/5次はどこへ
- Claude Sonnet 5: フィールドガイド — バランス段階と Claude Code のデフォルト。Sonnet 4.6 からの移行には独自の 400 トラップがある
- Fable 5 & Mythos 5: フラッグシップフィールドガイド — トップ段階が実際に 2 倍のコストを稼ぐ時
- 2026 年のモデル選び — Anthropic ラインナップ全体の決定木
- 適応的 thinking と努力チューニング — effort が実トークン支出にどうマップするか
- プロンプトキャッシング経済学 — Opus 5 の見出し価格を実請求に変えるキャッシュヒットの計算
- 現行モデルと価格 — 常時最新の表。ピンする前にチェック
出典とさらに読む
- Claude Opus 5 の紹介 — Anthropic(2026 年 7 月 24 日) — ローンチ投稿、ベンチマーク表、安全性ノート
- Claude Platform ドキュメント — モデル概要 — 価格表、スナップショット ID、Bedrock/GCP 識別子、努力デフォルト
- 移行ガイド — Opus 4.8 から Opus 5 — 契約変更と自己検証警告の公式リスト
- MarkTechPost — Opus 5 ローンチ報道(2026 年 7 月 24 日) — SWE-bench、ARC-AGI-3、Chartography 数値を含むベンチマーク別内訳
- Interesting Engineering — Opus 5 コーディング報道 — タスクあたりコストの枠付け
- TheNextWeb — Opus 5 ローンチ分析 — リリースケイデンスと Fable 5 比較
- BigGo Finance — Opus 5 価格分析 — fast モード経済学とプロンプトキャッシュ変更
- モデル廃止 — Anthropic — Opus 4.1 引退日と広範なライフサイクルポリシー