メインコンテンツまでスキップ

Claude Opus 5: フィールドガイド

中級

2026 年 7 月 24 日、Anthropic は Claude Opus 5 (claude-opus-5) をリリースしました — Sonnet 5(6 月 30 日)、Fable 5 / Mythos 5(6 月 9 日)に続き、2 か月で 4 番目のモデルです。見出しは意図的に地味です: Opus 4.8 と同じ MTok あたり $5 入力 / $25 出力の価格、同じ 1M コンテキスト、同じ 128k 出力上限。興味深いのは、これらの変わらない数字が今何を買うか: Frontier-Bench v0.1 で 44.4%(Opus 4.8 は 18.7%) で 2 倍以上、SWE-bench Verified で 96.0%、そして ARC-AGI-3 で 30.16% — GPT-5.6 Sol の 7.78% の約 3 倍、Opus 4.8 の 1.52% の約 20 倍。Opus 5 は Claude Max のデフォルトモデルとなり、Claude Pro で利用可能な最強モデルです。

このページは実用フィールドガイド: これらの数字があなたのスタックに実際に何を意味するか、素朴な移行を 400 エラーで壊す 2 つの API 契約変更、Opus 5 が正当に Fable 5 に取って代わる時(そうでない時)、そして新しい xhigh / max 努力段階。

What you'll learn
  • Opus 5 が何か知る: 1M コンテキスト、128k 出力、MTok あたり $5 入力 / $25 出力 — Opus 4.8 と同じ形、実質的に良い数字
  • 素朴な移行を壊す 2 つの API 制約を理解する: 高努力での thinking 無効化の制限、そして max_tokens 予算を食う thinking のデフォルト有効
  • エージェントチームリーダーが読むようにベンチマークを読む — Frontier-Bench、ARC-AGI-3、SWE-bench Pro、OSWorld 2.0 — そしてどれがあなたのワークロードに意味があるか知る
  • 正直な価格計算をする: Opus 5 の max 努力が解決タスクあたりコストで Fable 5 を打ち負かす時、そうでない時
  • 適切な努力段階を選ぶ — 新しい xhigh と max の段階は Frontier-Bench と ARC-AGI-3 で元を取るが、他ではトークンを無駄にする
  • Opus 4.1 → Opus 5 の廃止を 2026 年 8 月 5 日の引退日前に計画する

一段落版

Opus 5 は再価格設定ではなく、価格中立の能力向上です。Opus 4.8 と同じ MTok あたり $5 / $25、同じ 1M トークンコンテキスト、同期 Messages API での同じ 128k 最大出力、2026 年 5 月にシフトした同じ信頼できる知識カットオフ。変わったのはこれらのトークンが何をするか: Frontier-Bench v0.1(Anthropic 自身の最も難しいコーディングエージェント評価)で Opus 5 は xhigh 努力で 44.4% vs Opus 4.8 の 18.7% — 同じ表示価格で 2 倍以上。ARC-AGI-3 では、新規問題解決が 1.52% から 30.16% に跳ね上がる。2 つの契約変更が素朴な移行を壊します: 適応的 thinking がデフォルトで有効で max_tokens 予算を応答と共有し、thinking: {"type": "disabled"} は新しい xhigh または max 努力段階で 400 を返すようになりました。Opus 5 は Claude Max の新しいデフォルト、Claude Pro で利用可能な最強のモデル、そして Claude API、Bedrock(anthropic.claude-opus-5)、Google Cloud(claude-opus-5)、Microsoft Foundry、AWS の Claude Platform 経由で利用可能。

Opus 4.8 に対して実際に変わったこと

Opus 4.8 は 1M コンテキストウィンドウとデフォルト有効の適応的 thinking を持つ最初の Opus として 2026 年 4 月に出荷されました。Opus 5 はこれらのデフォルトすべてを維持するので、ワイヤ上のリクエスト/レスポンス形状はほぼ同一です。動いた 4 つ:

  • 数字。 Frontier-Bench v0.1 は 18.7% から 44.4%(xhigh)/ 43.3%(max)へ。SWE-bench Multimodal は 38.4% から 59.4%。OSWorld 2.0 は 55.7% から 70.57%。Zapier AutomationBench は 17.0% から 26.0%。ARC-AGI-3 は高努力で 1.52% から 30.16%。
  • 新しい max 努力段階xhigh の上に入り、thinking: {"type": "disabled"}xhigh または max で動作しなくなりました(400 エラー)。意図はこれらの段階では明示的に推論の対価を払っているので、静かに無効化するのは好みではなくバグだということ。
  • 自己検証がデフォルト動作になり、プロンプトで促す習慣ではなくなりました。Anthropic の移行ガイドは、手動の「自分の作業をチェックして」指示を削除するよう明示的に警告しています — そうしないと二重検証とトークンの浪費になります。これは Opus 4.8 で動作していたコードを Opus 5 で実行した初日で最もよくある驚きです。
  • プロンプトキャッシングは会話中のツール変更で無効にならなくなりました(ベータ)。エージェントループがステップごとにツールリストをスワップする場合、キャッシュプレフィックスは今や生き残ります。Opus 4.8 では毎回新規書き込みを払っていました。

移行を壊す 2 つの 400 エラー

Guided walkthrough1 of 4
  1. Opus 4.8 では任意の努力レベルで thinking を無効化できました。Opus 5 では thinking: {"type": "disabled"} は high 努力以下でのみ許可されます。xhigh または max とペアにするとハードエラー。常に thinking を無効化するラッパー(応答を簡潔にするためこうするチームもあります)がある場合、努力を high に落とすか、thinking フィールドを削除して適応的 thinking を走らせる。

最小限の安全な移行 — Opus 4.8 から Opus 5

# Before (Opus 4.8) — worked
response = client.messages.create(
  model="claude-opus-4-8",
  max_tokens=4096,
  extra_body={"effort": "max"},
  thinking={"type": "disabled"},           # allowed on 4.8 at any effort
  system="After answering, verify your work step by step.",
  messages=[...],
)

# After (Opus 5) — three edits
response = client.messages.create(
  model="claude-opus-5",
  max_tokens=16384,                        # thinking now shares this budget
  extra_body={"effort": "max"},
  # thinking={"type": "disabled"}          # 400 at xhigh/max — remove it
  system="Answer the question.",           # drop the verify instruction — Opus 5 self-verifies
  messages=[...],
)

実際に重要なベンチマーク

Anthropic はローンチ日に多くの数字を発表しました。3 つは実ワークロードで負荷を担い、1 つはマーケティングのトロフィー、2 つは注意深く読む価値があります — Opus 5 が最上位選択肢でない場所を示すからです。

  • Frontier-Bench v0.1 — 44.4%(xhigh)vs Opus 4.8 の 18.7%。 これは Anthropic の最も難しいエージェンティックコーディング評価 — モデルがツールを実行し、反復し、自己修正する必要がある長期タスク。同じ価格で 2.4 倍のジャンプが、移行の最強の単一理由です。
  • SWE-bench Verified — 96.0%。 天井近く。SWE-bench 風のバグ修正で Opus 4.8 または Fable 5 を使っていたなら、Opus 5 は直接のアップグレード。しかし SWE-bench Verified は現在飽和したベンチマークで、小さな差はもうモデルを区別しません。
  • OSWorld 2.0 — 70.57% vs Opus 4.8 の 55.7%。 コンピュータ使用ベンチマーク。Claude for Chrome、Claude Cowork のブラウザモード、または実 UI をクリックする他の何かを実行しているなら、これが監視すべき数字。
  • ARC-AGI-3 — 30.16%(高努力)vs GPT-5.6 Sol の 7.78% と Opus 4.8 の 1.52%。 マーケティングトロフィー。ARC-AGI-3 は記憶に抵抗する新規問題解決をテストし、Opus 5 は次点モデルの約 3 倍。ワークロードに実際の新規性があるなら意味のあるシグナル。インターネットがすでに解決したものの変種なら意味は薄い。
  • SWE-bench Pro — 79.2% vs Fable 5 の 80.0%。 より難しい SWE-bench Pro では Fable 5 が Opus 5 を 0.8pp 上回ります。ほとんどのチームにとって Fable 5 の 2 倍の価格を正当化するには不十分ですが、コード複雑性の上位 10 パーセントにいてすべてのポイントが重要なら注意。
  • サイバーセキュリティ攻撃 — Opus 5 は Mythos 5 の後ろ。 Anthropic は Opus 5 が最上位のサイバーモデルではないと明示。Project Glasswing 経由で防御的サイバー作業をしているなら、まだ Mythos が選択肢。

Opus 5 が Fable 5 に取って代わる時(そうでない時)

このローンチが強いる興味深い質問: いつ実際に Fable 5 の $10 / $50 の価格が必要か? Anthropic 自身の主張は、Opus 5 が CursorBench 3.2 で Fable 5 のピークの 0.5% 以内に、半分のコストで到達し、OSWorld 2.0 の結果を「わずか 3 分の 1 強のコスト」で一致させるということ。それが強い版の議論。正直な版:

  • Opus 5 を選ぶ — エージェンティックコーディング、コンピュータ使用、ビジネス自動化、生命科学推論、そしてコストあたり解決タスクが最後の 1〜3pp の質より重要なあらゆることに。これは本番ワークロードの 90% 超。
  • Fable 5 を選ぶ — ワークロードが (a) 境界の実行が最後のパーセントから真に恩恵を受ける長期実行エージェント(Anthropic は Fable 5 を「長期実行エージェント向けの次世代インテリジェンス」と枠付け)、(b) 実ギャップを測定した SWE-bench Pro 風の難しいコードタスク、または (c) 2 倍のコストが実際の質を買う精度対コスト曲線内にすでにいるワークロード。
  • Mythos 5 を選ぶProject Glasswing 経由の招待制防御的サイバーに。

正直な解決タスクあたりコスト計算

# Fable 5 on a hard agentic task
#   ~500k input tokens, ~50k output tokens
#   500 * $10/M + 50 * $50/M = $5.00 + $2.50 = $7.50 per run
#   Fable 5 solve rate: ~46% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $7.50 / 0.46 = ~$16.30

# Opus 5 on the same task
#   Same token budget
#   500 * $5/M + 50 * $25/M = $2.50 + $1.25 = $3.75 per run
#   Opus 5 solve rate: ~44.4% (Frontier-Bench v0.1, xhigh)
#   Cost per solved task: $3.75 / 0.444 = ~$8.45

# Opus 5 wins on cost-per-solved-task by ~48% at near-parity quality.
# Break-even: Fable 5 would need to be 2x cheaper per successful run,
# i.e. Opus 5 would have to drop below ~23% solve rate for Fable 5 to win.

新しい max 努力段階 — いつ元を取るか

Opus 5 は maxxhigh の上の明示的な段階として導入します。適応的 thinking は今や low → medium → high → xhigh → max にわたり、high が Claude API と Claude Code のデフォルト。ローンチベンチマークからの 2 つの観察:

  • Frontier-Bench v0.1 では、xhigh は実際に 44.4% を記録し、max は 43.3% — max は厳密に良いわけではない。試行あたりより多くのトークンを燃やすが、追加の推論はこの評価では必ずしも変換しない。
  • 長い熟考を報いるタスク — ARC-AGI-3、新規研究問題、難しい数学的推論(IMO 2026 金メダルレベル、42/42) — では、高い段階は元を取ります。

実用ルール: デフォルトは high、評価が測定可能な利得を示す場合に xhigh に移動、max は推論深度がスループットより重要と検証したワークロードでのみ使う。 max を設定して希望しない。測定する。

生命科学、安全性、サイバー姿勢

固定する価値のある 3 つの数字:

  • 生命科学。 Opus 5 は Opus 4.8 に対して有機化学で +10.2 パーセンテージポイント、タンパク質予測で +7.7pp。構造生物学、バイオインフォマティクス、または合成計画のエージェントを構築しているなら、これは実ジャンプ — ノイズ内の改善ではない。
  • プロンプトインジェクション耐性。 Gray Swan ベンチマークで攻撃者成功率は Opus 4.8 の 5.5% から 2.0% に低下。Claude Cowork ブラウザ環境では、自動モードの保護策がブラウザプロンプトインジェクション成功率を Anthropic の測定で 0% に。Claude-for-Chrome 風エージェントを出荷している人には意味がある。
  • サイバー分類子。 Opus 5 のサイバー保護策は Fable 5 より約 85% 少ない頻度で介入する — Opus 5 は意図的に最上位のサイバーモデルではないので、介入率が抑えられている。Fable 5 で正当なセキュリティ研究プロンプトに偽陽性の安全拒否を見ていたなら、Opus 5 は明らかに引き金が緩く感じられるでしょう。

計画すべき廃止タイムライン

  • **Opus 4.1(claude-opus-4-1-20250805)**は 2026 年 8 月 5 日に引退 — Opus 5 ローンチから 11 日。本番の何かがまだ Opus 4.1 をピンしているなら、今週移行する。
  • Opus 4.5 / 4.6 / 4.7 / 4.8 はプラットフォーム概要で「レガシーモデル」として利用可能なままだが、標準の 12 か月廃止サイクルを予想する。新しいものは Opus 5 を移行ターゲットとして扱う。
  • Opus 5 のモデル ID はピンされたスナップショットで、常緑ポインタではない。4.6 世代から、日付なし ID 形式もまだ「固定スナップショット」を意味する。将来の claude-opus-5-1 は新しい ID で、claude-opus-5 の静かなアップグレードではない。

試す — 1 コマンド

推奨デフォルトで Opus 5 を実行

# Python — Claude SDK
from anthropic import Anthropic
client = Anthropic()

response = client.messages.create(
  model="claude-opus-5",
  max_tokens=8192,                    # room for adaptive thinking + response
  extra_body={"effort": "high"},      # default; move to xhigh only if evals justify
  system="You are a senior engineer. Answer directly and iterate until the task is complete.",
  messages=[{"role": "user", "content": "..."}],
)

# Claude Code
claude --model claude-opus-5

# For fast mode (2.5x speed, 2x cost)
# model="claude-opus-5-fast"  # separate model ID, $10/$50 per MTok

チートシート

Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 8

理解を確認する

Check yourself

0/5
  1. `model="claude-opus-4-8"`、`effort: "max"`、`thinking: {"type": "disabled"}` をピンしていたラッパーを Opus 5 に移行します。何が起きますか?
  2. Opus 4.8 のプロンプトが「今、あなたの答えをステップごとに検証して」で終わります。Opus 5 にスワップすると、難しいプロンプトで thinking トークンコストがおおよそ 2 倍。なぜ?
  3. 解決率が重要でコストが実制約の本番エージェンティックコーディングワークロードで、Opus 5 のローンチデータが最も強く支持するモデルは?
  4. `xhigh` より厳密に良い質を期待して、すべてのリクエストで `effort: "max"` を設定します。Anthropic のローンチデータは何を示唆しますか?
  5. Opus 5 ローンチ後に計画すべき廃止日は?

次はどこへ

出典とさらに読む