メインコンテンツまでスキップ

Claude ユーザーのための GPT-5.6 と ChatGPT Work

中級

あなたはすでに Claude で考えている。そして 2026 年 7 月 9 日、タイムライン全体がひっくり返った。OpenAI が GPT-5.6 の 3 種類 —— Sol、Terra、Luna ―― と、目標を渡すと数時間バックグラウンドで作業する ChatGPT Work を投入したのだ。チームメイトが「Sol に乗り換えるべき?」と聞いてくる。クライアントは Claude で回しているワークフローの半分を ChatGPT Work に置き換えたがっている。このページはこの発売をあなたの Claude 的なメンタルモデルに写し取り —— そしてより有用なこととして —— ニュース記事が埋没させた部分を掘り出す。実際の価格、正確なベンチマーク差分、誰も予想しなかった 1.05M コンテキスト、そして OpenAI が Anthropic に依然として負けている領域だ。

What you'll learn
  • 実際に出荷されたものを把握する: Sol、Terra、Luna(および Sol Ultra)。すべて 1.05M トークンのコンテキスト窓を持つ
  • OpenAI が公表しなかった読み方でベンチマーク表を読む —— GPT-5.6 が先行する領域と、Claude Fable 5 が依然として勝つ領域
  • ChatGPT Work を理解する: チャットモードではなく、完成したスプレッドシート、スライド、ドキュメント、ウェブアプリを数時間後に返してくるバックグラウンドエージェント
  • コーディング、エージェント、ブラウザ作業で GPT-5.6 Sol を Claude より優先すべきタイミング —— そして答えが依然として Claude であるタイミング

一文で言うと

GPT-5.6 は GPT-5 ファミリーの 3 ティア刷新 ―― Sol(フラッグシップ)、Terra(中間)、Luna(廉価) ―― で 1.05M トークンのコンテキスト窓128K の最大出力 を共有し、OpenAI が 「エージェンティックコーディングでトークン効率 54% 改善」 と主張している。ChatGPT Work はその上に構築された新しい自律エージェントで、Codex を吸収した統合デスクトップアプリとして提供される。

面白いのはモデル刷新の部分ではない —— そちらは想定内だ。面白いのは だ。OpenAI はいまや モデル + エージェント + IDE を 1 つの製品として出荷しており、主力ティア(Luna は入力 $1 / 出力 $6)を「安価なコーディングモデル」の歴史的な相場より下に価格付けしている。

GPT-5.6 の発売で人が見落とす 3 点

みんなベンチマークの総括を書いている。ここでは、ほとんどの Claude ユーザーが最初の一読で見落とす部分を挙げる。

1. 3 ティアすべてが同じ 1.05M コンテキストを共有する

これは OpenAI の通常の出荷方法ではない。過去の刷新では、廉価ティアには 縮小された コンテキスト窓が付き、上位への誘導装置として使われていた。GPT-5.6 では Sol、Terra、Luna すべてが 1.05M トークンのコンテキストと 128K の最大出力を掲げる ―― 同じ形だ。つまり 入力 100 万トークンあたり $1 / 出力 100 万トークンあたり $6 の Luna は、単発の短いリクエスト用ではなく、実用的な 長文コンテキスト の選択肢となる。RAG パイプライン、リポジトリ全体のレビュー、長いツールループの採算が変わる。高ボリュームな検索業務のために Claude Haiku 系ティアを想定していたなら、Luna は今や自明なクロスチェック先だ。

2. ChatGPT Work は「チャットモード」ではない —— 完成ファイルを渡してくるバックグラウンドエージェントだ

OpenAI の言い回しがそれを物語る。ChatGPT Work とは チャット するのではなく、ブリーフィング する。成果物(「これら 5 社の競合分析を作れ」)を渡し、接続済みのアプリやファイルから文脈を集め、仕事をステップに分解し、数分から数時間、独立して作業して、完成した成果物 —— スプレッドシート、スライド、ドキュメント、レポート、動くウェブアプリ —— を届ける。Codex は同じデスクトップアプリに折り込まれたので、ChatGPT Work がコード記述面も所有する。これは Anthropic が Claude の マネージドエージェント で賭けた「長時間自律動作」と同じ賭けだが、API 先ではなくエンドユーザー製品として先に出荷された。発売当日に Pro / Enterprise / Edu で展開され、Plus と Business は数日以内に続いた。

3. OpenAI 公表ベンチマークでは Sol が勝つ。だが SWE-bench Pro では Claude が依然リード。

マーケティングチャートの奥まで読むと、「Sol が新王者」よりずっと入り混じった絵が見える。OpenAI 自身の数字によると、Sol は Artificial Analysis Coding Agent Index で 80 に達し(Claude Fable 5 に対し約 +2.8)、出力トークン数は 半分未満、コストは およそ 3 分の 1 だという。これは本物の勝利だ。しかし Fable 5 は SWE-Bench Pro で報告上大差でリードしており —— Sol はそこで約 64.6% に留まる —— 発売報道はこれを埋没させがちだ。翻訳: プレスリリースではなくワークロードで選べ。ツールとブラウザ主体の「エージェント指数」的な仕事なら、Sol は今や打ち破るべきモデル。実リポジトリのバグ修正を有意な文脈付きで行うなら、Anthropic に軍配が上がる。

GPT-5.6 ティア表(2026 年 7 月 9 日時点)

モデル入力 $/1M出力 $/1Mコンテキスト最大出力ポジショニング
Sol$5$301.05M128Kフラッグシップ: 複雑な推論、コーディング、科学、エージェント
Terra$2.50$151.05M128K「GPT-5.5 の性能を約半分のコストで」—— 日常業務
Luna$1$61.05M128K高ボリューム、簡単な仕事; 予算内での長文コンテキスト
Sol Ultra(未公開)(未公開)1.05M128K一部の公表ベンチマークで使われる Sol の高負荷ティア

OpenAI が公表したベンチマーク(Sol / Terra / Luna):

  • Artificial Analysis Coding Agent Index v1.1: 80 / 77.4 / 74.6
  • SWE-Bench Pro: 64.6% / 63.4% / 62.7% (Claude Fable 5 が依然リード)
  • Terminal-Bench 2.1: 88.8%(Sol Ultra 91.9%)/ 87.4% / 84.7%
  • DeepSWE v1.1: 72.7% / 69.6% / 67.2%
  • BrowseComp: 90.4%(Sol Ultra 92.2%)/ 87.5% / 83.3%
  • ExploitBench: 73.5% / 52.9% / 33.2%

最後の行 —— ExploitBench —— は凝視する価値がある。Sol → Luna の 73.5% から 33.2% への急落は、リスト上のどのベンチマークよりも鋭い。だからこそ OpenAI は Sol に限ってサイバーセキュリティのストーリーに傾き、連邦当局のレビュー担当者は公開前に追加テストのためモデルを差し止めたのだ。

ChatGPT Work、解剖

Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 6

Claude から移せるもの(ほぼすべて)

あなたのプロンプティングの直感は依然として通用する。明確な指示、明示的な出力形状、few-shot 例、良い説明文つきでツールをモデルに渡すこと —— すべて移植可能だ。これらは Claude 固有の技ではなく、指示チューニングされたフロンティアモデル全般の性質だから。この議論の深堀りは モデル間でプロンプトを移植する と実用ガイド Claude ユーザーのための ChatGPT を見よ。

乗り換えるときにリセットするもの 2 つ:

  • API の形。 Anthropic は messages API に tools ブロックを付ける。OpenAI は Chat Completions(または Responses API)で tools を使い、OpenAI の関数呼び出しスキーマを取る。考え方は同じだが、ワイヤーフォーマットが違う。
  • 推論はスライダーではなくモードだ。 Claude は thinking/effort パラメータを露出する。GPT-5.6 では、廉価版で effort を調整するよりも、正しい ティア(Sol / Sol Ultra)を選ぶことで最も鋭い効果が出る。GPT-5.5 のときよりコストが物を言う。

数行で試す

OpenAI SDK は変わらない —— model を GPT-5.6 の任意バリアントに向けるだけだ:

Python (OpenAI SDK) から GPT-5.6 Sol を呼ぶ

from openai import OpenAI

client = OpenAI()  # uses OPENAI_API_KEY

resp = client.chat.completions.create(
  model="gpt-5.6-sol",         # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
  messages=[
      {"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
      {"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
  ],
  # tools=[...]  # OpenAI-style function/tool schema
)

print(resp.choices[0].message.content)
Guided walkthrough1 of 4
  1. 複雑なコーディング、エージェントループ、あるいは Claude Opus 系に手を伸ばす場面には Sol。デフォルトの「GPT-5.5 を半額で」的な主力業務には Terra。検索、抽出、分類などの高ボリューム業務には Luna —— 共有された 1.05M コンテキストがおもちゃではない実用的な選択肢にする。

GPT-5.6 を Claude より優先すべきタイミング

どちらが厳密に優れているというわけではない。GPT-5.6 を選ぶべきなのは:

  • 1.05M コンテキストの $1/$6 ティアが欲しい。 Luna は現在、長文コンテキストでフロンティア級の品質を得る最も安い手段だ。これは新しい能力であり、リブランドではない。
  • タスクがブラウザ重視、あるいはエージェント指数型。 BrowseComp と Coding Agent Index は Sol の最強カード。エージェントが大半の時間をブラウザやシェルで過ごすなら、Sol が打ち破るべきモデル。
  • エージェントフレームワークを自分で貼り合わせずに、完成したスプレッドシート/スライド/レポート/アプリをエンドユーザー成果物として生む ChatGPT Work の「ブリーフして忘れる」ワークフローが欲しい。

Claude を選ぶべきなのは、モデルの周りのマネージドプラットフォームが欲しいとき ―― プロンプトキャッシングメモリとコンテキスト編集マネージドエージェント、コンピュータユース、デスクトップアプリ ―― そして特にワークロードが 実リポジトリのソフトウェアエンジニアリング のとき。Fable 5 は SWE-Bench Pro で依然大差でリードしている。継続する頭対頭比較は Claude, GPT, Gemini for coding、コスト観点は what AI costs across providers を見よ。

Check yourself

0/3
  1. GPT-5.6 の 3 ティアのうち、コンテキスト窓が最も小さいのはどれか?
  2. ChatGPT Work を一行で言うと?
  3. OpenAI 公表ベンチマークのうち、Anthropic の Claude Fable 5 が依然として GPT-5.6 Sol をリードするのはどれか?

ソースと関連資料