Claude ユーザーのための GPT-5.6 と ChatGPT Work
あなたはすでに Claude で考えている。そして 2026 年 7 月 9 日、タイムライン全体がひっくり返った。OpenAI が GPT-5.6 の 3 種類 —— Sol、Terra、Luna ―― と、目標を渡すと数時間バックグラウンドで作業する ChatGPT Work を投入したのだ。チームメイトが「Sol に乗り換えるべき?」と聞いてくる。クライアントは Claude で回しているワークフローの半分を ChatGPT Work に置き換えたがっている。このページはこの発売をあなたの Claude 的なメンタルモデルに写し取り —— そしてより有用なこととして —— ニュース記事が埋没させた部分を掘り出す。実際の価格、正確なベンチマーク差分、誰も予想しなかった 1.05M コンテキスト、そして OpenAI が Anthropic に依然として負けている領域だ。
- 実際に出荷されたものを把握する: Sol、Terra、Luna(および Sol Ultra)。すべて 1.05M トークンのコンテキスト窓を持つ
- OpenAI が公表しなかった読み方でベンチマーク表を読む —— GPT-5.6 が先行する領域と、Claude Fable 5 が依然として勝つ領域
- ChatGPT Work を理解する: チャットモードではなく、完成したスプレッドシート、スライド、ドキュメント、ウェブアプリを数時間後に返してくるバックグラウンドエージェント
- コーディング、エージェント、ブラウザ作業で GPT-5.6 Sol を Claude より優先すべきタイミング —— そして答えが依然として Claude であるタイミング
一文で言うと
GPT-5.6 は GPT-5 ファミリーの 3 ティア刷新 ―― Sol(フラッグシップ)、Terra(中間)、Luna(廉価) ―― で 1.05M トークンのコンテキスト窓 と 128K の最大出力 を共有し、OpenAI が 「エージェンティックコーディングでトークン効率 54% 改善」 と主張している。ChatGPT Work はその上に構築された新しい自律エージェントで、Codex を吸収した統合デスクトップアプリとして提供される。
面白いのはモデル刷新の部分ではない —— そちらは想定内だ。面白いのは 形 だ。OpenAI はいまや モデル + エージェント + IDE を 1 つの製品として出荷しており、主力ティア(Luna は入力 $1 / 出力 $6)を「安価なコーディングモデル」の歴史的な相場より下に価格付けしている。
GPT-5.6 の発売で人が見落とす 3 点
みんなベンチマークの総括を書いている。ここでは、ほとんどの Claude ユーザーが最初の一読で見落とす部分を挙げる。
1. 3 ティアすべてが同じ 1.05M コンテキストを共有する
これは OpenAI の通常の出荷方法ではない。過去の刷新では、廉価ティアには 縮小された コンテキスト窓が付き、上位への誘導装置として使われていた。GPT-5.6 では Sol、Terra、Luna すべてが 1.05M トークンのコンテキストと 128K の最大出力を掲げる ―― 同じ形だ。つまり 入力 100 万トークンあたり $1 / 出力 100 万トークンあたり $6 の Luna は、単発の短いリクエスト用ではなく、実用的な 長文コンテキスト の選択肢となる。RAG パイプライン、リポジトリ全体のレビュー、長いツールループの採算が変わる。高ボリュームな検索業務のために Claude Haiku 系ティアを想定していたなら、Luna は今や自明なクロスチェック先だ。
2. ChatGPT Work は「チャットモード」ではない —— 完成ファイルを渡してくるバックグラウンドエージェントだ
OpenAI の言い回しがそれを物語る。ChatGPT Work とは チャット するのではなく、ブリーフィング する。成果物(「これら 5 社の競合分析を作れ」)を渡し、接続済みのアプリやファイルから文脈を集め、仕事をステップに分解し、数分から数時間、独立して作業して、完成した成果物 —— スプレッドシート、スライド、ドキュメント、レポート、動くウェブアプリ —— を届ける。Codex は同じデスクトップアプリに折り込まれたので、ChatGPT Work がコード記述面も所有する。これは Anthropic が Claude の マネージドエージェント で賭けた「長時間自律動作」と同じ賭けだが、API 先ではなくエンドユーザー製品として先に出荷された。発売当日に Pro / Enterprise / Edu で展開され、Plus と Business は数日以内に続いた。
3. OpenAI 公表ベンチマークでは Sol が勝つ。だが SWE-bench Pro では Claude が依然リード。
マーケティングチャートの奥まで読むと、「Sol が新王者」よりずっと入り混じった絵が見える。OpenAI 自身の数字によると、Sol は Artificial Analysis Coding Agent Index で 80 に達し(Claude Fable 5 に対し約 +2.8)、出力トークン数は 半分未満、コストは およそ 3 分の 1 だという。これは本物の勝利だ。しかし Fable 5 は SWE-Bench Pro で報告上大差でリードしており —— Sol はそこで約 64.6% に留まる —— 発売報道はこれを埋没させがちだ。翻訳: プレスリリースではなくワークロードで選べ。ツールとブラウザ主体の「エージェント指数」的な仕事なら、Sol は今や打ち破るべきモデル。実リポジトリのバグ修正を有意な文脈付きで行うなら、Anthropic に軍配が上がる。
GPT-5.6 ティア表(2026 年 7 月 9 日時点)
| モデル | 入力 $/1M | 出力 $/1M | コンテキスト | 最大出力 | ポジショニング |
|---|---|---|---|---|---|
| Sol | $5 | $30 | 1.05M | 128K | フラッグシップ: 複雑な推論、コーディング、科学、エージェント |
| Terra | $2.50 | $15 | 1.05M | 128K | 「GPT-5.5 の性能を約半分のコストで」—— 日常業務 |
| Luna | $1 | $6 | 1.05M | 128K | 高ボリューム、簡単な仕事; 予算内での長文コンテキスト |
| Sol Ultra | (未公開) | (未公開) | 1.05M | 128K | 一部の公表ベンチマークで使われる Sol の高負荷ティア |
OpenAI が公表したベンチマーク(Sol / Terra / Luna):
- Artificial Analysis Coding Agent Index v1.1: 80 / 77.4 / 74.6
- SWE-Bench Pro: 64.6% / 63.4% / 62.7% (Claude Fable 5 が依然リード)
- Terminal-Bench 2.1: 88.8%(Sol Ultra 91.9%)/ 87.4% / 84.7%
- DeepSWE v1.1: 72.7% / 69.6% / 67.2%
- BrowseComp: 90.4%(Sol Ultra 92.2%)/ 87.5% / 83.3%
- ExploitBench: 73.5% / 52.9% / 33.2%
最後の行 —— ExploitBench —— は凝視する価値がある。Sol → Luna の 73.5% から 33.2% への急落は、リスト上のどのベンチマークよりも鋭い。だからこそ OpenAI は Sol に限ってサイバーセキュリティのストーリーに傾き、連邦当局のレビュー担当者は公開前に追加テストのためモデルを差し止めたのだ。
ChatGPT Work、解剖
Claude から移せるもの(ほぼすべて)
あなたのプロンプティングの直感は依然として通用する。明確な指示、明示的な出力形状、few-shot 例、良い説明文つきでツールをモデルに渡すこと —— すべて移植可能だ。これらは Claude 固有の技ではなく、指示チューニングされたフロンティアモデル全般の性質だから。この議論の深堀りは モデル間でプロンプトを移植する と実用ガイド Claude ユーザーのための ChatGPT を見よ。
乗り換えるときにリセットするもの 2 つ:
- API の形。 Anthropic は
messagesAPI にtoolsブロックを付ける。OpenAI は Chat Completions(または Responses API)でtoolsを使い、OpenAI の関数呼び出しスキーマを取る。考え方は同じだが、ワイヤーフォーマットが違う。 - 推論はスライダーではなくモードだ。 Claude は thinking/effort パラメータを露出する。GPT-5.6 では、廉価版で effort を調整するよりも、正しい ティア(Sol / Sol Ultra)を選ぶことで最も鋭い効果が出る。GPT-5.5 のときよりコストが物を言う。
数行で試す
OpenAI SDK は変わらない —— model を GPT-5.6 の任意バリアントに向けるだけだ:
Python (OpenAI SDK) から GPT-5.6 Sol を呼ぶ
from openai import OpenAI
client = OpenAI() # uses OPENAI_API_KEY
resp = client.chat.completions.create(
model="gpt-5.6-sol", # try gpt-5.6-terra / gpt-5.6-luna to trade cost for quality
messages=[
{"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
{"role": "user", "content": "Compare our 3 largest competitors on pricing, packaging, and 2026 launches."},
],
# tools=[...] # OpenAI-style function/tool schema
)
print(resp.choices[0].message.content)- 複雑なコーディング、エージェントループ、あるいは Claude Opus 系に手を伸ばす場面には Sol。デフォルトの「GPT-5.5 を半額で」的な主力業務には Terra。検索、抽出、分類などの高ボリューム業務には Luna —— 共有された 1.05M コンテキストがおもちゃではない実用的な選択肢にする。
- 終端に定義可能な成果物(スプレッドシート、スライド、レポート、小さなウェブアプリ)があるなら、ChatGPT Work にブリーフして走らせろ。会話や意思決定の補助なら、普通のチャットに留まれ。
- 各ツールを良い製品仕様のように記述する —— 明快な名前、一行の目的、例つきのパラメータ説明。GPT-5.6 は Claude と同じ「後輩に渡すつもりでツールを渡せ」という規律に反応する。
- Sol/Terra/Luna の価格は出力が入力の 6 倍高い。54% の効率主張はまさに *出力* についての話 —— Claude 予算を移す前に、自分のワークロードで検証すること。
GPT-5.6 を Claude より優先すべきタイミング
どちらが厳密に優れているというわけではない。GPT-5.6 を選ぶべきなのは:
- 1.05M コンテキストの $1/$6 ティアが欲しい。 Luna は現在、長文コンテキストでフロンティア級の品質を得る最も安い手段だ。これは新しい能力であり、リブランドではない。
- タスクがブラウザ重視、あるいはエージェント指数型。 BrowseComp と Coding Agent Index は Sol の最強カード。エージェントが大半の時間をブラウザやシェルで過ごすなら、Sol が打ち破るべきモデル。
- エージェントフレームワークを自分で貼り合わせずに、完成したスプレッドシート/スライド/レポート/アプリをエンドユーザー成果物として生む ChatGPT Work の「ブリーフして忘れる」ワークフローが欲しい。
Claude を選ぶべきなのは、モデルの周りのマネージドプラットフォームが欲しいとき ―― プロンプトキャッシング、メモリとコンテキスト編集、マネージドエージェント、コンピュータユース、デスクトップアプリ ―― そして特にワークロードが 実リポジトリのソフトウェアエンジニアリング のとき。Fable 5 は SWE-Bench Pro で依然大差でリードしている。継続する頭対頭比較は Claude, GPT, Gemini for coding、コスト観点は what AI costs across providers を見よ。
Check yourself
0/3ソースと関連資料
- OpenAI が GPT-5.6 で新モデルファミリーを発売 (TechCrunch, 2026 年 7 月 9 日) —— 発売報道: バリアント、価格、ChatGPT Work 展開、「トークン効率 54% 改善」の引用、Fable 5 比較
- OpenAI が 7 月 9 日に GPT-5.6 を公開する許可を得る (Engadget) —— 政府レビュー過程、Center for AI Standards and Innovation、段階展開
- OpenAI が ChatGPT Work 職場 AI エージェントを GPT-5.6 と共に発表 (Forbes) —— Altman の引用、職場ポジショニング、Claude 比較対象
- OpenAI が ChatGPT Work エージェントを発表、複雑なタスクを処理 (Bloomberg) —— 「数時間」自律のフレーミング、Codex 統合
- GPT-5.6: モデル解説、ベンチマーク、アクセス (CometAPI) —— 完全なベンチマーク表(SWE-Bench Pro、Terminal-Bench 2.1、DeepSWE、BrowseComp、ExploitBench、Coding Agent Index)、1.05M コンテキスト / 128K 出力の数値
- AILmanac の関連記事: Claude ユーザーのための ChatGPT · コーディングのための Claude, GPT, Gemini · モデル間でプロンプトを移植する · プロバイダー間の AI コスト · コーディングエージェント CLI 比較