AI Models & Assistants
Claude is our core — but the same skills travel. This section widens the lens to the whole AI world: the major assistants, how they differ, when to use which, and the techniques that transfer across all of them.
- Pick the right model for a job without re-learning the field every time
- Move between assistants — ChatGPT, Gemini, Grok, open models — without losing your technique
- Run capable models on your own machine, and know when that is worth it
- Combine Claude with local models and agent frameworks
Start here
If you read one page in this section, read this one. Everything below is a branch off it.
- How to choose a model — a durable framework that outlives any particular release.
Then follow whichever thread matches what you are doing.
The current flagships
The two September 2026 releases at the top of both stacks, read side by side.
- Claude Fable 5.1: what changed and how to migrate — three breaking changes, five betas, cache reads at a quarter of the price
- GPT-6 Astra: the field guide for Claude users — same list price, different bill, Critical-tier cyber classification
Coming from another assistant
You already know one tool and want your habits to carry over.
- ChatGPT for Claude users
- Gemini for Claude users
- Grok for Claude users
- Porting prompts across models — what transfers, what breaks
Comparing before you commit
- Claude vs GPT vs Gemini for coding
- Reasoning models compared
- What AI costs across providers
- Generative media: image, audio, video
Running models yourself
Local models trade some capability for privacy, cost control, and working offline. These pages cover when that trade is worth making.
- Run models locally with Ollama — the practical starting point
- Why a 35 KB system prompt breaks on a local model — context budgets, Ollama's silent middle-of-prompt truncation, and the failure signals to watch
- DeepSeek, Qwen & the open models
- DeepSeek V4-Flash-Vision: first native-vision frontier open weight
- Colibrì: run a 744B MoE from your SSD — expert streaming on 16–32 GB machines, and what it really costs in tok/s
- A private local AI stack
- Claude plus local models — using both, deliberately
Agents beyond Claude
- Local AI agents
- Open-source agent frameworks
- Claude, MCP and local tools
- A2A: the agent-to-agent protocol
- Agent payments: x402, MPP and AgentCore GA — how agents actually pay for things now
- OpenAI Agents API vs Claude Managed Agents — the two hosted agent loops side by side: permissions, vaults, budgets, network policy, sandbox cost
Everything in this section
The full list, including pages added since this index was written.
AI Models & Assistants
Claude is the core here, but the same skills travel. Start with how to choose, then go as deep as you need on any assistant, on running models locally, or on agents.
AIモデルの全体像:Claude、ChatGPT、Gemini、オープンモデルから選ぶ
タスクに合った最適なAIモデルを選ぶための、長く使える枠組み — Claude、ChatGPT、Gemini、Llama、Mistral、Grok、そしてオープン/ローカルモデルにわたって。さらに、すべてに共通して通用するスキルとは何か。
Claude Fable 5.1: What Changed and How to Migrate
Anthropic shipped Claude Fable 5.1 and Mythos 5.1 on September 1, 2026: same $10/$50 price, cache reads cut to $0.25, three breaking API changes (forced tool_choice errors, one-way thinking blocks, append-only history) and five additive betas. The migration field guide for anyone pinning claude-fable-5 or claude-opus-5.
Claude Fable 5 と Mythos 5: フラッグシップフィールドガイド
Fable 5 は Anthropic の最も高性能なモデル。API はインバンドで拒否し(HTTP 200, stop_reason: refusal)、adaptive thinking のみ、生の thinking は決して返しません。トップティアモデルを固定するなら、統合の書き方が変わります。Opus 4.8 との使い分け、フォールバックパターン、プロンプトの変化を解説。
Claude Opus 5: フィールドガイド
Opus 5 は 2026 年 7 月 24 日に Anthropic の 2 か月で 4 番目のモデルとして出荷 — Opus 4.8 と同じ $5/$25 の価格ながら Frontier-Bench スコアは 2 倍以上、ARC-AGI-3 は次点モデルの 3 倍、新しい xhigh/max 努力段階を追加。重要なベンチマーク、素朴な移行を壊す 2 つの 400 エラー、スタックで Opus 5 が Fable 5 に取って代わる時。
Claude Sonnet 5: フィールドガイド
Sonnet 5 は Claude Code の新しいデフォルトであり、Sonnet 4.6 のドロップイン後継モデルです。ただし、移行時に 400 を返す 3 つの API 制約と、新しいトークナイザーが同じテキストで約 30% 多くのトークンを生成します。価格計算、effort の再マッピング(Sonnet 5 medium ≈ Sonnet 4.6 high)、そしてチームがつまずくプロンプトの変化を解説します。
Claude ユーザーのための ChatGPT
Claude を使いこなしているけれど ChatGPT を使う必要がある人へ。重要な違い、そのまま通用するもの、そしてどちらをいつ選ぶか。
Claude ユーザーのための GPT-5.6 と ChatGPT Work
OpenAI は 2026 年 7 月 9 日に GPT-5.6 ファミリー(Sol、Terra、Luna)と ChatGPT Work を投入した。Claude ユーザーにとって実際に変わったこと —— 1.05M コンテキスト、$1 ティア、数時間稼働するエージェント、そして誰も書いていない発売の側面。
GPT-5.6 2026年8月アップデート:エフォート・スライダー、無料版のThinkボタン、そして272Kの価格クリフ
2026年8月6日、OpenAIはGPT-5.6のミッドサイクル・アップデートを出荷した。多くの記事は『Solが賢くなった』の一言で片付けたが、本当の話はもっと具体的だ。リクエストの単価を左右する6段階のエフォート制御、無料ユーザー向けのThinkボタン、コール全体を再課金する272Kトークンの価格クリフ、そしてSolでのみ動く新しいFastモード。それぞれがClaudeユーザーに何を意味するか。
OpenAI Astra: プレビュー・フィールドノート
OpenAI の『次の主要モデル』Astra は 2026 年 8 月 1 日にプレビュー公開され、Lean で検証された 10 本の数学証明とほぼ皆無の製品仕様が示された。何が実際に確認済みで、何が未定か、そして Claude ユーザーは待つべきか — 情報源付きの率直な見解。
Codex Agent Plugins とカタログ連合 (v0.147.0): 実践ガイド
2026年8月7日、OpenAI は Codex CLI v0.147.0 をリリースした。Skills を四層カタログ付きの可搬な Agent Plugins に変え、名前とは裏腹の挙動を持つ --approve-for-me フラグを導入し、--full-auto をひっそりと削除し、MCP 2026-07-28 をオプトインにする。各要素が実際に何をするのかを、Claude ユーザー向けに整理する。
ChatGPTでサインイン
OpenAIの新しいアイデンティティ層、リリース3日目。実際にどのデータが境界を越えるのか、エンタープライズ管理者が何をできるのか、そして意図しない足場をOpenAIに与えずに自社アプリで受け入れる方法。
Ollama でローカルに AI モデルを動かす
オープンウェイトモデル(Llama、Mistral、Qwen…)を Ollama で自分のマシン上で動かす — プライベート、オフライン、無料で実行可能。セットアップ、CLI、コードからの呼び出しまで。
コーディングにおけるClaude vs GPT vs Gemini
コーディング向けのフロンティアモデルを選ぶための枠組み(ランキングではない)——重要な要素と、なぜ自分のリポジトリでの評価があらゆるベンチマークに勝るのか。
コーディングエージェントCLI比較
Claude Code、Codex CLI、Gemini CLI、そしてオープンソースのターミナルエージェント — なぜモデルだけでなくハーネスが結果を左右するのか、そしてAGENTS.mdで設定をポータブルに保つ方法。
Supabase Evals — 実バックエンドのエージェントベンチマーク
Supabase は、Claude Code、Codex、OpenCode を実際のコンテナ化された Supabase スタックに対して実行するベンチマークをオープンソース化した — モックではない。何を測るのか、モデルが実際にドキュメントとスキルをどう使うかについて何を見出したのか、そして一晩でローカル実行する方法。
Apple Foundation Models 3 と Claude ユーザーのためのオンデバイス LLM スタック
Apple の第3世代 Foundation Models(AFM 3)が WWDC 2026 で登場。3B のオンデバイス密モデル、iPhone で動作する 20B のスパース MoE、そして独自の LLM プロバイダ(Claude を含む)を持ち込める Swift ネイティブなフレームワークが揃った。実際に出荷されたもの、目立たない仕組み、そして Claude アプリを出荷する開発者にとってオンデバイスの物語がどう変わるかを解説する。
Claude ユーザーのための Gemini
Claude には慣れているが、Google の Gemini が必要? 重要な違い — Gems、Workspace 連携、巨大なコンテキスト、マルチモーダル — と、そのまま使えるもの。
Claude ユーザーのための Gemini 3.6 Flash・Flash-Lite・Flash Cyber
2026年7月21日、Google は Gemini 3.5 Pro を完全にスキップして、代わりに3つの Flash 系モデルを出荷した。実際の価格、実際のベンチマーク、移行時の落とし穴、そして多くの解説記事が見落としている部分 — V8 のバグ発見で Claude Opus 4.6 を上回ったセキュリティ向けファインチューンを含めて。
Gemini 3.7 Flash for Claude Users: Coding-Agent Workhorse at Half Price (Aug 2026)
On 13 August 2026, three weeks after 3.6 Flash, Google shipped Gemini 3.7 Flash at half the introductory price with a 16-point DeepSWE jump. The gotchas most write-ups skip: an expiring intro price, a 3× throughput advantage that matters for agent loops but not chat, and where it still trails Claude Sonnet 5.
Claude ユーザーのための Grok
Claude には慣れているが、xAI の Grok が必要? 重要な違い — リアルタイムの X/ウェブ検索、OpenAI 互換 API、そして Grok Build コーディングエージェント — と、そのまま活かせるすべて。
Muse Code + Muse Spark 1.2: Meta のターミナル・コーディングエージェント
2026 年 8 月 5 日、Meta はターミナル・コーディングエージェントの Muse Code と、それと共に共同学習されたモデル Muse Spark 1.2 を出荷した。追記専用イベントログが実際に何をもたらすのか、なぜ contributor ティアが標準ティアより 12.5 倍安いのか、Terminal-Bench 2.1 で Claude Code とどう並ぶのか、そしてどのエージェントを使うにせよ盗む価値のある同梱スキル 3 つ。
オープンソースのAIエージェントフレームワーク
LLMエージェントを構築するための主要なオープンフレームワーク — LangGraph、LlamaIndex、AutoGen、CrewAI、そして最小ループのアプローチ — をプロバイダーに依存しない形でマッピングし、選び方を解説します。
ネイティブなマルチエージェントAPI:OpenAIのResponsesマルチエージェントベータ vs 自作
2026年7月9日、OpenAIはResponses APIのマルチエージェントベータとSol Ultra Modeを出荷した — フロンティアベンダーで初めて『モデルが1回のHTTPリクエスト内でN個のサブエージェントを生成・統合する』ことをファーストクラスのプリミティブにした。実際に何が出荷されたか、APIの形、コスト計算、Anthropicが代わりに提供するもの、そしてネイティブプリミティブがDIYのファンアウトに勝つ場面。
A2A:エージェント間プロトコル
MCPはエージェントをツールに接続します。A2Aはエージェントを他のエージェントに — フレームワーク、クラウド、企業を越えて — 接続します。Agent Card、タスク、8つのライフサイクル状態、ストリーミングとwebhookの違い、そしてA2AがどのようにMCPと構成されるかを学びます。
エージェント決済:x402、MPP、AgentCore GA
AI エージェントが実際にどう支払いを行うのか — x402 の HTTP-402 プロトコル、exact/upto/batch-settlement スキーム、ファシリテーター、Amazon Bedrock AgentCore Payments の 2026 年 8 月 GA(決済セッション、Coinbase Bazar MCP、Stripe Privy、Machine Payment Protocol)、そしてウォレットを自作せずにペイウォールや支出するエージェントを追加する方法。
モデル間でプロンプトを移植する
Claude、GPT、Gemini、オープンモデルの間でプロンプトを移す — きれいに引き継げる部分、モデルごとに調整すべき部分、そして移行ワークフロー。
モデルルーティングパターン:カスケード、分類器、そして実際に本番投入されるもの
各リクエストを適切な AI モデルへ送るための設計パターン——ルールベース、分類器、複雑度、カスケード、アンサンブル、フォールバック。それぞれの使いどころ、失敗のしかた、そして 2026 年に実際に本番投入されているレシピ。
DeepSeek、Qwen、そしてオープンウェイトの波
強力なオープンウェイトモデル(DeepSeek、Qwen、Llama、Mistral)が差の多くを埋めた。「オープンウェイト」の意味、クローズドなフロンティアモデルとのトレードオフ、そしてそれらの使い方。
Qwen3.8-Max:初のオープンウェイトMaxクラスモデル(重みが公開されたら)
2026年8月3日、AlibabaのQwen3.8-MaxはAPI専用で公開された。2.4TパラメータのMoE(アクティブ95B)、1Mコンテキスト、OpenAI/Anthropic両仕様のAPI、OSWorldでGPT-5.6 Sol Maxを上回るベンチマーク。何が本当に新しいのか、Hugging Faceのページが空のときの『オープンウェイト』とは何を意味するのか、そしてセルフホスティングを高くつかせるスパース性の計算。
DeepSeek V4-Flash-Vision: First Native-Vision Frontier Open Weight
On Aug 31 2026 DeepSeek open-sourced V4-Flash-Vision-Exp — a 305B MoE that adds native vision to V4-Flash without hurting text agent scores, matches or beats Claude Opus 4.8 on ApexBench / Agents' Last Exam / ZeroBench at a fraction of the price, and ships MIT. The specific numbers, the hard 384-token-per-image cap most guides ignore, and the concrete way to run it.
Claude ユーザーのための Kimi K2
Claude を使いこなしていて、Moonshot の Kimi K2 が気になる? Claude Code をそのまま向けられるオープンウェイトのエージェント特化モデル——Moonshot が Anthropic 互換エンドポイントを提供しているからこそ実現する。本当に違う点と、そのまま活かせる点を整理する。
GLM-5.2:オープンウェイト・フロンティアのコーディングモデル
Z.ai の 753B MoE(~40B アクティブ)、1M トークンコンテキスト、MIT ライセンス — 長ホライズンのコーディングで Claude Opus 4.8 の 1 ポイント差まで迫り、API コストは約 6 分の 1。IndexShare が実際に何をするか、ローカルで動作させる方法、実世界で Claude Code に勝つ場面。
Inkling: Thinking Machines のオープンウェイトモデル
Mira Murati 率いる Thinking Machines Lab が Inkling を公開 — 9,750億パラメータ、Apache 2.0、連続的な思考エフォート・ダイヤルを備えたマルチモーダル MoE。ローンチ報道が取り違えた点、意図的にベンチマークで負ける理由、そしてエフォートつまみの実体。
Kimi K3:世界最大のオープンウェイトモデル
Moonshot AIによる2.8兆パラメータのオープンウェイトモデルは、多くのベンチマークでClaude Opus 4.8を上回り、Frontend Code Arenaで首位に立った。何がアーキテクチャ的に異なるのか、キャッシュヒット価格でコストの計算がどう反転するのか、そして本当に手を伸ばす価値があるのか。
Kimi K3をローカルで動かす:vLLM、DSpark、そして本当のハードウェア請求書
2026年、Moonshotの2.8Tオープンウェイト Kimi K3 をセルフホストするための決定版の実践ガイド。DSpark投機的デコードが実際に何をするか、最低限必要なハードウェア(1× DGX B300 または 16× DGX Spark)、正確なvLLMサーブコマンド、誰も警告しないプリフィル/デコードの非対称性、そしてホスト型推論が自分のラックより安くなるのはいつか。
Grok Build の内側:オープンなエージェントハーネスを読む
xAI は自社のコーディングエージェントの Rust ソース全体を Apache 2.0 で公開した — エージェントループ、ツール層、TUI、拡張システム。クレート構成がエージェント構築について教えてくれること、ここでの「オープンソース」がなぜ source-available を意味するのか、そしてツリーに残るデータコレクターのコードが物語ること。
Poolside Laguna:クラスを超える性能を発揮するオープンウェイトのコーディングモデル
Poolside AI の Laguna ファミリー(XS 2.1、S 2.1、M.1)——アクティブパラメータ 3B〜23B、100 万トークンのコンテキスト、OpenMDW-1.1 ライセンスを持つ MoE コーディングモデル。8B アクティブの S 2.1 が実際に何を打ち破るのか、3B アクティブの XS 2.1 が MacBook で動く理由、初めてとされる FP8 での RL 学習パイプライン、そして Claude、GLM-5.2、Kimi K3 より Laguna を選ぶべきタイミング。
生成メディア: 画像・音声・動画AI
テキストチャットの先へ — 画像、動画、音声、音楽のためのAIの地図: 主要なツール、長く使えるスキル、そして重要な権利と倫理。
MiniMax H3 (Hailuo 3.0): オープンウェイトのオムニ動画モデル
MiniMax は 33B の単一ストリーム Transformer をオープンソース化し、ネイティブなステレオ音声付きの 4〜15 秒の 2K 動画を 1 パスで生成します。ライセンスは US/EU/UK/韓国での自前ホスティングを静かにブロックし、オープンなベースは 768p (2K ではない) で、33B パラメータのうち約 13B は推論時にスキップできる AdaLN 分岐です。H3 が実際に何なのか、コストはいくらか、そしてクローズドな動画 API を打ち負かすのはいつなのか。
AIの本当のコスト(プロバイダー横断)
プロバイダーを横断してAIコストを比較するための、長く使えるフレームワーク。価格設定のアーキタイプ、ワークロードの見積もり方、請求額を削るレバー、そしてオープン/ローカルが勝つ場面。
AIエージェントがトークンを浪費する理由(そして請求額を抑える方法)
エージェント実行はチャットの50〜1000倍のコストがかかる — モデルが劣っているからではなく、コンテキストの雪だるま式増加のせいだ。そのメカニズム、意外な数字、そしてClaude・GPT・Gemini・オープンモデルを通じて請求額を実際に削減する4つのレバー。
ローカルAIエージェントを構築する
ローカルのオープンウェイトモデルを使って、自分のマシン上で完結して動作する自律エージェント — プライベートで、オフラインで、無料で動かせる。そのアーキテクチャ、トレードオフ、そして始め方。
Claude + ローカルモデル: ハイブリッドパターン
Claude とローカルのオープンウェイトモデルを連携させる — ルーター、ドラフト後リファイン、プライバシー編集、一括前処理 — フロンティアの推論力をローカルのプライバシーとコストで手に入れる。
AIゲートウェイ:LiteLLM、OpenRouter、Portkey、Vercel
本番のAIゲートウェイは、アプリと全モデルの間に欠けていたルータだ — Claude、GPT、Gemini、Llama を一つにまとめる。LiteLLM、OpenRouter、Portkey、Vercel AI Gateway を比較し、Claude Code を自前のプロキシ経由に配線する。
ローカルコーディングエージェント(とClaudeとの組み合わせ方)
あなたのマシン上で動作しリポジトリを編集するコーディングエージェント — Aider、Cline、Continue、OpenHands、Claude Code — 品質を求めるならClaude、プライバシーを求めるならローカルモデルで動かす。
MCP で Claude をローカルのツールやエージェントに接続する
Model Context Protocol を使えば、Claude は自分のマシン上でプライベートに動くツール・データ・エージェントをオーケストレーションできます — Claude を頭脳に、ローカルの能力を手足にする相乗効果。ローカル MCP サーバーを追加するか、自分で構築しましょう。
プライベートなローカルAIスタックを構築する(エンドツーエンド)
すべてを結びつける: ローカルモデル(Ollama)+ モデル非依存のエージェント + ローカルMCPサーバー経由のツール — Claude をオプションのスマートレイヤーとして備えた、自分のマシン上で動くプライベートアシスタント。
ローカルエージェントか Claude か:意思決定ガイド
完全ローカルエージェント、Claude 駆動、それともハイブリッド? それを決める要因 — プライバシー、タスクの難易度、コスト、レイテンシ、信頼性 — と、なぜハイブリッドがしばしば勝つのか。
ローカル & ハイブリッドエージェントのセキュリティ
ファイルを編集しコマンドを実行できるエージェントは強力で危険でもある。最小権限、サンドボックス化、人間による承認、プロンプトインジェクション対策、予算上限——エージェントを安全に動かす方法。
推論モデルの比較
Claude、GPT、Gemini、DeepSeek、Qwen にまたがる思考バジェットと推論エフォート — いつ思考にトークンを使い、いつ使わないか。
全二重音声AI:なぜ音声エージェントは突然本物になったのか
GPT-Liveと新しい音声ネイティブモデルは、聞くのと話すのを同時に行う。全二重が何を変えるか、どう機能するか、そして今の音声AIの状況。
Opus と Sonnet の Claude 音声(2026 年 7 月): 推論優先の音声 vs GPT-Live
Anthropic は 2026 年 7 月 23 日に Claude 音声を Opus、Sonnet、コネクトアプリに開放 — しかしターンベースのスタックは維持。実際に何が変わったか、通話中にモデルを切り替える時、そして OpenAI の全二重 GPT-Live との設計上の賭けの違い。
トークン速度:なぜAI推論は突然10〜15倍速くなったのか
ウェハースケールチップとLPUが、毎秒数百トークンでフロンティアモデルを提供している。推論速度を実際に制限するもの、新しいハードウェアレース、そして高速トークンがエージェント・音声・推論をどう変えるか。
コンピュータ操作エージェント比較
Claude、GPT、Gemini はいまやどれも画面を操作できる — しかしそれぞれ異なるアクション空間、座標契約、安全ゲートを公開している。実際に何が壊れるか、そしてそれを生き延びるループの作り方。
AIエージェント向け共有ログインブラウザ:ego lite パターン
新しいクラスのブラウザ — その最高の代表である ego lite は 2026年7月24日に GitHub Trending で 1 位を獲得した — が、Claude Code、Codex、Cursor、その他あらゆるコーディングエージェントに、あなたの実際のログインを継承する隔離された Chromium セッションを駆動させる。Spaces とセマンティックスナップショットが実際に解決するもの、エージェント作業で Playwright を下回る理由、自律プロセスとセッションクッキーを共有するセキュリティコスト。
Cloudflare Kitesurf:AI エージェント(人間ではなく)のために作られた初のブラウザランタイム
2026 年 8 月 6 日、Cloudflare は Kitesurf をリリースしました。Workers 上の V8 isolate だけで動くステートレスなエージェントファーストのブラウザです。一般的なエージェントタスクで Chromium より CPU とメモリを 3〜7 倍少なく使い、その代償として実時間は約 1.7 倍かかります。Rust で書かれ、Firefox の CSS パーサー(Stylo)と Blitz レンダリングエンジンを使い、Chrome DevTools Protocol 経由で Puppeteer/Playwright とそのまま互換です。このページでは、何が変わったのか、ヘッドレス Chrome の代わりにいつ選ぶべきか、Claude Code / Codex / MCP クライアントにどう組み込むか、そして現時点でまったくできない 4 つのことを解説します。
SKILL.md:エージェント横断のオープン標準
1 つの SKILL.md ファイル、32 のエージェント。Agent Skills オープン標準の実体、progressive disclosure が context を安く保つ仕組み、可搬性を壊すもの、そして Claude Code / Codex / Gemini CLI / Cursor で無改変で動くスキルの書き方。
Colibrì: Run a 744B MoE From Your SSD (and What It Really Costs You)
Colibrì is a pure-C, zero-dependency engine that runs GLM-5.2 (744B), Kimi K3 (2.8T), DeepSeek V4.1 Flash and six other frontier MoE models on a 16–32 GB machine by keeping the dense layers in RAM and streaming the routed experts from NVMe. This page explains the memory hierarchy, the numbers that decide whether it is usable for you (0.05 to 6.8 tok/s), the SSD-wear and speculative-decoding gotchas, and the exact commands to get a first token.
OpenAI Agents API vs Claude Managed Agents: The Hosted Agent Loop, Compared
On September 10, 2026 OpenAI put the Codex harness behind a single API call: the Agents API public beta — durable sessions, hosted or self-hosted sandboxes, automatic compaction, tool search, subagents. Anthropic has run the same shape since April as Managed Agents. Both use the same four primitives; they differ on permissions, secrets, budgets, network policy and what the sandbox costs. The side-by-side, the request shapes, the six gotchas, and when to pick which.
Why a 35 KB System Prompt Breaks on a Local Model
Moving a big Claude/GPT system prompt to Ollama or another local runtime: the context-budget math, Ollama's silent middle-of-prompt truncation, the failure signals of context exhaustion, and the restructuring that actually works.