AIモデルの全体像:Claude、ChatGPT、Gemini、オープンモデルから選ぶ
タスクに合った最適なAIモデルを選ぶための、長く使える枠組み — Claude、ChatGPT、Gemini、Llama、Mistral、Grok、そしてオープン/ローカルモデルにわたって。さらに、すべてに共通して通用するスキルとは何か。
Claude Fable 5 と Mythos 5: フラッグシップフィールドガイド
Fable 5 は Anthropic の最も高性能なモデル。API はインバンドで拒否し(HTTP 200, stop_reason: refusal)、adaptive thinking のみ、生の thinking は決して返しません。トップティアモデルを固定するなら、統合の書き方が変わります。Opus 4.8 との使い分け、フォールバックパターン、プロンプトの変化を解説。
Claude Opus 5: フィールドガイド
Opus 5 は 2026 年 7 月 24 日に Anthropic の 2 か月で 4 番目のモデルとして出荷 — Opus 4.8 と同じ $5/$25 の価格ながら Frontier-Bench スコアは 2 倍以上、ARC-AGI-3 は次点モデルの 3 倍、新しい xhigh/max 努力段階を追加。重要なベンチマーク、素朴な移行を壊す 2 つの 400 エラー、スタックで Opus 5 が Fable 5 に取って代わる時。
Claude Sonnet 5: フィールドガイド
Sonnet 5 は Claude Code の新しいデフォルトであり、Sonnet 4.6 のドロップイン後継モデルです。ただし、移行時に 400 を返す 3 つの API 制約と、新しいトークナイザーが同じテキストで約 30% 多くのトークンを生成します。価格計算、effort の再マッピング(Sonnet 5 medium ≈ Sonnet 4.6 high)、そしてチームがつまずくプロンプトの変化を解説します。
Claude ユーザーのための ChatGPT
Claude を使いこなしているけれど ChatGPT を使う必要がある人へ。重要な違い、そのまま通用するもの、そしてどちらをいつ選ぶか。
Claude ユーザーのための GPT-5.6 と ChatGPT Work
OpenAI は 2026 年 7 月 9 日に GPT-5.6 ファミリー(Sol、Terra、Luna)と ChatGPT Work を投入した。Claude ユーザーにとって実際に変わったこと —— 1.05M コンテキスト、$1 ティア、数時間稼働するエージェント、そして誰も書いていない発売の側面。
OpenAI Astra: プレビュー・フィールドノート
OpenAI の『次の主要モデル』Astra は 2026 年 8 月 1 日にプレビュー公開され、Lean で検証された 10 本の数学証明とほぼ皆無の製品仕様が示された。何が実際に確認済みで、何が未定か、そして Claude ユーザーは待つべきか — 情報源付きの率直な見解。
ChatGPTでサインイン
OpenAIの新しいアイデンティティ層、リリース3日目。実際にどのデータが境界を越えるのか、エンタープライズ管理者が何をできるのか、そして意図しない足場をOpenAIに与えずに自社アプリで受け入れる方法。
Ollama でローカルに AI モデルを動かす
オープンウェイトモデル(Llama、Mistral、Qwen…)を Ollama で自分のマシン上で動かす — プライベート、オフライン、無料で実行可能。セットアップ、CLI、コードからの呼び出しまで。
コーディングにおけるClaude vs GPT vs Gemini
コーディング向けのフロンティアモデルを選ぶための枠組み(ランキングではない)——重要な要素と、なぜ自分のリポジトリでの評価があらゆるベンチマークに勝るのか。
コーディングエージェントCLI比較
Claude Code、Codex CLI、Gemini CLI、そしてオープンソースのターミナルエージェント — なぜモデルだけでなくハーネスが結果を左右するのか、そしてAGENTS.mdで設定をポータブルに保つ方法。
Supabase Evals — 実バックエンドのエージェントベンチマーク
Supabase は、Claude Code、Codex、OpenCode を実際のコンテナ化された Supabase スタックに対して実行するベンチマークをオープンソース化した — モックではない。何を測るのか、モデルが実際にドキュメントとスキルをどう使うかについて何を見出したのか、そして一晩でローカル実行する方法。
Claude ユーザーのための Gemini
Claude には慣れているが、Google の Gemini が必要? 重要な違い — Gems、Workspace 連携、巨大なコンテキスト、マルチモーダル — と、そのまま使えるもの。
Claude ユーザーのための Gemini 3.6 Flash・Flash-Lite・Flash Cyber
2026年7月21日、Google は Gemini 3.5 Pro を完全にスキップして、代わりに3つの Flash 系モデルを出荷した。実際の価格、実際のベンチマーク、移行時の落とし穴、そして多くの解説記事が見落としている部分 — V8 のバグ発見で Claude Opus 4.6 を上回ったセキュリティ向けファインチューンを含めて。
Claude ユーザーのための Grok
Claude には慣れているが、xAI の Grok が必要? 重要な違い — リアルタイムの X/ウェブ検索、OpenAI 互換 API、そして Grok Build コーディングエージェント — と、そのまま活かせるすべて。
Muse Code + Muse Spark 1.2: Meta のターミナル・コーディングエージェント
2026 年 8 月 5 日、Meta はターミナル・コーディングエージェントの Muse Code と、それと共に共同学習されたモデル Muse Spark 1.2 を出荷した。追記専用イベントログが実際に何をもたらすのか、なぜ contributor ティアが標準ティアより 12.5 倍安いのか、Terminal-Bench 2.1 で Claude Code とどう並ぶのか、そしてどのエージェントを使うにせよ盗む価値のある同梱スキル 3 つ。
オープンソースのAIエージェントフレームワーク
LLMエージェントを構築するための主要なオープンフレームワーク — LangGraph、LlamaIndex、AutoGen、CrewAI、そして最小ループのアプローチ — をプロバイダーに依存しない形でマッピングし、選び方を解説します。
ネイティブなマルチエージェントAPI:OpenAIのResponsesマルチエージェントベータ vs 自作
2026年7月9日、OpenAIはResponses APIのマルチエージェントベータとSol Ultra Modeを出荷した — フロンティアベンダーで初めて『モデルが1回のHTTPリクエスト内でN個のサブエージェントを生成・統合する』ことをファーストクラスのプリミティブにした。実際に何が出荷されたか、APIの形、コスト計算、Anthropicが代わりに提供するもの、そしてネイティブプリミティブがDIYのファンアウトに勝つ場面。
A2A:エージェント間プロトコル
MCPはエージェントをツールに接続します。A2Aはエージェントを他のエージェントに — フレームワーク、クラウド、企業を越えて — 接続します。Agent Card、タスク、8つのライフサイクル状態、ストリーミングとwebhookの違い、そしてA2AがどのようにMCPと構成されるかを学びます。
モデル間でプロンプトを移植する
Claude、GPT、Gemini、オープンモデルの間でプロンプトを移す — きれいに引き継げる部分、モデルごとに調整すべき部分、そして移行ワークフロー。
DeepSeek、Qwen、そしてオープンウェイトの波
強力なオープンウェイトモデル(DeepSeek、Qwen、Llama、Mistral)が差の多くを埋めた。「オープンウェイト」の意味、クローズドなフロンティアモデルとのトレードオフ、そしてそれらの使い方。
Claude ユーザーのための Kimi K2
Claude を使いこなしていて、Moonshot の Kimi K2 が気になる? Claude Code をそのまま向けられるオープンウェイトのエージェント特化モデル——Moonshot が Anthropic 互換エンドポイントを提供しているからこそ実現する。本当に違う点と、そのまま活かせる点を整理する。
GLM-5.2:オープンウェイト・フロンティアのコーディングモデル
Z.ai の 753B MoE(~40B アクティブ)、1M トークンコンテキスト、MIT ライセンス — 長ホライズンのコーディングで Claude Opus 4.8 の 1 ポイント差まで迫り、API コストは約 6 分の 1。IndexShare が実際に何をするか、ローカルで動作させる方法、実世界で Claude Code に勝つ場面。
Inkling: Thinking Machines のオープンウェイトモデル
Mira Murati 率いる Thinking Machines Lab が Inkling を公開 — 9,750億パラメータ、Apache 2.0、連続的な思考エフォート・ダイヤルを備えたマルチモーダル MoE。ローンチ報道が取り違えた点、意図的にベンチマークで負ける理由、そしてエフォートつまみの実体。
Kimi K3:世界最大のオープンウェイトモデル
Moonshot AIによる2.8兆パラメータのオープンウェイトモデルは、多くのベンチマークでClaude Opus 4.8を上回り、Frontend Code Arenaで首位に立った。何がアーキテクチャ的に異なるのか、キャッシュヒット価格でコストの計算がどう反転するのか、そして本当に手を伸ばす価値があるのか。
Kimi K3をローカルで動かす:vLLM、DSpark、そして本当のハードウェア請求書
2026年、Moonshotの2.8Tオープンウェイト Kimi K3 をセルフホストするための決定版の実践ガイド。DSpark投機的デコードが実際に何をするか、最低限必要なハードウェア(1× DGX B300 または 16× DGX Spark)、正確なvLLMサーブコマンド、誰も警告しないプリフィル/デコードの非対称性、そしてホスト型推論が自分のラックより安くなるのはいつか。
Grok Build の内側:オープンなエージェントハーネスを読む
xAI は自社のコーディングエージェントの Rust ソース全体を Apache 2.0 で公開した — エージェントループ、ツール層、TUI、拡張システム。クレート構成がエージェント構築について教えてくれること、ここでの「オープンソース」がなぜ source-available を意味するのか、そしてツリーに残るデータコレクターのコードが物語ること。
Poolside Laguna:クラスを超える性能を発揮するオープンウェイトのコーディングモデル
Poolside AI の Laguna ファミリー(XS 2.1、S 2.1、M.1)——アクティブパラメータ 3B〜23B、100 万トークンのコンテキスト、OpenMDW-1.1 ライセンスを持つ MoE コーディングモデル。8B アクティブの S 2.1 が実際に何を打ち破るのか、3B アクティブの XS 2.1 が MacBook で動く理由、初めてとされる FP8 での RL 学習パイプライン、そして Claude、GLM-5.2、Kimi K3 より Laguna を選ぶべきタイミング。
生成メディア: 画像・音声・動画AI
テキストチャットの先へ — 画像、動画、音声、音楽のためのAIの地図: 主要なツール、長く使えるスキル、そして重要な権利と倫理。
AIの本当のコスト(プロバイダー横断)
プロバイダーを横断してAIコストを比較するための、長く使えるフレームワーク。価格設定のアーキタイプ、ワークロードの見積もり方、請求額を削るレバー、そしてオープン/ローカルが勝つ場面。
AIエージェントがトークンを浪費する理由(そして請求額を抑える方法)
エージェント実行はチャットの50〜1000倍のコストがかかる — モデルが劣っているからではなく、コンテキストの雪だるま式増加のせいだ。そのメカニズム、意外な数字、そしてClaude・GPT・Gemini・オープンモデルを通じて請求額を実際に削減する4つのレバー。
ローカルAIエージェントを構築する
ローカルのオープンウェイトモデルを使って、自分のマシン上で完結して動作する自律エージェント — プライベートで、オフラインで、無料で動かせる。そのアーキテクチャ、トレードオフ、そして始め方。
Claude + ローカルモデル: ハイブリッドパターン
Claude とローカルのオープンウェイトモデルを連携させる — ルーター、ドラフト後リファイン、プライバシー編集、一括前処理 — フロンティアの推論力をローカルのプライバシーとコストで手に入れる。
AIゲートウェイ:LiteLLM、OpenRouter、Portkey、Vercel
本番のAIゲートウェイは、アプリと全モデルの間に欠けていたルータだ — Claude、GPT、Gemini、Llama を一つにまとめる。LiteLLM、OpenRouter、Portkey、Vercel AI Gateway を比較し、Claude Code を自前のプロキシ経由に配線する。
ローカルコーディングエージェント(とClaudeとの組み合わせ方)
あなたのマシン上で動作しリポジトリを編集するコーディングエージェント — Aider、Cline、Continue、OpenHands、Claude Code — 品質を求めるならClaude、プライバシーを求めるならローカルモデルで動かす。
MCP で Claude をローカルのツールやエージェントに接続する
Model Context Protocol を使えば、Claude は自分のマシン上でプライベートに動くツール・データ・エージェントをオーケストレーションできます — Claude を頭脳に、ローカルの能力を手足にする相乗効果。ローカル MCP サーバーを追加するか、自分で構築しましょう。
プライベートなローカルAIスタックを構築する(エンドツーエンド)
すべてを結びつける: ローカルモデル(Ollama)+ モデル非依存のエージェント + ローカルMCPサーバー経由のツール — Claude をオプションのスマートレイヤーとして備えた、自分のマシン上で動くプライベートアシスタント。
ローカルエージェントか Claude か:意思決定ガイド
完全ローカルエージェント、Claude 駆動、それともハイブリッド? それを決める要因 — プライバシー、タスクの難易度、コスト、レイテンシ、信頼性 — と、なぜハイブリッドがしばしば勝つのか。
ローカル & ハイブリッドエージェントのセキュリティ
ファイルを編集しコマンドを実行できるエージェントは強力で危険でもある。最小権限、サンドボックス化、人間による承認、プロンプトインジェクション対策、予算上限——エージェントを安全に動かす方法。
推論モデルの比較
Claude、GPT、Gemini、DeepSeek、Qwen にまたがる思考バジェットと推論エフォート — いつ思考にトークンを使い、いつ使わないか。
全二重音声AI:なぜ音声エージェントは突然本物になったのか
GPT-Liveと新しい音声ネイティブモデルは、聞くのと話すのを同時に行う。全二重が何を変えるか、どう機能するか、そして今の音声AIの状況。
Opus と Sonnet の Claude 音声(2026 年 7 月): 推論優先の音声 vs GPT-Live
Anthropic は 2026 年 7 月 23 日に Claude 音声を Opus、Sonnet、コネクトアプリに開放 — しかしターンベースのスタックは維持。実際に何が変わったか、通話中にモデルを切り替える時、そして OpenAI の全二重 GPT-Live との設計上の賭けの違い。
トークン速度:なぜAI推論は突然10〜15倍速くなったのか
ウェハースケールチップとLPUが、毎秒数百トークンでフロンティアモデルを提供している。推論速度を実際に制限するもの、新しいハードウェアレース、そして高速トークンがエージェント・音声・推論をどう変えるか。
コンピュータ操作エージェント比較
Claude、GPT、Gemini はいまやどれも画面を操作できる — しかしそれぞれ異なるアクション空間、座標契約、安全ゲートを公開している。実際に何が壊れるか、そしてそれを生き延びるループの作り方。
AIエージェント向け共有ログインブラウザ:ego lite パターン
新しいクラスのブラウザ — その最高の代表である ego lite は 2026年7月24日に GitHub Trending で 1 位を獲得した — が、Claude Code、Codex、Cursor、その他あらゆるコーディングエージェントに、あなたの実際のログインを継承する隔離された Chromium セッションを駆動させる。Spaces とセマンティックスナップショットが実際に解決するもの、エージェント作業で Playwright を下回る理由、自律プロセスとセッションクッキーを共有するセキュリティコスト。
SKILL.md:エージェント横断のオープン標準
1 つの SKILL.md ファイル、32 のエージェント。Agent Skills オープン標準の実体、progressive disclosure が context を安く保つ仕組み、可搬性を壊すもの、そして Claude Code / Codex / Gemini CLI / Cursor で無改変で動くスキルの書き方。