AIモデルの全体像:Claude、ChatGPT、Gemini、オープンモデルから選ぶ
AILmanacの中核はClaudeですが、スキルは持ち運びできます。同じプロンプティング、コンテキストエンジニアリング、ツール利用、評価(eval)の習慣は、ほぼあらゆる現代的なモデルで通用します。このページでは視野を分野全体へと広げます — 主要なプレイヤーは誰か、タスクに合わせてどう選ぶか、そしてどれを使っても変わらず役立つものは何か。
- 主要なAIアシスタントとモデル、そしてそれぞれがどの原型(アーキタイプ)かを知る
- 誇大宣伝ではなく、再現可能な枠組みで特定のタスクに合うモデルを選ぶ
- あらゆるモデルに通用するスキル(そのほとんど)を把握する
- どの事実がすぐ陳腐化するか、そして最新の真実をどこで確認すべきかを知る
主要なプレイヤー(順位ではなく原型で)
**原型(アーキタイプ)**で考えましょう — 順位は入れ替わりますが、原型は安定しています。
- Anthropic — Claude · フロンティアのクローズドモデル。コーディング、エージェント的/ツール利用、長コンテキストの推論、そして安全性を最優先とする姿勢で知られる。(このサイトの残り全体がここを深掘りします。)
- OpenAI — ChatGPT / GPT · フロンティアのクローズドモデル。最大の消費者向けエコシステムと、非常に幅広いマルチモーダルな機能群を持つ。
- Google — Gemini · フロンティアのクローズドモデル。Googleの製品やデータと深く結びつき、非常に大きなコンテキストウィンドウを備える。
- Meta — Llama · オープンウェイト:ダウンロードして自前でホストできる。ローカル/オープンのエコシステムの多くを支える基盤。
- Mistral · オープンウェイト + API。欧州発で、効率性を重視。
- xAI — Grok · クローズド。Xと統合され、リアルタイムのシグナルを重視。
- DeepSeek / Qwen (Alibaba) · コストあたりの能力で知られる強力なオープンウェイトモデル。自前ホスティングで人気。
- 実用上の最大の分岐点は、CLOSEDなフロンティア(最高の生の能力、ホスト型のみ)とOPEN-WEIGHT(自前ホスト可、プライベート、カスタマイズ可、大規模運用ではしばしば安上がり)の違いです。
- リーダーボードで買い物をしないこと。唯一意味のあるベンチマークは、あなたのデータで動かすあなたのタスクです。
タスクに合わせてモデルを選ぶ方法
Guided walkthrough1 of 6
- それは何をしなければならないか、そして何が交渉の余地のない条件か:データのプライバシー(データはネットワーク外に出てよいか?)、予算、レイテンシ、最大コンテキスト、規制対象領域、オンデバイス要件。
- インフラ不要で絶対的に最高の能力が必要? ならクローズドなフロンティアモデル(Claude / GPT / Gemini)。プライバシー、自前ホスティング、大規模なカスタマイズ、あるいは大規模運用での最低運用コストが必要? なら自前でホストするオープンウェイトモデル(Llama / Mistral / Qwen / DeepSeek)。
- 制約に妥当に合いそうなものをいくつか選ぶ — 悩み込まないこと。どのみちテストするのだから。
- 正解がわかっている実例を10〜50件。それぞれの候補で動かす。あなたのユースケースには、どんな公開リーダーボードよりこれが効く。
- 1コールあたりのコストと速度に、想定トラフィックを掛ける。必要のない2%の品質向上のために10倍の価格を払うなら、『最高の』モデルは間違った選択になりうる。
- 新しいモデルが出たら再実行する。評価があれば乗り換えは安く済む。なければコイン投げになる。
プロバイダー非依存のシステムプロンプトの骨格(どのモデルでも動く)
You are a {role}.
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}(ほぼ)あらゆるモデルに通用するもの
Claudeをしっかり学ぶことがどこででも報われる理由 — これらのスキルは持ち運び可能です。
- プロンプトの構造 — 明確な役割、明示的なタスク、例、出力フォーマット → プロンプティングの基本
- コンテキストエンジニアリング — ウィンドウに何を入れるかを決める → 基礎
- ツール利用 / 関数呼び出し — パターンはプロバイダー間でほぼ同一 → ツール利用
- 検索拡張(RAG) — 回答を自分のデータに根拠づける → RAG
- 評価(eval) — モデルを公正に比較できるよう品質を測る → 評価
- 構造化出力 — 結果を機械可読にする → 構造化出力
きれいに移植できないもの:正確なAPIの形、ツール呼び出しのJSONの細部、トークン上限、価格、そして安全性/拒否(refusal)の挙動 — これらは必ずプロバイダーごとに再確認すること。
全体像のための語彙
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。1 / 4
理解度チェック
0/3- 原型で考える(クローズドなフロンティア vs オープンウェイト)。順位は移ろうが、原型は移ろわない。
- 制約 + 自分のデータでの小さな評価で選ぶ — 決してリーダーボードの誇大宣伝で選ばない。
- ほとんどのスキル(プロンプティング、コンテキスト、ツール、RAG、評価)はあらゆるモデルに通用する — だからClaudeを深掘りすることがどこででも報われる。
- 名称、価格、上限、ベンチマークはすぐ陳腐化する — 今日の具体値は出典で確認すること。
出典とさらに読むには
- Anthropic — モデル概要 — Claudeの現行ラインナップ。
- OpenAI — Models · Google — Geminiモデル · Meta — Llama · Mistral — Models — 各プロバイダー自身の、最新の真実の出典。
- Artificial Analysis — 独立系で、頻繁に更新される能力/価格/速度の比較。
- Ollama · LM Studio — オープンウェイトモデルをローカルで動かす。
次へ
- 中核を深掘りする → どのClaudeを使うべき?
- 選択を測定可能にする → 評価
- 持ち運べるスキル → プロンプティングの基本 · 基礎