メインコンテンツまでスキップ

AIの本当のコスト(プロバイダー横断)

中級

「AIはいくらかかるのか?」には単一の答えはありません。それはどの価格設定アーキタイプを買っているか、そして実際にどれだけ使うかに左右されます。ドルの数字は数か月ごとに入れ替わりますが、コストの構造はほとんど動きません。このページでは長く使える形を教えます。AIの3つの値付け方法、構築前にワークロードを見積もる方法、請求額を削るレバー、そしてAPIを借りるか自前でホストするかという本当の分岐点です。

What you'll learn
  • 3つのコストアーキタイプを区別する:トークン単位のAPI、定額サブスクリプション、オープン/セルフホスト
  • あらゆるワークロードのコストを トークン × レート × ボリューム から見積もる — 出荷する前に
  • 品質を損なわずに支出を削る大きなレバーを引く
  • オープン/セルフホストがコストでAPIに勝つ場面と、APIが勝つ場面を知る
  • どの数字がすぐ古くなるか、そして今日の真実をどこで確認するかを知る

3つのコストアーキタイプ

AIへの支払い方法は、ほぼすべてが3つの形のいずれかに収束します。価格ではなく、形を覚えてください。

  • トークン単位のAPI(使用量ベース)。 ホスト型モデルをAPI経由で呼び出し、トークン単位で支払います — そして入力と出力は別々に値付けされ、ほぼ常に出力の方が高価です。大きい/賢いモデルはトークン単位で高く、小さいモデルははるかに安くなります。ほとんどのプロバイダーは割引も提供します:再送するキャッシュ済み入力への割引レート、そして緊急でない非同期ジョブ向けの定額のバッチ割引です。これがClaude、GPT、Geminiの上に製品を構築するときの支払い方です。コストは使用量に直接比例します — 小規模では数セント、大規模では支配的な費目になります。
  • 定額の消費者/シート単位サブスクリプション。 チャットアプリやIDEアシスタント向けの固定の月額料金(Claude / ChatGPT / Geminiの消費者向けプラン、Copilot型のシート)。トークンは見えません。使用枠とレート制限が与えられます。キーボードの前にいる人間にとっては予測可能で安い — しかしプログラム的/大量のワークロードにはスケールせず、シート単位のコストはチーム全体で積み上がります。
  • オープン / ローカル(セルフホスト)。 オープンウェイトモデル(Llama、Mistral、Qwen、DeepSeek)を自分のハードウェアやレンタルGPUで動かします。呼び出し単位の価格はありません — モデルが稼働中でもアイドル中でも、ハードウェア(または時間単位のGPUレンタル)+ 電気代 + 運用に対して支払います。もう1回呼び出す限界コストは事実上大規模ではほぼゼロですが、固定費と運用負担を背負います。Ollamaでモデルをローカル実行するを参照してください。
Pro tip
  • 鍵となる分岐:APIとサブスクリプションは限界コスト(使うたびに支払う)、セルフホストはほぼ固定コスト(使う使わないにかかわらず、能力を維持するために支払う)。
  • APIで最大の驚きは、出力トークンが通常は入力の数倍のコストになること — 冗長な回答は本当にお金がかかる。
  • 定額サブスクリプションは人間がチャットするのに適したツール、トークン単位のAPIはアプリがループでモデルを呼ぶのに適したツール。

ワークロードのコストの見積もり方

本番コードを1行も書く前に、API請求額の規模を把握できます。モデル全体はたった1つの式です:

コスト ≈ (入力トークン × 入力レート) + (出力トークン × 出力レート)、1回あたり × 呼び出し回数

レートは100万トークンあたりで提示され、入力と出力は異なるレートを持ちます — だから2つの半分を別々に見積もって足してください。おおまかなトークンの目安:英語で約1トークン ≈ 4文字、または約0.75語。正確なカウントにはトークン推定機エリアを使い、トークンと価格を読んでください。トークンがどこに隠れているかの全メカニクスはトークン・エコノミーにあります。

Guided walkthrough1 of 5
  1. 入力を合計する:システムプロンプト + ツール + 取得したコンテキスト + 履歴 + ユーザーのターン。次に、求める出力を見積もる。入力と出力は別々に数える — 値付けが異なるから。

封筒の裏での見積もり(今日のレートを埋める)

Per call:
input_tokens  = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens  * input_rate_per_million  / 1e6)
          + (output_tokens * output_rate_per_million / 1e6)

Per month:
monthly_cost = call_cost * calls_per_day * 30

Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent  -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.

コストを削る大きなレバー

ほとんどの実ワークロードはデッドウェイトを抱えています。以下のレバーは、おおむねレバレッジの大きい順で、品質に触れずに支出を削ります — 安価で構造的なものを先に引いてください。

  • モデルを適正サイズにする。 小さい/安いモデルで十分に片付く仕事に、フラッグシップのレートを払わない。分類、抽出、ルーティング、単純なフォーマット整形は、通常、最小ティアでトークン単価のほんの一部で快適に動く。本当に難しい推論には大きいモデルを取っておき、ルーティングを検討する:安いモデルが簡単な大多数を処理し、難しいケースだけエスカレーションする。モデルの選び方を参照。
  • 送るコンテキストを削る。 最も安いトークンは、送らないトークン。肥大したシステムプロンプトを刈り込み、長い履歴を走り書きの要約にまとめ、タスクに必要なツールだけを公開する — どれも毎回再び払う入力。
  • 巨大なコンテキストを詰め込む代わりにRAG。 1つの質問に答えるために50ページの文書を貼り付けると、毎回50ページ分を払う。**検索(リトリーバル)**は関連する数節だけを取ってくる — 同じ(しばしばより良い)答えに対してはるかに少ない入力トークン。コーパス全体を一度に視野に入れる必要が本当にあるときだけ、巨大なコンテキストウィンドウに手を伸ばす。
  • プロンプトキャッシング。 多くの呼び出しが変わらない大きなプレフィックス(システムプロンプト、ツールカタログ、参照ドキュメント)を共有するなら、キャッシングはそれを一度処理し、それ以降の各呼び出しで大幅な割引で再提供する。チャットとエージェントのワークロードにとって最も高レバレッジな構造的変更 — なぜなら毎ターン元が取れるから。
  • 緊急でないものはバッチに。 評価、一括ラベリング、アーカイブの要約 — 答えが数秒で必要でないものはすべて — ほとんどのプロバイダーで非同期バッチ経路を通り、定額割引が効く。即時性を、目に見えて低い請求額と引き換える。
  • 出力を短くする。 出力は高い方の側。おしゃべりな段落の代わりにJSONや厳格なスキーマを求める:出力トークンが少なくなおかつ下流での解析の当て推量もない。
  • 簡単な分にはより小さい/オープンなモデル。 大量で低難度の呼び出しの大多数には、オープンまたは小さいモデルが呼び出し単位で劇的に安くなる — すでにセルフホストしているなら時にほぼ無料。フロンティアモデルは、本当に必要なケースのために取っておく。
Pro tip
  • これらは乗算的に積み重なる:キャッシュ済み入力 × 適正サイズのモデル × より簡潔な出力 × バッチ割引 が複利となり、簡単なタスクで大きな合計削減になる — 品質はそのまま。
  • 言い回しをミクロ最適化する前に、構造的レバー(適正サイズ、キャッシュ、RAG、バッチ)を引く — そちらの方が請求額をはるかに動かす。
  • 推測ではなく、常に実際の請求額に対して変化を計測する。深いプレイブックはトークン・エコノミー。

オープン/セルフホストがAPIに勝つとき、そしてAPIが勝つとき

これがAI予算を実際に動かす判断です。固定対限界コストのクロスオーバーであり、ボリュームがそれを決める変数です。

  • オープン / セルフホストは高く安定したボリュームで勝つ。 GPUをほぼ常時稼働させられるだけの呼び出しを回すようになれば、呼び出し単位のほぼゼロの限界コストが、永遠にトークン単位で払うのに勝つ。固定のハードウェア/レンタルコストを膨大な数の呼び出しに分散し、データプライバシーと完全なカスタマイズを得る — そして運用負担(プロビジョニング、スケーリング、稼働時間、MLOps)を入場料として受け入れる。
  • APIは低いまたはスパイク状のボリューム、あるいはインフラなしで勝つ。 トラフィックが小さく、断続的、または予測不能なら、トークン単位で払うことは使った分だけ払い、アイドル時には何も払わないことを意味する — 午前3時に温まったまま座っているGPUはない。運用もすべて省ける。製品を出荷したり、プロトタイピングしたり、スパイクで来るトラフィックを持つほとんどのチームにとって、APIは安くなおかつはるかに手間が少ない。
Watch out
  • セルフホストが「無料」であることはまれ。モデルの重みは無料かもしれないが、GPU、電気代、それを動かし続けるエンジニアの時間は無料ではない — 節約を主張する前に正直に数える。
  • アイドルのGPUは純粋な損失:固定コストのインフラは稼働率が高いときだけトークン単位の価格に勝つ。低いまたはスパイク状のトラフィックは毎回APIを優遇する。
  • クロスオーバー地点は、API価格が下がるかハードウェアが安くなるたびに動く — 定期的に計算をやり直し、一度決めて忘れないこと。
AIコストの語彙
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 6

自分でチェック

0/3
  1. トークン単位のAPIで、請求額のどちらの側がほぼ常により高価か?
  2. 低く、スパイク状で、予測不能なトラフィックがあり、MLインフラがない。どれが通常は安いか?
  3. 簡単で大量のタスクでAPI請求額を削る最も信頼できる方法は?
Key takeaways
  • 3つのアーキタイプ:トークン単位のAPI(使用量ベース、入力と出力は別々に値付け)、定額サブスクリプション(予測可能、大量ボリュームにはスケールしない)、オープン/セルフホスト(固定コスト、呼び出し単位はほぼゼロ)。
  • 構築前に見積もる:(入力 × 入力レート) + (出力 × 出力レート)、1回あたり × ボリューム — それからキャッシュとバッチの割引を適用する。
  • 最大のレバー:モデルを適正サイズにする、コンテキストを削る、巨大コンテキストよりRAG、プロンプトキャッシング、緊急でないものはバッチに、出力を短くする。
  • セルフホストは高く安定したボリュームで勝つ(固定コストを分散)。APIは低い/スパイク状のボリュームまたはインフラなしで勝つ(使った分だけ払う)。
  • あらゆるドルの数字はすぐ古くなる — プロバイダーの価格ページとトラッカーで確認し、コスト計算機で自分の数字を実行する。

出典とさらに読む

  • Anthropic — Pricing — 現在のClaudeのトークン単位レート、キャッシュとバッチの割引。
  • OpenAI — API Pricing · OpenAI — Pricing overview — 現在のGPTのトークン単位レートと段階。
  • Google — Gemini API Pricing — 現在のGeminiのレート、無料ティア、有料ティア。
  • Mistral — Pricing — オープンウェイト + APIの価格設定、効率重視の参照点。
  • Artificial Analysis — 独立した、頻繁に更新されるプロバイダー横断の価格/速度/品質の比較(提示されたどの数字も妥当性を確認するためのトラッカー)。
  • Ollama — オープンウェイトモデルをローカル実行し、大規模で呼び出し単位の価格をゼロに近づける。

次へ