跳到主要内容

AI 到底要花多少钱(跨服务商对比)

进阶

“AI 要花多少钱?”没有唯一答案——它取决于你买的是哪种定价原型,以及你实际用了多少。具体的美元数字每隔几个月就变;但成本的结构几乎不动。本页教你这个持久的形状:AI 的三种定价方式、在动手搭建之前如何估算一个工作负载、削减账单的杠杆,以及租用 API 与自建之间那个真正的岔路口。

What you'll learn
  • 分清三种成本原型:按 token 计费的 API、固定订阅、开源/自建
  • 在上线前,用 token × 单价 × 用量估算任何工作负载的成本
  • 在不损害质量的前提下,拉动削减开支的大杠杆
  • 知道开源/自建在成本上何时胜过 API,以及 API 何时更优
  • 知道哪些数字很快就会过时——以及去哪里查今天的真相

三种成本原型

几乎你能为 AI 付费的每一种方式,都归结为三种形状之一。学形状,别记价格。

  • 按 token 计费的 API(用量计费)。 你通过 API 调用一个托管模型,按 token 付费——而且输入和输出分别定价,输出几乎总是两者中更贵的那个。更大/更聪明的模型每 token 更贵;更小的模型便宜得多。多数服务商还提供折扣:对你重复发送的缓存输入有一个更低的单价,对非紧急的异步任务有一个统一的批量折扣。当你在 Claude、GPT 或 Gemini 上构建产品时,就是这样付费的。成本随用量直接增长——小规模时是几分钱,大规模时则是最大的账单项。
  • 固定的消费者/席位订阅。 为一个聊天应用或 IDE 助手支付固定的月费(Claude / ChatGPT / Gemini 的消费者套餐、Copilot 式的席位)。你看不到 token;你得到一个用量额度和速率限制。对坐在键盘前的人类来说可预测又便宜——但它无法扩展到程序化/高并发的工作,而且按席位的成本会随团队人数累加。
  • 开源/本地(自建)。 你在自己的硬件或租来的 GPU 上运行一个开源权重模型(Llama、Mistral、Qwen、DeepSeek)。没有按次调用的价格——你为硬件(或按小时租的 GPU)+ 电费 + 运维付费,无论模型是忙是闲。再多一次调用的边际成本在规模化后实际上接近于零,但你要背负固定成本和运维负担。见 用 Ollama 在本地运行模型
Pro tip
  • 关键的分野:API 和订阅是边际成本(你按使用付费);自建大多是固定成本(无论用不用,你都要维持容量)。
  • 在 API 上,最大的意外是输出 token 通常比输入贵好几倍——啰嗦的回答会真的花钱。
  • 固定订阅是人类聊天的合适工具;按 token 的 API 是应用在循环中调用模型的合适工具。

如何估算一个工作负载的成本

在写一行生产代码之前,你就能估算一笔 API 账单。整个模型就是一个公式:

成本 ≈ (输入 token × 输入单价) + (输出 token × 输出单价),每次调用 × 调用次数

单价按每百万 token报价,而输入和输出有不同的单价——所以分别估算两半再相加。一个粗略的 token 经验法则:约 1 token ≈ 4 个英文字符,或约 0.75 个词。要精确计数,请使用 Token 估算器 区域并阅读 Token 与定价。token 到底藏在哪里的完整机制在 Token 经济学

Guided walkthrough1 of 5
  1. 把输入加起来:系统提示 + 工具 + 检索到的上下文 + 历史 + 用户这一轮。然后估算你要求的输出。输入和输出分开计——它们定价不同。

信封背面的估算(填入今天的单价)

Per call:
input_tokens  = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens  * input_rate_per_million  / 1e6)
          + (output_tokens * output_rate_per_million / 1e6)

Per month:
monthly_cost = call_cost * calls_per_day * 30

Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent  -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.

削减成本的大杠杆

大多数真实工作负载都背着无用的重量。以下这些杠杆,大致按杠杆效应排序,能在不触及质量的前提下削减开支——先拉便宜的结构性杠杆。

  • 给模型选对尺寸。 别为一个小/便宜模型就能做好的活儿付旗舰级单价。分类、抽取、路由和简单格式化,通常在最小档上就跑得很好,而每 token 的价格只是零头。把大模型留给真正困难的推理,并考虑路由:便宜模型处理简单的大多数,只在困难的情况才升级。见 选择模型
  • 精简你发送的上下文。 最便宜的 token 是你从不发送的那个。裁掉臃肿的系统提示,把长历史压缩成一份滚动摘要,只暴露任务需要的工具——每一个都是你每次调用都要重付的输入。
  • 用 RAG 而非塞入巨大上下文。 为回答一个问题就粘贴一份 50 页的文档,意味着每次调用都为这 50 页付费。检索只取回那几段相关的内容——用远少的输入 token 得到同样(往往更好)的答案。只有当你确实需要一次性看到整个语料时,才动用超大上下文窗口。
  • 提示缓存。 如果许多调用共享一段不变的大前缀(系统提示、工具目录、参考文档),缓存会处理它一次,并在之后每次调用时以大幅折扣重新提供。这是聊天和智能体工作负载中杠杆效应最高的单项结构性改动,因为它每一轮都在回本。
  • 把非紧急的批量处理。 评测、批量打标、给一份存档做摘要——任何你不需要在几秒内拿到答案的活儿——都能走异步批量通道,在多数服务商那里享受统一折扣。用即时性换来实质性更低的账单。
  • 缩短输出。 输出是更贵的一边。要求 JSON 或一个紧凑的 schema,而不是一段唠叨的话:更少的输出 token,而且没有下游解析的猜测。
  • 用更小/开源模型处理简单的那部分。 对于高并发、低难度的大多数调用,一个开源或小模型每次调用可能便宜得多——如果你已经自建,有时几乎免费。把前沿模型留给真正需要它的情况。
Pro tip
  • 这些是相乘叠加的:缓存输入 × 选对尺寸的模型 × 更简短的输出 × 批量折扣,在一个简单任务上会复合成一大笔总削减——而质量不变。
  • 在微调措辞之前,先拉结构性杠杆(选对尺寸、缓存、RAG、批量)——它们对账单的影响大得多。
  • 永远用真实账单来度量改动,而不是靠猜。深度打法在《Token 经济学》。

开源/自建何时胜过 API——以及 API 何时更优

这是真正左右你 AI 预算的决策。它是一个固定成本与边际成本的交叉点,而用量是决定它的变量。

  • 开源/自建在高、稳定的用量下胜出。 一旦你跑的调用足以让一块 GPU 大部分时间都忙碌,那么每次调用接近于零的边际成本就胜过永远按 token 付费。你把固定的硬件/租用成本摊到海量调用上,获得数据隐私和完全的定制能力——并接受运维负担(供给、扩缩容、可用性、MLOps)作为入场费。
  • API 在低或波动的用量下、或没有基础设施时胜出。 如果流量很小、突发或不可预测,按 token 付费意味着你只为用到的付费,闲时分文不花——没有凌晨 3 点还热着的 GPU。你也省掉了所有运维。对于大多数要发布产品、做原型、或流量呈尖峰的团队来说,API 既更便宜省事得多。
Watch out
  • 自建很少是“免费的”。模型权重也许免费,但 GPU、电费,以及让它持续运行的工程师工时都不免费——在宣称省钱之前,诚实地把它们算进去。
  • 闲置的 GPU 是纯粹的损失:固定成本的基础设施只有在利用率高时才胜过按 token 定价。低或尖峰的流量每次都更利于 API。
  • 每当 API 降价或硬件变便宜,交叉点就会移动——定期重算这笔账,别一次决定就忘。
AI 成本词汇
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。
1 / 6

自我检查

0/3
  1. 在按 token 计费的 API 上,账单的哪一边几乎总是更贵?
  2. 你的流量低、尖峰、不可预测,而且没有机器学习基础设施。哪个通常更便宜?
  3. 在一个简单、高并发的任务上,削减 API 账单最可靠的方式是什么?
Key takeaways
  • 三种原型:按 token 的 API(用量计费,输入与输出分别定价)、固定订阅(可预测,无法扩展到高并发)、开源/自建(固定成本,每次调用接近于零)。
  • 在搭建前估算:(输入 × 输入单价) + (输出 × 输出单价),每次调用 × 用量——然后套用缓存和批量折扣。
  • 最大的杠杆:给模型选对尺寸、精简上下文、用 RAG 替代巨大上下文、提示缓存、把非紧急的批量处理、缩短输出。
  • 自建在高且稳定的用量下胜出(摊薄固定成本);API 在低/尖峰用量或无基础设施时胜出(只为用到的付费)。
  • 每个美元数字都很快过时——在服务商定价页面和一个追踪器上核实,并在成本计算器里亲自算一遍。

来源与延伸阅读

下一步