跳到主要内容

推理模型对比

进阶

推理模型会花费额外算力在回答前思考——先生成一段私有的中间步骤链条,再给出最终答复。它是当今所有主流 AI 中提升难题准确率的最大单一杠杆。问题在于:每家提供商用不同的旋钮暴露同一个理念,而过度花费会白白浪费金钱和延迟、毫无收益。本课将这些旋钮并排对照,让这项技能能在 Claude、GPT、Gemini、DeepSeek 和 Qwen 之间迁移。

What you'll learn
  • 解释测试时算力(思考)能带来什么、又不能带来什么
  • 对照各家提供商的推理控制:Claude 的 effort、OpenAI 的 reasoning.effort、Gemini 的 thinkingBudget/thinkingLevel、DeepSeek 的 reasoner、Qwen 的 enable_thinking
  • 按任务选择思考深度,而不是把所有东西默认拉到最大
  • 在各个 API 上正确读回推理轨迹,且不把它作为输入回喂
  • 避开常见陷阱:过度思考、无法关闭思考的模型、以及把 effort 当成质量修复手段

一个核心理念:思考是刻度盘,不是开关

每个推理模型都处在同一个权衡上:

  • 思考更少 → 更快、更便宜。适合抽取、格式化、简单问答。
  • 思考更多 → 在真正的难题(多步数学、棘手的调试、严谨的证明)上表现更好,但延迟和成本更高。

绊倒人的陷阱是:对本就简单的任务,额外思考毫无作用——你只是白白付出延迟和成本。真正的技能是把深度花在能改变答案的地方。这个真理在下面的每个模型上都一样;变的只是刻度盘的名字。

这是 Claude 专属课程 扩展思考与 Effort 的跨 AI 姊妹篇——想了解 Claude Messages API 的细节请阅读那篇。

步骤 1 —— 动旋钮之前先给任务分类

Guided walkthrough1 of 3
  1. 抽取、重新格式化、分类、简短事实查询 → 最小或不思考。思考帮不上忙,反而增加延迟。
Pro tip
  • 从提供商的中等/动态默认值开始,只在质量明显需要时才提高 effort。
  • 更高的 effort 不是模糊提示词的修复手段——更清晰的规格通常胜过更多思考。

步骤 2 —— 逐家提供商看旋钮

同一个刻度盘,五种不同的控制界面。当你在模型之间移植工作负载时,这张表要开着。

提供商 / 模型控制项取值能关闭思考吗?
Claude(扩展思考)effort 层级(较新模型自适应深度;较旧模型暴露 budget_tokensLow / Medium / High大多数可以——用低层级或省略思考
OpenAI GPT‑5.5 / o‑系列reasoning.effortminimallowmedium(默认)、highxhigh(GPT‑5.5 / Codex‑Max)minimal 只产生很少或不产生推理 token
Google Gemini 2.5thinkingBudgettoken 数量;0 关闭;-1 = 动态(上限约 8,192);2.5 Pro 需要 128–32768 或 -1大多数 2.5 模型可用 0
Google Gemini 3thinkingLevel(不要与 thinkingBudget 混用)分层级别不能——Gemini 3.1 Pro 无法关闭
DeepSeek R1deepseek-reasoner专用 reasoner——始终思考无(开放权重,本地运行)不能——它是仅思考模型
Qwen3enable_thinking(混合)+ /think · /no_think 软开关开 / 关,可逐轮切换可以——enable_thinking=False/no_think
Watch out
  • 有些模型移除了关闭开关:Gemini 3.1 Pro 和 DeepSeek R1 始终思考。要为此规划延迟/成本——你无法把它们调到零。
  • 在 Gemini 3 上,同一个请求里同时设置 thinkingLevel 和 thinkingBudget 会报错。二选一。
  • Gemini 的动态模式(-1)把思考上限约束在 8,192 token——对大多数工作够用,但对最难的问题是个硬天花板。

两大家族

自上而下地读这张表,模型分成两类——知道自己手里握的是哪一类,就知道该期待什么:

  • 混合 / 可切换(Claude、OpenAI、Gemini 2.5、Qwen3):一个模型,你可以按请求把思考调高、调低——或关闭。最适合混合流量,其中有些调用琐碎、有些困难。
  • 专用推理器(DeepSeek R1;实际上 Gemini 3.1 Pro 也是):模型始终推理。别把格式化和抽取路由到这里——你会在每次调用上都付思考税。在轮换中保留一个便宜的非思考模型来处理简单流量。

步骤 3 —— 正确读回推理轨迹

每家提供商都把思考和答案分开返回——通用规则是不要把推理作为输入粘贴回下一轮。只回喂最终答案(另外,在 Claude 上,回喂 API 为工具循环交给你的已签名思考块)。

Guided walkthrough1 of 4
  1. 回复以一个思考块紧跟一个文本块的形式到达。遍历 message.content 并按 block.type 分支。

同一任务,三个旋钮——可以套用的伪配置

# Claude — balanced
thinking = {"type": "enabled", "budget_tokens": 8000}   # keep < max_tokens

# OpenAI — balanced
reasoning = {"effort": "medium"}

# Gemini 2.5 — let the model decide
thinking_config = {"thinking_budget": -1}   # dynamic; 0 to disable

# Qwen3 (local) — turn thinking OFF for a trivial call
chat_template_kwargs = {"enable_thinking": False}

步骤 4 —— 何时不该花费思考

昂贵的错误是把所有东西默认拉到最大。在以下情况跳过或最小化思考:

  • 任务是机械性的(抽取、重新格式化、分类、翻译一段已知字符串)。
  • 你处在紧张的延迟预算下(聊天 UI、自动补全)——使用 minimal/0//no_think
  • 提示词规格不足——对模糊任务更多思考只会产生自信的游移,而非更好的答案。先修好规格。
  • 你在做大批量工作,而几个百分点的准确率不值得把 token 账单在数百万次调用上翻倍。
Pro tip
  • 经验法则:当问题有一个可验证的正确答案、且需要若干个相互依赖的步骤时,思考才划算。在没有唯一正确路径的开放式生成上,它收益甚微。

测验

Check yourself

0/4
  1. 对一个本就简单的任务,额外思考能给你带来什么?
  2. 哪个模型实际上无法关闭思考?
  3. 在 Gemini 2.5 中,thinkingBudget = -1 是什么意思?
  4. 对模型的推理轨迹,你不应该做什么?

记忆卡片

各模型的推理控制词汇
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。
1 / 7

来源与延伸阅读