推理模型对比
推理模型会花费额外算力在回答前思考——先生成一段私有的中间步骤链条,再给出最终答复。它是当今所有主流 AI 中提升难题准确率的最大单一杠杆。问题在于:每家提供商用不同的旋钮暴露同一个理念,而过度花费会白白浪费金钱和延迟、毫无收益。本课将这些旋钮并排对照,让这项技能能在 Claude、GPT、Gemini、DeepSeek 和 Qwen 之间迁移。
- 解释测试时算力(思考)能带来什么、又不能带来什么
- 对照各家提供商的推理控制:Claude 的 effort、OpenAI 的 reasoning.effort、Gemini 的 thinkingBudget/thinkingLevel、DeepSeek 的 reasoner、Qwen 的 enable_thinking
- 按任务选择思考深度,而不是把所有东西默认拉到最大
- 在各个 API 上正确读回推理轨迹,且不把它作为输入回喂
- 避开常见陷阱:过度思考、无法关闭思考的模型、以及把 effort 当成质量修复手段
一个核心理念:思考是刻度盘,不是开关
每个推理模型都处在同一个权衡上:
- 思考更少 → 更快、更便宜。适合抽取、格式化、简单问答。
- 思考更多 → 在真正的难题(多步数学、棘手的调试、严谨的证明)上表现更好,但延迟和成本更高。
绊倒人的陷阱是:对本就简单的任务,额外思考毫无作用——你只是白白付出延迟和成本。真正的技能是把深度花在能改变答案的地方。这个真理在下面的每个模型上都一样;变的只是刻度盘的名字。
这是 Claude 专属课程 扩展思考与 Effort 的跨 AI 姊妹篇——想了解 Claude Messages API 的细节请阅读那篇。
步骤 1 —— 动旋钮之前先给任务分类
Guided walkthrough1 of 3
- 抽取、重新格式化、分类、简短事实查询 → 最小或不思考。思考帮不上忙,反而增加延迟。
- 普通编码、起草、多段落分析 → 中等 / 动态。这是每家提供商的均衡默认值。
- 竞赛数学、微妙的竞态条件调试、长证明、困难的智能体规划 → 高 / 大预算。这才是思考值回成本的地方。
- 从提供商的中等/动态默认值开始,只在质量明显需要时才提高 effort。
- 更高的 effort 不是模糊提示词的修复手段——更清晰的规格通常胜过更多思考。
步骤 2 —— 逐家提供商看旋钮
同一个刻度盘,五种不同的控制界面。当你在模型之间移植工作负载时,这张表要开着。
| 提供商 / 模型 | 控制项 | 取值 | 能关闭思考吗? |
|---|---|---|---|
| Claude(扩展思考) | effort 层级(较新模型自适应深度;较旧模型暴露 budget_tokens) | Low / Medium / High | 大多数可以——用低层级或省略思考 |
| OpenAI GPT‑5.5 / o‑系列 | reasoning.effort | minimal、low、medium(默认)、high、xhigh(GPT‑5.5 / Codex‑Max) | minimal 只产生很少或不产生推理 token |
| Google Gemini 2.5 | thinkingBudget | token 数量;0 关闭;-1 = 动态(上限约 8,192);2.5 Pro 需要 128–32768 或 -1 | 大多数 2.5 模型可用 0 |
| Google Gemini 3 | thinkingLevel(不要与 thinkingBudget 混用) | 分层级别 | 不能——Gemini 3.1 Pro 无法关闭 |
DeepSeek R1(deepseek-reasoner) | 专用 reasoner——始终思考 | 无(开放权重,本地运行) | 不能——它是仅思考模型 |
| Qwen3 | enable_thinking(混合)+ /think · /no_think 软开关 | 开 / 关,可逐轮切换 | 可以——enable_thinking=False 或 /no_think |
- 有些模型移除了关闭开关:Gemini 3.1 Pro 和 DeepSeek R1 始终思考。要为此规划延迟/成本——你无法把它们调到零。
- 在 Gemini 3 上,同一个请求里同时设置 thinkingLevel 和 thinkingBudget 会报错。二选一。
- Gemini 的动态模式(-1)把思考上限约束在 8,192 token——对大多数工作够用,但对最难的问题是个硬天花板。
两大家族
自上而下地读这张表,模型分成两类——知道自己手里握的是哪一类,就知道该期待什么:
- 混合 / 可切换(Claude、OpenAI、Gemini 2.5、Qwen3):一个模型,你可以按请求把思考调高、调低——或关闭。最适合混合流量,其中有些调用琐碎、有些困难。
- 专用推理器(DeepSeek R1;实际上 Gemini 3.1 Pro 也是):模型始终推理。别把格式化和抽取路由到这里——你会在每次调用上都付思考税。在轮换中保留一个便宜的非思考模型来处理简单流量。
步骤 3 —— 正确读回推理轨迹
每家提供商都把思考和答案分开返回——通用规则是不要把推理作为输入粘贴回下一轮。只回喂最终答案(另外,在 Claude 上,回喂 API 为工具循环交给你的已签名思考块)。
Guided walkthrough1 of 4
- 回复以一个思考块紧跟一个文本块的形式到达。遍历 message.content 并按 block.type 分支。
- 推理存在于 reasoning items / summary 中;你要为看不到全貌的推理 token 付费。持久化 response 状态,而不是重新发送原始推理。
- 设置 includeThoughts 以获取思考摘要;思考 token 会计费并在 usage 元数据中报告。
- 轨迹以 reasoning_content 字段(较旧的构建)或 reasoning 返回,与 content 分开。在原始权重下,它是 <think> 与 </think> 标签之间的文本。
同一任务,三个旋钮——可以套用的伪配置
# Claude — balanced
thinking = {"type": "enabled", "budget_tokens": 8000} # keep < max_tokens
# OpenAI — balanced
reasoning = {"effort": "medium"}
# Gemini 2.5 — let the model decide
thinking_config = {"thinking_budget": -1} # dynamic; 0 to disable
# Qwen3 (local) — turn thinking OFF for a trivial call
chat_template_kwargs = {"enable_thinking": False}步骤 4 —— 何时不该花费思考
昂贵的错误是把所有东西默认拉到最大。在以下情况跳过或最小化思考:
- 任务是机械性的(抽取、重新格式化、分类、翻译一段已知字符串)。
- 你处在紧张的延迟预算下(聊天 UI、自动补全)——使用
minimal/0//no_think。 - 提示词规格不足——对模糊任务更多思考只会产生自信的游移,而非更好的答案。先修好规格。
- 你在做大批量工作,而几个百分点的准确率不值得把 token 账单在数百万次调用上翻倍。
- 经验法则:当问题有一个可验证的正确答案、且需要若干个相互依赖的步骤时,思考才划算。在没有唯一正确路径的开放式生成上,它收益甚微。
测验
Check yourself
0/4记忆卡片
各模型的推理控制词汇
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。1 / 7