AI 模型全景:在 Claude、ChatGPT、Gemini 与开源模型之间做选择
AILmanac 的核心是 Claude——但技能是可迁移的。同样的提示、上下文工程、工具使用与评估习惯,几乎适用于任何现代模型。本页把视野放宽到整个领域:主要参与者有哪些、如何为任务做选择,以及无论你用哪一个都能通用的部分。
- 了解主要的 AI 助手与模型,以及每一个属于哪种原型
- 使用一套可复用的框架为特定任务挑选模型——而不是跟风炒作
- 看清哪些技能能在每个模型之间通用(大多数都能)
- 知道哪些事实会很快过时——以及去哪里核对当下的真实情况
主要参与者(按原型划分,而非排名)
以原型来思考——排名会洗牌,原型是稳定的:
- Anthropic — Claude · 前沿闭源模型。以编码、智能体/工具使用、长上下文推理,以及安全优先的姿态著称。(本站其余全部内容都在这里深入展开。)
- OpenAI — ChatGPT / GPT · 前沿闭源模型,拥有最大的消费者生态系统,以及非常广泛的多模态功能集。
- Google — Gemini · 前沿闭源模型,深度嵌入 Google 的产品与数据,拥有非常大的上下文窗口。
- Meta — Llama · 开放权重:你可以下载并自行托管它。是大量本地/开源生态系统的中坚力量。
- Mistral · 开放权重 + API,来自欧洲,注重效率。
- xAI — Grok · 闭源,与 X 集成,倚重实时信号。
- DeepSeek / Qwen(阿里巴巴) · 强大的开放权重模型,以性价比著称;在自托管场景中很受欢迎。
- 最大的实际分岔在于:闭源前沿模型(原始能力最强,仅托管提供)与开放权重模型(可自托管、私密、可定制,在大规模运行时往往更便宜)。
- 别按排行榜购物。唯一重要的基准,是用你自己的数据跑你自己的任务。
如何为一项任务选择模型
Guided walkthrough1 of 6
- 它必须做什么,以及哪些不可妥协:数据隐私(数据能否离开你的网络?)、预算、延迟、最大上下文、受监管领域、设备端要求。
- 需要绝对顶级的能力且零基础设施?选闭源前沿模型(Claude / GPT / Gemini)。需要隐私、自托管、大量定制,或在大规模下最低运行成本?选一个你自己托管的开放权重模型(Llama / Mistral / Qwen / DeepSeek)。
- 挑几个看似符合约束的——别纠结;你会去测试它们。
- 10-50 个带有已知正确答案的真实案例。逐一运行每个候选。对你的用例而言,这胜过任何公开排行榜。
- 把每次调用的成本和速度乘以你预期的流量。若某个模型贵 10 倍,却只换来你并不需要的 2% 质量提升,那么这个“最佳”模型就是错误的选择。
- 有新模型发布时就重新跑一遍。当你有一套评估时,切换成本很低;没有时,就只能靠掷硬币。
厂商中立的系统提示骨架(适用于任何模型)
You are a {role}.
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}哪些能在(几乎)每个模型之间迁移
这就是把 Claude 学透在任何地方都能受益的原因——这些技能是可移植的:
- 提示结构 —— 清晰的角色、明确的任务、示例、输出格式 → 提示基础
- 上下文工程 —— 决定窗口里放什么 → 基础
- 工具使用 / 函数调用 —— 各家厂商的模式几乎相同 → 工具使用
- 检索(RAG) —— 让答案立足于你的数据 → RAG
- 评估 —— 度量质量,以便诚实地比较模型 → 评估
- 结构化输出 —— 让结果可被机器读取 → 结构化输出
哪些不能干净地迁移:确切的 API 形态、工具调用的 JSON 细节、token 上限、定价,以及安全/拒绝行为——务必逐家厂商重新核对。
全景术语
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。1 / 4
自我检测
0/3- 以原型来思考(闭源前沿 vs 开放权重);排名会翻腾,原型不会。
- 按约束 + 一个用你自己数据做的小型评估来选择——绝不要按排行榜的炒作。
- 大多数技能(提示、上下文、工具、RAG、评估)在每个模型之间通用——这就是把 Claude 学透在任何地方都能受益的原因。
- 名称、价格、上限和基准会很快过时——请到源头核实当下的具体情况。
来源与延伸阅读
- Anthropic — 模型概览 —— Claude 当前的产品阵容。
- OpenAI — 模型 · Google — Gemini 模型 · Meta — Llama · Mistral — 模型 —— 各家厂商自己的、当下的权威来源。
- Artificial Analysis —— 独立且频繁更新的能力/价格/速度对比。
- Ollama · LM Studio —— 在本地运行开放权重模型。
下一步
- 深入核心 → 我该用哪个 Claude?
- 让你的选择可度量 → 评估
- 可迁移的技能 → 提示基础 · 基础