跳到主要内容

AI 模型全景:在 Claude、ChatGPT、Gemini 与开源模型之间做选择

入门

AILmanac 的核心是 Claude——但技能是可迁移的。同样的提示、上下文工程、工具使用与评估习惯,几乎适用于任何现代模型。本页把视野放宽到整个领域:主要参与者有哪些、如何为任务做选择,以及无论你用哪一个都能通用的部分。

What you'll learn
  • 了解主要的 AI 助手与模型,以及每一个属于哪种原型
  • 使用一套可复用的框架为特定任务挑选模型——而不是跟风炒作
  • 看清哪些技能能在每个模型之间通用(大多数都能)
  • 知道哪些事实会很快过时——以及去哪里核对当下的真实情况

主要参与者(按原型划分,而非排名)

原型来思考——排名会洗牌,原型是稳定的:

  • Anthropic — Claude · 前沿闭源模型。以编码、智能体/工具使用、长上下文推理,以及安全优先的姿态著称。(本站其余全部内容都在这里深入展开。)
  • OpenAI — ChatGPT / GPT · 前沿闭源模型,拥有最大的消费者生态系统,以及非常广泛的多模态功能集。
  • Google — Gemini · 前沿闭源模型,深度嵌入 Google 的产品与数据,拥有非常大的上下文窗口。
  • Meta — Llama · 开放权重:你可以下载并自行托管它。是大量本地/开源生态系统的中坚力量。
  • Mistral · 开放权重 + API,来自欧洲,注重效率。
  • xAI — Grok · 闭源,与 X 集成,倚重实时信号。
  • DeepSeek / Qwen(阿里巴巴) · 强大的开放权重模型,以性价比著称;在自托管场景中很受欢迎。
Pro tip
  • 最大的实际分岔在于:闭源前沿模型(原始能力最强,仅托管提供)与开放权重模型(可自托管、私密、可定制,在大规模运行时往往更便宜)。
  • 别按排行榜购物。唯一重要的基准,是用你自己的数据跑你自己的任务。

如何为一项任务选择模型

Guided walkthrough1 of 6
  1. 它必须做什么,以及哪些不可妥协:数据隐私(数据能否离开你的网络?)、预算、延迟、最大上下文、受监管领域、设备端要求。

厂商中立的系统提示骨架(适用于任何模型)

You are a {role}. 
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}

哪些能在(几乎)每个模型之间迁移

这就是把 Claude 学透在任何地方都能受益的原因——这些技能是可移植的:

  • 提示结构 —— 清晰的角色、明确的任务、示例、输出格式 → 提示基础
  • 上下文工程 —— 决定窗口里放什么 → 基础
  • 工具使用 / 函数调用 —— 各家厂商的模式几乎相同 → 工具使用
  • 检索(RAG) —— 让答案立足于你的数据 → RAG
  • 评估 —— 度量质量,以便诚实地比较模型 → 评估
  • 结构化输出 —— 让结果可被机器读取 → 结构化输出

哪些不能干净地迁移:确切的 API 形态、工具调用的 JSON 细节、token 上限、定价,以及安全/拒绝行为——务必逐家厂商重新核对。

全景术语
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。
1 / 4

自我检测

0/3
  1. 为你的任务在两个模型之间做选择,最可靠的唯一方法是什么?
  2. 你需要处理不能离开你网络的敏感数据。你会倾向哪一边?
  3. 以下哪一项在厂商之间无法干净地迁移?
Key takeaways
  • 以原型来思考(闭源前沿 vs 开放权重);排名会翻腾,原型不会。
  • 按约束 + 一个用你自己数据做的小型评估来选择——绝不要按排行榜的炒作。
  • 大多数技能(提示、上下文、工具、RAG、评估)在每个模型之间通用——这就是把 Claude 学透在任何地方都能受益的原因。
  • 名称、价格、上限和基准会很快过时——请到源头核实当下的具体情况。

来源与延伸阅读

下一步