面向 Claude 用户的 Kimi K2
你已经习惯用 Claude 的方式思考。然后 r/LocalLLaMA 上就没完没了地讨论 Kimi K2——Moonshot AI 的开放权重、智能体优先的模型,它能连续调用数百步工具而不丢失主线,价格却只有前沿模型的一小部分。真正让它区别于其他每一个"换到 X"故事的地方在于:因为 Moonshot 提供了 Anthropic 兼容的端点,你只需改动两个环境变量,就能让现有的 Claude Code 对接 Kimi K2。你工作流里的其他一切都不用动。本页把你的 Claude 心智模型映射到 Kimi K2 上,展示确切的切换方式,并指出少数几个真正不同的地方。
- 把 Claude 概念对应到 Kimi K2 的等价物(Kimi 应用、Moonshot 的 API、K2-Instruct 对比 K2 Thinking、开放权重)
- 理解那一个结构性大差异:Kimi K2 是开放权重(Modified MIT)且为 MoE,而非封闭的前沿模型
- 通过 Moonshot 的 Anthropic 兼容端点,用两个变量的切换让 Claude Code 对接 Kimi K2
- 在依赖这个兼容层之前,了解真正的分歧点和注意事项
- 知道 Kimi K2 通常在什么时候是更好的选择——长时智能体运行、成本敏感的编码,以及自托管
60 秒概念对照
如果你只读一节,就读这一节。下面是你在 Claude 里熟悉的东西如何对应到 Kimi 的世界:
| 在 Claude 里你称之为…… | 在 Kimi 的世界里它是…… | 同一个思路? |
|---|---|---|
| Claude.ai(聊天应用) | Kimi 应用(kimi.com / 移动端) | 是——面向消费者/助手的界面 |
| 模型选择器(Opus / Sonnet / Haiku) | K2 变体——K2-Instruct(快速智能体)和 K2 Thinking(深度推理) | 是——按速度对比推理深度来选 |
| 扩展思考 | K2 Thinking 的交错式思维链 + 工具调用 | 是——在这里推理是一个变体,而不只是一个开关 |
| Anthropic Messages API | Moonshot 的原生 API 以及一个 Anthropic 兼容端点 | 部分——兼容层说的是你的方言 |
| 工具使用 | Kimi 的原生工具调用(设计上智能体优先) | 是——同样的声明→调用→执行→返回循环 |
| 封闭权重,仅托管 | Hugging Face 上的开放权重(Modified MIT) | 否——这是最大的差异;你可以自托管 |
| Claude Code | 对接 Kimi 的 Claude Code,或 Moonshot 自家的 Kimi CLI | 大体是——同样的载体,背后是不同的模型 |
最重要的一行是倒数第二行:Kimi K2 是开放权重的。 下游的一切——自托管、低价、宽松的许可证——都源于此。
Kimi K2 究竟是什么
Kimi K2 是一个 Mixture-of-Experts(专家混合) 模型:大约 1T 总参数,每个 token 约 32B 激活(384 个专家,每个 token 选中 8 个)。它在约 15.5T tokens 上完成预训练,并以 Modified MIT License 发布——真正开放的权重,你可以下载、检视并运行。Moonshot 把它构建为智能体优先:模型卡将其描述为"专为工具使用、推理和自主问题解决而设计"。
有两个变体对你最重要:
- K2-Instruct —— 即插即用的智能体/聊天模型。128K 上下文。自报 SWE-bench Verified 65.8%、LiveCodeBench 53.7%、MMLU 89.5%。这是你的 Sonnet 型日常主力。
- K2 Thinking —— 推理智能体。它端到端地把思维链与函数调用交错在一起,并在 200–300 次连续工具调用中保持稳定——这正是人们为长时程智能体所津津乐道的特质。原生 INT4,256K 上下文。自报 SWE-bench Verified 71.3%、Humanity's Last Exam(带工具)44.9%、BrowseComp 60.2%。这是你的"Opus 加扩展思考"对应物。
- 开放权重改变了'切换'的含义。用 Grok 或 Gemini,你租的是一个黑盒;用 Kimi K2,你还可以下载它、在自己的硬件上运行,并且永远不把任何一个 token 发到外面。这也正是它成为我们开放模型和本地智能体页面锚点的原因。
面向 Claude 用户的杀手级特性:让 Claude Code 对接 Kimi
与大多数替代方案不同,你不必离开你的载体。Moonshot 暴露了一个 Anthropic 兼容端点(/anthropic/v1/messages),所以 Claude Code——它说的是 Anthropic Messages API——只需覆盖两个环境变量就能与 Kimi K2 对话。
- 在 Moonshot 的开发者平台(platform.moonshot.ai,或中国大陆的 platform.moonshot.cn)上创建账户并生成一个 API 密钥。它以 sk- 开头。
- 把 Claude Code 的 Anthropic base URL 和 auth token 指向 Moonshot 而非 Anthropic。你 Claude Code 配置里的其他一切——CLAUDE.md、skills、MCP 服务器、斜杠命令——都不用改。
- 把模型设置为一个当前的 Kimi id(例如某个 kimi-k2 预览/带日期的 id)。模型 id 会轮换——去读 Moonshot 当前的模型列表,而不要硬编码一个旧的。
- 启动 claude 并正常驱动它。把它当作熟悉方向盘背后的一个新模型:重新跑你自己的任务并做对比。同样的载体 ≠ 同样的行为。
让 Claude Code 对接 Kimi K2(shell)
# Route Claude Code to Moonshot's Anthropic-compatible endpoint export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic" export ANTHROPIC_AUTH_TOKEN="sk-your-moonshot-api-key" # Then just run Claude Code as normal: claude # (In mainland China, use https://api.moonshot.cn/anthropic instead.)
- 兼容层是接近,而非完全一致。Moonshot 的 Anthropic 兼容接口并未实现每一个 Anthropic 特性(例如 document 参数),而且在 thinking 字段附近存在已知的分歧,可能在子智能体或结构化输出请求中浮现。如果某个特性表现异常,先怀疑兼容层再怀疑你的配置——并查看 Moonshot 当前的兼容性文档。
超越 Claude Code:原始 API 与自托管
如果你要写自己的集成,而不是驱动 Claude Code,你有三条路:
- Anthropic 兼容端点 —— 通过改动 base URL 和密钥来复用你的 Claude/Messages 型客户端(如上)。如果你的代码本就是 Anthropic 型的,这是摩擦最小的方案。
- Moonshot 的原生 API —— Moonshot 还提供一个 OpenAI 兼容界面,所以 OpenAI 型代码也可以通过 base URL + 密钥的切换来迁移。如果你的技术栈来自 OpenAI 那一侧,这很方便。
- 自托管权重 —— 从 Hugging Face 下载,并用一个支持 Kimi 原生工具解析的推理引擎(vLLM、SGLang 及其同类)来提供服务。这是隐私/成本的终极方案:没有任何 token 离开你的基础设施。本地路径参见 用 Ollama 在本地运行模型 和 私有本地 AI 技术栈。
哪些可以原样照搬
你几乎所有的 Claude 手艺都能延续过来,因为 Kimi K2 像 Claude 一样是智能体优先、工具原生的:
- 提示习惯。 清晰的指令、明确的约束、示例和角色设定都管用。参见 提示基础 和 跨模型移植提示。
- 工具使用的纪律。 声明→调用→执行→返回循环与 Claude 的 工具使用 形状相同。Kimi 为此而生,并且在极长的工具链上依然稳健。
- 上下文工程。 紧凑的上下文、良好的检索和结构化输入同样重要——在长时智能体运行中可以说更重要。参见 上下文工程。
- 驱动智能体的技能。 划定任务范围、审查 diff、让运行保持在轨,这些能直接移植到任何载体——包括对接 Kimi 的 Claude Code。参见 什么是 Claude Code? 和 长时运行的智能体载体。
Kimi K2 通常在什么时候出彩
- 长时程智能体运行。 招牌特质是在数百次连续工具调用中保持稳定——当一个任务是工具使用的马拉松而非单个答案时,就用 K2 Thinking。
- 规模化的成本敏感编码。 在开放权重的经济性下取得强劲的自报 SWE-bench 成绩,使它成为高并发编码智能体的天然 A/B 对象。
- 隐私与自托管。 开放权重意味着你可以完全在自己的硬件上运行它——这是任何封闭前沿模型都无法提供的一点。
- 保住你的 Claude Code 肌肉记忆。 当你想要一个更便宜或自托管的模型,却又不想重新学一套工作流时,这个两变量切换很难被超越。
大多数时候诚实的答案是:谁在你关心的任务上赢得评测——以及你的隐私和预算约束允许谁。 技能是可移植的;搭建和评测才是真正的工作。想了解与厂商无关的选择方式,参见 如何选择模型 和 各家厂商的 AI 成本几何。
自我检查
0/3- Kimi K2 是 Moonshot 的开放权重、智能体优先的 MoE 模型(约 1T 总参数 / 约 32B 激活,Modified MIT)——开放权重就是全部故事:自托管、低成本、宽松许可。
- 两个变体干净地映射到你的 Claude 心智模型上:K2-Instruct(快速智能体 ≈ Sonnet)和 K2 Thinking(深度推理 + 交错工具调用 ≈ 带扩展思考的 Opus)。
- 对 Claude 用户最突出的一点:Moonshot 的 Anthropic 兼容端点让你通过覆盖两个环境变量就能让 Claude Code 对接 Kimi——工作流零改动。
- 兼容层是接近而非一致——一些 Anthropic 特性(例如 document)和 thinking 字段行为存在分歧;出问题时查 Moonshot 当前的文档。
- 在长时智能体运行、成本敏感的编码,以及隐私/自托管场景下选择 Kimi K2——但变体名称、分数和价格会很快过时,所以要核实并评测。
Sources & further reading
- moonshotai/Kimi-K2-Instruct · Hugging Face —— 官方 K2-Instruct 模型卡:架构、许可证和自报基准。
- moonshotai/Kimi-K2-Thinking · Hugging Face —— K2 Thinking 模型卡:交错推理 + 工具调用、上下文和分数。
- moonshotai on Hugging Face —— Moonshot 的完整模型组织,包括更新的小版本发布和 Base 变体。
- MoonshotAI/Kimi-K2 · GitHub —— K2 仓库,包括 Anthropic 兼容端点的讨论和部署说明。
- Introducing Kimi K2 Thinking —— Moonshot 自己对这个思考智能体的阐述。
- Moonshot AI developer platform —— API 密钥、当前模型 id 和定价(任何具体数字的权威来源)。
Next
- 与厂商无关的选择方式 → 如何选择模型
- 更广阔的开放权重版图 → DeepSeek 与 Qwen 开放模型 · 各家厂商的 AI 成本几何
- 自托管权重 → 用 Ollama 在本地运行模型 · 私有本地 AI 技术栈
- 也从其他助手迁移过来? → 面向 Claude 用户的 ChatGPT · 面向 Claude 用户的 Gemini · 面向 Claude 用户的 Grok
- 让长工具链听话 → 长时运行的智能体载体 · 上下文工程