跳到主要内容

面向 Claude 用户的 Kimi K2

进阶

你已经习惯用 Claude 的方式思考。然后 r/LocalLLaMA 上就没完没了地讨论 Kimi K2——Moonshot AI 的开放权重、智能体优先的模型,它能连续调用数百步工具而不丢失主线,价格却只有前沿模型的一小部分。真正让它区别于其他每一个"换到 X"故事的地方在于:因为 Moonshot 提供了 Anthropic 兼容的端点,你只需改动两个环境变量,就能让现有的 Claude Code 对接 Kimi K2。你工作流里的其他一切都不用动。本页把你的 Claude 心智模型映射到 Kimi K2 上,展示确切的切换方式,并指出少数几个真正不同的地方。

What you'll learn
  • 把 Claude 概念对应到 Kimi K2 的等价物(Kimi 应用、Moonshot 的 API、K2-Instruct 对比 K2 Thinking、开放权重)
  • 理解那一个结构性大差异:Kimi K2 是开放权重(Modified MIT)且为 MoE,而非封闭的前沿模型
  • 通过 Moonshot 的 Anthropic 兼容端点,用两个变量的切换让 Claude Code 对接 Kimi K2
  • 在依赖这个兼容层之前,了解真正的分歧点和注意事项
  • 知道 Kimi K2 通常在什么时候是更好的选择——长时智能体运行、成本敏感的编码,以及自托管

60 秒概念对照

如果你只读一节,就读这一节。下面是你在 Claude 里熟悉的东西如何对应到 Kimi 的世界:

在 Claude 里你称之为……在 Kimi 的世界里它是……同一个思路?
Claude.ai(聊天应用)Kimi 应用(kimi.com / 移动端)是——面向消费者/助手的界面
模型选择器(Opus / Sonnet / Haiku)K2 变体——K2-Instruct(快速智能体)和 K2 Thinking(深度推理)是——按速度对比推理深度来选
扩展思考K2 Thinking 的交错式思维链 + 工具调用是——在这里推理是一个变体,而不只是一个开关
Anthropic Messages APIMoonshot 的原生 API 以及一个 Anthropic 兼容端点部分——兼容层说的是你的方言
工具使用Kimi 的原生工具调用(设计上智能体优先)是——同样的声明→调用→执行→返回循环
封闭权重,仅托管Hugging Face 上的开放权重(Modified MIT)否——这是最大的差异;你可以自托管
Claude Code对接 Kimi 的 Claude Code,或 Moonshot 自家的 Kimi CLI大体是——同样的载体,背后是不同的模型

最重要的一行是倒数第二行:Kimi K2 是开放权重的。 下游的一切——自托管、低价、宽松的许可证——都源于此。

Kimi K2 究竟是什么

Kimi K2 是一个 Mixture-of-Experts(专家混合) 模型:大约 1T 总参数,每个 token 约 32B 激活(384 个专家,每个 token 选中 8 个)。它在约 15.5T tokens 上完成预训练,并以 Modified MIT License 发布——真正开放的权重,你可以下载、检视并运行。Moonshot 把它构建为智能体优先:模型卡将其描述为"专为工具使用、推理和自主问题解决而设计"。

有两个变体对你最重要:

  • K2-Instruct —— 即插即用的智能体/聊天模型。128K 上下文。自报 SWE-bench Verified 65.8%、LiveCodeBench 53.7%、MMLU 89.5%。这是你的 Sonnet 型日常主力。
  • K2 Thinking —— 推理智能体。它端到端地把思维链与函数调用交错在一起,并在 200–300 次连续工具调用中保持稳定——这正是人们为长时程智能体所津津乐道的特质。原生 INT4,256K 上下文。自报 SWE-bench Verified 71.3%、Humanity's Last Exam(带工具)44.9%、BrowseComp 60.2%。这是你的"Opus 加扩展思考"对应物。
What you'll learn
  • 开放权重改变了'切换'的含义。用 Grok 或 Gemini,你租的是一个黑盒;用 Kimi K2,你还可以下载它、在自己的硬件上运行,并且永远不把任何一个 token 发到外面。这也正是它成为我们开放模型和本地智能体页面锚点的原因。

面向 Claude 用户的杀手级特性:让 Claude Code 对接 Kimi

与大多数替代方案不同,你不必离开你的载体。Moonshot 暴露了一个 Anthropic 兼容端点/anthropic/v1/messages),所以 Claude Code——它说的是 Anthropic Messages API——只需覆盖两个环境变量就能与 Kimi K2 对话。

Guided walkthrough1 of 4
  1. 在 Moonshot 的开发者平台(platform.moonshot.ai,或中国大陆的 platform.moonshot.cn)上创建账户并生成一个 API 密钥。它以 sk- 开头。

让 Claude Code 对接 Kimi K2(shell)

# Route Claude Code to Moonshot's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="sk-your-moonshot-api-key"

# Then just run Claude Code as normal:
claude

# (In mainland China, use https://api.moonshot.cn/anthropic instead.)
Watch out
  • 兼容层是接近,而非完全一致。Moonshot 的 Anthropic 兼容接口并未实现每一个 Anthropic 特性(例如 document 参数),而且在 thinking 字段附近存在已知的分歧,可能在子智能体或结构化输出请求中浮现。如果某个特性表现异常,先怀疑兼容层再怀疑你的配置——并查看 Moonshot 当前的兼容性文档。

超越 Claude Code:原始 API 与自托管

如果你要写自己的集成,而不是驱动 Claude Code,你有三条路:

  • Anthropic 兼容端点 —— 通过改动 base URL 和密钥来复用你的 Claude/Messages 型客户端(如上)。如果你的代码本就是 Anthropic 型的,这是摩擦最小的方案。
  • Moonshot 的原生 API —— Moonshot 还提供一个 OpenAI 兼容界面,所以 OpenAI 型代码也可以通过 base URL + 密钥的切换来迁移。如果你的技术栈来自 OpenAI 那一侧,这很方便。
  • 自托管权重 —— 从 Hugging Face 下载,并用一个支持 Kimi 原生工具解析的推理引擎(vLLM、SGLang 及其同类)来提供服务。这是隐私/成本的终极方案:没有任何 token 离开你的基础设施。本地路径参见 用 Ollama 在本地运行模型私有本地 AI 技术栈

哪些可以原样照搬

你几乎所有的 Claude 手艺都能延续过来,因为 Kimi K2 像 Claude 一样是智能体优先、工具原生的:

  • 提示习惯。 清晰的指令、明确的约束、示例和角色设定都管用。参见 提示基础跨模型移植提示
  • 工具使用的纪律。 声明→调用→执行→返回循环与 Claude 的 工具使用 形状相同。Kimi 为此而生,并且在极长的工具链上依然稳健。
  • 上下文工程。 紧凑的上下文、良好的检索和结构化输入同样重要——在长时智能体运行中可以说更重要。参见 上下文工程
  • 驱动智能体的技能。 划定任务范围、审查 diff、让运行保持在轨,这些能直接移植到任何载体——包括对接 Kimi 的 Claude Code。参见 什么是 Claude Code?长时运行的智能体载体

Kimi K2 通常在什么时候出彩

  • 长时程智能体运行。 招牌特质是在数百次连续工具调用中保持稳定——当一个任务是工具使用的马拉松而非单个答案时,就用 K2 Thinking。
  • 规模化的成本敏感编码。 在开放权重的经济性下取得强劲的自报 SWE-bench 成绩,使它成为高并发编码智能体的天然 A/B 对象。
  • 隐私与自托管。 开放权重意味着你可以完全在自己的硬件上运行它——这是任何封闭前沿模型都无法提供的一点。
  • 保住你的 Claude Code 肌肉记忆。 当你想要一个更便宜或自托管的模型,却又不想重新学一套工作流时,这个两变量切换很难被超越。

大多数时候诚实的答案是:谁在你关心的任务上赢得评测——以及你的隐私和预算约束允许谁。 技能是可移植的;搭建和评测才是真正的工作。想了解与厂商无关的选择方式,参见 如何选择模型各家厂商的 AI 成本几何

Kimi 到 Claude 词汇对照
按 Enter 或空格键翻转卡片。使用左右方向键在卡片之间切换。已显示术语。
1 / 6

自我检查

0/3
  1. 你想试试 Kimi K2,又不想离开你的 Claude Code 设置。最持久、摩擦最小的做法是什么?
  2. Kimi K2 与 Grok 或 Gemini 这类封闭模型之间,那一个最大的结构性差异是什么?
  3. Anthropic 兼容端点能用,但你依赖的一个文档上传功能表现异常。正确的直觉是什么?
Key takeaways
  • Kimi K2 是 Moonshot 的开放权重、智能体优先的 MoE 模型(约 1T 总参数 / 约 32B 激活,Modified MIT)——开放权重就是全部故事:自托管、低成本、宽松许可。
  • 两个变体干净地映射到你的 Claude 心智模型上:K2-Instruct(快速智能体 ≈ Sonnet)和 K2 Thinking(深度推理 + 交错工具调用 ≈ 带扩展思考的 Opus)。
  • 对 Claude 用户最突出的一点:Moonshot 的 Anthropic 兼容端点让你通过覆盖两个环境变量就能让 Claude Code 对接 Kimi——工作流零改动。
  • 兼容层是接近而非一致——一些 Anthropic 特性(例如 document)和 thinking 字段行为存在分歧;出问题时查 Moonshot 当前的文档。
  • 在长时智能体运行、成本敏感的编码,以及隐私/自托管场景下选择 Kimi K2——但变体名称、分数和价格会很快过时,所以要核实并评测。

Sources & further reading

Next