Pular para o conteúdo principal

Kimi K2 para Usuários do Claude

Intermediário

Você já pensa em Claude. Então o r/LocalLLaMA não para de falar sobre o Kimi K2 — o modelo de pesos abertos e agent-first da Moonshot AI, que enfileira chamadas de ferramenta ao longo de centenas de passos sem perder o fio da meada, por uma fração dos preços de fronteira. Aqui está a parte que o torna diferente de toda outra história de "mude para X": como a Moonshot oferece um endpoint compatível com a Anthropic, você pode apontar seu Claude Code existente para o Kimi K2 mudando duas variáveis de ambiente. Nada mais no seu fluxo de trabalho se move. Esta página mapeia seu modelo mental de Claude sobre o Kimi K2, mostra a troca exata e sinaliza o punhado de coisas que genuinamente diferem.

What you'll learn
  • Traduzir conceitos de Claude para seus equivalentes no Kimi K2 (o app Kimi, a API da Moonshot, K2-Instruct vs K2 Thinking, pesos abertos)
  • Entender a única grande diferença estrutural: o Kimi K2 é de pesos abertos (Modified MIT) e MoE, não um modelo de fronteira fechado
  • Apontar o Claude Code para o Kimi K2 via o endpoint compatível com a Anthropic da Moonshot com uma troca de duas variáveis
  • Conhecer as divergências reais e as ressalvas antes de confiar na camada de compatibilidade
  • Saber quando o Kimi K2 tende a ser a melhor escolha — execuções agênticas longas, programação sensível a custos e auto-hospedagem

O mapa de conceitos em 60 segundos

Se você só ler uma seção, leia esta. Veja como as coisas que você conhece em Claude se alinham com o mundo do Kimi:

Em Claude você chama de…No mundo do Kimi é…Mesma ideia?
Claude.ai (o app de chat)O app Kimi (kimi.com / mobile)Sim — a superfície de consumidor/assistente
Seletor de modelo (Opus / Sonnet / Haiku)Variantes do K2 — K2-Instruct (agêntico rápido) e K2 Thinking (raciocínio profundo)Sim — escolha por velocidade vs. profundidade de raciocínio
Pensamento estendidoA cadeia de raciocínio intercalada com chamadas de ferramenta do K2 ThinkingSim — o raciocínio aqui é uma variante, não apenas um interruptor
API Anthropic MessagesA API nativa da Moonshot e um endpoint compatível com a AnthropicEm parte — a camada de compatibilidade fala o seu dialeto
Uso de ferramentasA chamada de ferramenta nativa do Kimi (agent-first por design)Sim — o mesmo loop de declarar→chamar→executar→retornar
Pesos fechados, apenas hospedadoPesos abertos no Hugging Face (Modified MIT)Não — este é o grande; você pode auto-hospedar
Claude CodeClaude Code apontado para o Kimi, ou o próprio Kimi CLI da MoonshotEm grande parte — o mesmo harness, um modelo diferente por trás

A linha mais importante de todas é a penúltima: o Kimi K2 é de pesos abertos. Tudo o que vem depois — auto-hospedagem, o preço baixo, a licença permissiva — decorre disso.

O que o Kimi K2 realmente é

O Kimi K2 é um modelo Mixture-of-Experts: aproximadamente 1T de parâmetros totais com ~32B ativos por token (384 experts, 8 selecionados por token). Foi pré-treinado em ~15,5T tokens e é lançado sob uma Modified MIT License — pesos genuinamente abertos que você pode baixar, inspecionar e executar. A Moonshot o construiu agent-first: o cartão de modelo o descreve como "especificamente projetado para uso de ferramentas, raciocínio e resolução autônoma de problemas".

Duas variantes importam mais para você:

  • K2-Instruct — o modelo agêntico/chat de encaixe direto. Contexto de 128K. 65,8% auto-reportado no SWE-bench Verified, 53,7% no LiveCodeBench, 89,5% no MMLU. Este é o seu cavalo de batalha diário no formato Sonnet.
  • K2 Thinking — o agente de raciocínio. Ele intercala a cadeia de raciocínio com chamadas de função de ponta a ponta e permanece estável ao longo de 200–300 chamadas de ferramenta sequenciais — a característica pela qual as pessoas se entusiasmam para agentes de longo horizonte. INT4 nativo, contexto de 256K. 71,3% auto-reportado no SWE-bench Verified, 44,9% no Humanity's Last Exam (com ferramentas), 60,2% no BrowseComp. Este é o seu análogo do Opus com pensamento estendido.
What you'll learn
  • Pesos abertos mudam o que 'trocar' significa. Com Grok ou Gemini você aluga uma caixa-preta; com o Kimi K2 você também pode baixá-lo, executá-lo no seu próprio hardware e nunca enviar um token para fora. Essa é a mesma razão pela qual ele ancora nossas páginas de modelos abertos e agentes locais.

O recurso matador para usuários do Claude: aponte o Claude Code para o Kimi

Ao contrário da maioria das alternativas, você não precisa abandonar seu harness. A Moonshot expõe um endpoint compatível com a Anthropic (/anthropic/v1/messages), então o Claude Code — que fala a API Anthropic Messages — pode conversar com o Kimi K2 ao sobrescrever duas variáveis de ambiente.

Guided walkthrough1 of 4
  1. Crie uma conta na plataforma de desenvolvedores da Moonshot (platform.moonshot.ai, ou platform.moonshot.cn na China continental) e gere uma chave de API. Ela começa com sk-.

Aponte o Claude Code para o Kimi K2 (shell)

# Route Claude Code to Moonshot's Anthropic-compatible endpoint
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="sk-your-moonshot-api-key"

# Then just run Claude Code as normal:
claude

# (In mainland China, use https://api.moonshot.cn/anthropic instead.)
Watch out
  • A camada de compatibilidade é próxima, não idêntica. A interface compatível com a Anthropic da Moonshot não implementa todos os recursos da Anthropic (por exemplo, o parâmetro document), e há divergências conhecidas em torno do campo thinking que podem surgir com subagentes ou requisições de saída estruturada. Se um recurso se comportar de forma estranha, suspeite da camada de compatibilidade antes da sua configuração — e consulte a documentação de compatibilidade atual da Moonshot.

Além do Claude Code: a API bruta e a auto-hospedagem

Se você está escrevendo sua própria integração em vez de operar o Claude Code, tem três caminhos:

  • Endpoint compatível com a Anthropic — reutilize seu cliente no formato Claude/Messages mudando a base URL e a chave (como acima). Menor atrito se seu código já estiver no formato Anthropic.
  • API nativa da Moonshot — a Moonshot também oferece uma superfície compatível com a OpenAI, então código no formato OpenAI migra por troca de base-URL + chave também. Útil se sua stack veio do lado da OpenAI.
  • Auto-hospede os pesos — baixe do Hugging Face e sirva com um motor de inferência que suporte o parsing de ferramentas nativo do Kimi (vLLM, SGLang e afins). Este é o objetivo final de privacidade/custo: nenhum token deixa sua infraestrutura. Veja Rode Modelos Localmente com Ollama e Stack de IA Privada e Local para o caminho local.

O que se transfere sem mudanças

Quase todo o seu ofício com Claude se transfere, porque o Kimi K2 é agent-first e nativo de ferramentas como o Claude:

  • Hábitos de prompting. Instruções claras, restrições explícitas, exemplos e enquadramento de papel funcionam todos. Veja Fundamentos de Prompting e Portando Prompts Entre Modelos.
  • Disciplina de uso de ferramentas. O loop de declarar→chamar→executar→retornar tem o mesmo formato que o Uso de Ferramentas do Claude. O Kimi é feito para isso e se sustenta ao longo de cadeias de ferramentas muito longas.
  • Engenharia de contexto. Contexto enxuto, boa recuperação e entradas estruturadas importam tanto — indiscutivelmente mais em execuções agênticas longas. Veja Engenharia de Contexto.
  • Habilidades de conduzir agentes. Delimitar tarefas, revisar diffs e manter as execuções nos trilhos se transferem diretamente para qualquer harness — incluindo o Claude Code apontado para o Kimi. Veja O que é o Claude Code? e Harnesses de Agente de Longa Duração.

Quando o Kimi K2 tende a brilhar

  • Execuções agênticas de longo horizonte. A característica de destaque é a estabilidade ao longo de centenas de chamadas de ferramenta sequenciais — recorra ao K2 Thinking quando uma tarefa for uma maratona de uso de ferramentas, não uma resposta única.
  • Programação sensível a custos em escala. Resultados fortes auto-reportados no SWE-bench com economia de pesos abertos o tornam um alvo natural de A/B para agentes de programação de alto volume.
  • Privacidade e auto-hospedagem. Pesos abertos significam que você pode executá-lo totalmente no seu próprio hardware — a única coisa que nenhum modelo de fronteira fechado pode oferecer.
  • Manter a memória muscular do seu Claude Code. Quando você quer um modelo mais barato ou auto-hospedado sem reaprender um fluxo de trabalho, a troca de duas variáveis é difícil de superar.

A resposta honesta na maioria das vezes: o que vencer sua avaliação na tarefa que importa — e o que suas restrições de privacidade e orçamento permitirem. A habilidade é portátil; a configuração e a avaliação são o trabalho de verdade. Para a forma neutra em relação a fornecedores de escolher, veja Escolhendo um Modelo e Quanto Custa a IA Entre Fornecedores.

Vocabulário Kimi para Claude
Pressione Enter ou Espaço para virar o cartão. Use as setas esquerda e direita para navegar entre os cartões.Termo exibido.
1 / 6

Teste você mesmo

0/3
  1. Você quer experimentar o Kimi K2 sem abandonar sua configuração do Claude Code. Qual é a jogada duradoura e de menor atrito?
  2. Qual é a única maior diferença estrutural entre o Kimi K2 e modelos fechados como Grok ou Gemini?
  3. O endpoint compatível com a Anthropic funciona, mas um recurso de upload de documento do qual você depende se comporta mal. Qual é o instinto certo?
Key takeaways
  • O Kimi K2 é o modelo MoE de pesos abertos e agent-first da Moonshot (~1T total / ~32B ativos, Modified MIT) — os pesos abertos são a história toda: auto-hospedagem, custo baixo, licença permissiva.
  • Duas variantes mapeiam limpamente sobre seu modelo mental de Claude: K2-Instruct (agêntico rápido ≈ Sonnet) e K2 Thinking (raciocínio profundo + chamadas de ferramenta intercaladas ≈ Opus com pensamento estendido).
  • O destaque para usuários do Claude: o endpoint compatível com a Anthropic da Moonshot permite apontar o Claude Code para o Kimi ao sobrescrever duas variáveis de ambiente — sem mudança de fluxo de trabalho.
  • A camada de compatibilidade é próxima, não idêntica — alguns recursos da Anthropic (ex.: document) e comportamentos do campo thinking divergem; consulte a documentação atual da Moonshot quando algo der problema.
  • Recorra ao Kimi K2 em execuções agênticas longas, programação sensível a custos e privacidade/auto-hospedagem — mas nomes de variantes, pontuações e preços ficam desatualizados rápido, então verifique e avalie.

Fontes e leitura adicional

Próximo