Kimi K2 pour les utilisateurs de Claude
Vous pensez déjà en Claude. Puis r/LocalLLaMA n'arrête pas de parler de Kimi K2 — un modèle chinois à poids ouverts que les gens n'arrêtent pas d'appeler « le Claude ouvert pour les agents ». Un coéquipier veut l'exécuter sur son propre matériel ; un projet a besoin de poids qu'il peut réellement télécharger ; quelqu'un vous tend une base de code de forme OpenAI et demande si Moonshot est un backend moins cher. Cette page projette votre modèle mental Claude sur la famille Kimi K2 de Moonshot AI, et — plus utile — vous dit la poignée de choses à son sujet qui surprennent réellement les gens, chacune sourcée.
- Comprendre ce que Kimi K2 est réellement : un MoE parcimonieux d'un billion de paramètres avec seulement 32 Md actifs par token
- Apprendre les trois choses non évidentes que K2 fait différemment d'une sortie de modèle typique (poids INT4 natifs, chaînes d'outils de 200 à 300 étapes, une licence vraiment permissive)
- Connaître la lignée K2 — K2-Instruct, K2 Thinking, et la ligne K2.x Code — et laquelle privilégier
- Pointer une base de code de forme Claude ou de forme OpenAI vers Kimi en quelques lignes, et savoir quand il bat le recours à Claude
La version en une phrase
Kimi K2 est un modèle à poids ouverts (téléchargeable, auto-hébergeable), Mixture-of-Experts d'un billion de paramètres de Moonshot AI, ajusté spécifiquement pour l'usage agentique d'outils — de longues chaînes « appelle un outil, lis le résultat, décide du prochain coup » — et publié sous une licence assez permissive pour un usage commercial.
Cette partie « poids ouverts » est toute la raison de s'y intéresser. Les poids de Claude ne quittent jamais Anthropic ; vous louez le modèle via une API. Les poids de Kimi K2 sont sur Hugging Face — vous pouvez les télécharger, les exécuter dans votre propre centre de données, les affiner et les inspecter. Si votre contrainte est les données ne peuvent pas quitter notre réseau ou nous devons posséder le modèle, c'est une catégorie d'outil différente de Claude, pas une version moins chère. (Pour les équivalents côté Claude de l'auto-hébergement et des configurations hybrides, voir Claude + modèles locaux et choisir un modèle.)
Trois choses sur K2 qui surprennent les gens
La plupart des pages « nouveau modèle ouvert » ne font que redire le tableau de benchmarks. Voici les parties réellement non évidentes — les choses que la plupart des utilisateurs de Claude ne savent pas jusqu'à ce que quelqu'un les leur signale.
1. C'est un billion de paramètres, mais seulement ~3 % s'activent à la fois
K2 est un Mixture-of-Experts parcimonieux : 1 billion de paramètres au total, mais seulement 32 milliards activés par token. Le routeur choisit 8 experts sur 384 (plus un expert partagé toujours actif) pour chaque token. Le modèle a donc la capacité de connaissance d'un réseau d'un billion de paramètres, mais chaque passe avant ne paie que ~32 Md de calcul.
Pourquoi cela compte pour vous : « 1 T de paramètres » sonne comme s'il fallait un superordinateur, et pour contenir les poids il en faut un (c'est beaucoup de VRAM). Mais le coût d'inférence par token suit le compte des 32 Md actifs, pas le billion. C'est le même pari architectural derrière les plus gros modèles MoE de DeepSeek et Qwen — voir Modèles ouverts DeepSeek & Qwen pour l'air de famille.
2. Les poids publiés sont déjà en INT4 — exprès
Normalement vous téléchargez un modèle en pleine précision et vous le quantifiez ensuite vous-même pour le faire tenir, perdant un peu de qualité au passage. Kimi K2 Thinking inverse cela : Moonshot a appliqué l'entraînement conscient de la quantification (QAT) pendant le post-entraînement, livrant les poids MoE nativement en INT4. Parce que le modèle a été entraîné pour être en INT4, la quantification est quasi sans perte — et Moonshot rapporte une génération environ 2× plus rapide en conséquence.
L'implication pratique : la version « petite, rapide » n'est pas une pensée après coup dégradée — c'est le modèle de référence. Vous ne choisissez pas entre « le vrai » et « le quantifié ».
- Règle empirique : un modèle INT4 a besoin d'environ un demi-octet par paramètre pour contenir les poids. Un modèle INT4 d'un billion de paramètres reste un déploiement multi-GPU sérieux — « poids ouverts » ne veut pas dire « tourne sur votre portable ». Budgétez en conséquence, ou louez-le via un point d'accès hébergé.
3. Il reste cohérent sur 200 à 300 appels d'outils
C'est le chiffre qui a fait de K2 Thinking une histoire. Moonshot rapporte que le modèle maintient un comportement cohérent et orienté vers un but sur jusqu'à 200 à 300 invocations d'outils consécutives — là où, selon eux, les systèmes d'agent antérieurs ont tendance à dériver ou perdre le fil après 30 à 50 étapes.
Si vous avez construit des agents, vous connaissez le mode d'échec : c'est bien pour dix étapes, puis il oublie son propre but, répète un appel d'outil, ou hallucine un résultat. Un modèle ajusté pour survivre à des centaines d'étapes vise carrément l'agent à long horizon — boucles de recherche, refactorisations multi-fichiers, tâches naviguer-puis-synthétiser. C'est le même problème autour duquel l'outillage d'agents de Claude est bâti, abordé depuis le côté poids ouverts.
La lignée K2 — laquelle voulez-vous ?
« Kimi K2 » est une famille, pas un seul modèle. Les trois que vous rencontrerez réellement :
Ce qui se transfère depuis Claude (presque tout)
Vos instincts de prompt se reportent. Instructions claires, formats de sortie explicites, exemples few-shot, « réfléchis étape par étape », donner au modèle des outils avec de bonnes descriptions — tout cela fonctionne de la même façon, parce que ce sont des propriétés des transformeurs ajustés par instruction, pas de Claude spécifiquement. Si vous voulez la version plus profonde de pourquoi les techniques voyagent entre modèles, voir porter les prompts entre modèles.
Deux vraies différences à garder à l'esprit :
- Format d'appel d'outil. L'API de K2 est compatible OpenAI, donc les définitions d'outils/fonctions suivent le schéma OpenAI, pas le bloc
toolsd'Anthropic. Si vous venez de l'API de Claude, c'est le principal changement de forme. (En venant d'une base de code OpenAI, c'est presque un remplacement direct.) - Le raisonnement est un mode, pas un curseur. Avec Claude vous ajustez la réflexion et l'effort. K2 Thinking et la ligne Code sont toujours en mode réflexion et préservent le raisonnement d'un tour à l'autre ; vous choisissez le modèle, plutôt que de doser l'effort par appel.
Essayez-le en quelques lignes
Parce que l'API parle le dialecte d'OpenAI, vous pointez un client OpenAI existant vers l'URL de base de Moonshot et échangez le nom du modèle. Pas de nouveau SDK.
Appeler Kimi K2 via le point d'accès compatible OpenAI (Python)
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_KEY",
base_url="https://api.moonshot.ai/v1", # OpenAI-compatible
)
resp = client.chat.completions.create(
model="kimi-k2-thinking", # or a K2 Code model
messages=[
{"role": "system", "content": "You are a careful research agent. Use tools; verify before you conclude."},
{"role": "user", "content": "Find the three most-starred MCP server repos and summarize what each does."},
],
# tools=[...] # OpenAI-style function/tool schema
)
print(resp.choices[0].message.content)- Pour l'auto-hébergement, tirez les poids depuis le dépôt Hugging Face de Moonshot. Pour juste l'essayer, utilisez l'API hébergée de Moonshot (compatible OpenAI) ou un agrégateur comme OpenRouter.
- Réglez base_url sur le point d'accès de Moonshot et le modèle sur une variante K2. Le code OpenAI existant — y compris l'appel d'outils/fonctions — tourne presque sans changement.
- K2 Thinking pour les longues boucles d'agent/recherche ; un modèle K2.x Code pour la programmation autonome ; K2-Instruct pour l'usage général d'outils sans phase de raisonnement lourde.
- Rappelez-vous la découpe 1 T/32 Md : plutôt bon marché par token, mais héberger les poids complets est un engagement multi-GPU. Louez un point d'accès hébergé si vous n'avez pas besoin de posséder le modèle.
Quand recourir à Kimi K2 plutôt qu'à Claude
Aucun n'est strictement meilleur — ils résolvent des contraintes différentes. Recourez à Kimi K2 quand :
- Vous avez besoin des poids. Données isolées (air-gapped), conformité sur site, « le modèle ne peut pas quitter notre réseau », ou vous voulez affiner sur des données propriétaires. C'est la raison décisive, et Claude ne peut pas la satisfaire par conception.
- Vous voulez une licence permissive. K2 est livré sous une Licence MIT Modifiée couvrant à la fois le code et les poids — inhabituellement libérale pour un modèle à l'échelle frontière, et favorable à l'usage commercial.
- La tâche est une longue boucle d'agent lourde en outils et vous voulez un modèle ouvert construit spécifiquement pour cette endurance.
Recourez à Claude quand vous voulez la plateforme gérée autour du modèle — mise en cache des prompts, mémoire et édition de contexte, agents gérés, l'usage de l'ordinateur, l'application de bureau, et une pile de support/sécurité que vous n'avez pas à exploiter vous-même. Avec Claude vous louez la capacité ; avec K2 vous possédez les poids et exploitez l'infrastructure. Ce compromis — posséder-et-exploiter vs. louer-et-se-détendre — est la vraie décision, pas un écart de benchmark. Pour le côté coût de cette comparaison entre fournisseurs, voir ce que l'IA coûte chez les fournisseurs.
Kimi K2 Thinking, en chiffres
Les figures rapportées par Moonshot pour la sortie K2 Thinking, pour orientation (voir la VerifyNote ci-dessus — elles bougent) :
- Architecture : 1 T de paramètres au total · 32 Md actifs · 384 experts (8 sélectionnés + 1 partagé) · attention MLA · 61 couches
- Contexte : ~256K tokens
- Poids : INT4 natif via QAT, génération ~2× plus rapide
- Endurance agentique : cohérent sur 200 à 300 appels d'outils séquentiels
- Benchmarks (rapportés par Moonshot) : HLE avec outils 44,9 · BrowseComp 60,2 · SWE-bench Verified 71,3 · LiveCodeBench V6 83,1
- Licence : MIT Modifiée
Check yourself
0/3Sources et lectures complémentaires
- Kimi K2 Thinking — fiche du modèle (Hugging Face) — architecture, INT4/QAT natif, chiffre des 200 à 300 appels d'outils, benchmarks, Licence MIT Modifiée
- Kimi K2 — GitHub (Moonshot AI) — la série de modèles, les poids et le rapport technique
- moonshotai/Kimi-K2-Instruct (Hugging Face) — la base instruct/agentique de la famille
- Kimi K2.7 Code (OpenRouter) — la ligne codage : long contexte, toujours-réfléchissant, entrée multimodale, tarification actuelle
- Connexes sur AILmanac : Modèles ouverts DeepSeek & Qwen · Claude + modèles locaux · Porter les prompts entre modèles · Ce que l'IA coûte chez les fournisseurs