Aller au contenu principal

Kimi K3 : le plus grand modèle open-weight au monde

Intermédiaire

Le 16 juillet 2026, Moonshot AI a livré Kimi K3 — un modèle Mixture-of-Experts de 2,8 mille milliards de paramètres et actuellement la plus grande sortie open-weight au monde à cette classe. Les gros titres ont appelé cela le moonshot du labo chinois. Le vrai chiffre à surveiller est plus discret : K3 s'est placé quatrième sur l'Artificial Analysis Intelligence Index, derrière Claude Fable 5 et GPT-5.6 Sol, mais nettement devant Claude Opus 4.8. Pour un modèle dont les poids complets atterrissent sur Hugging Face le 27 juillet 2026, c'est une phrase inhabituelle à écrire.

Cette page couvre ce qui est véritablement non évident à propos de K3 — les changements architecturaux, le piège tarifaire qui le fait paraître cher jusqu'à ce que vous vérifiiez le taux de cache hit, et les tâches spécifiques où il surpasse tous les autres modèles, open ou fermés.

What you'll learn
  • Comprendre pourquoi 2,8T paramètres ne signifie pas 2,8T de calcul : l'arithmétique MoE et comment l'activation sparse fonctionne
  • Apprendre les trois innovations architecturales de K3 (KDA, AttnRes, LatentMoE) qui lui donnent une efficacité de scaling 2,5× meilleure que K2
  • Connaître le calcul de prix de cache-hit : pourquoi K3 coûte plus près de 0,30 $/M que 3,00 $/M dans les charges de codage réelles
  • Placer K3 dans le paysage des benchmarks : où il mène, où il traîne, et ce que la mise en garde sur le taux d'hallucination signifie
  • Démarrer avec l'API en trois lignes en utilisant un client compatible OpenAI

La version en une phrase

Kimi K3 est un modèle Mixture-of-Experts sparse open-weight (poids complets tombant le 27 juillet 2026), 2,8 mille milliards de paramètres de Moonshot AI, ajusté pour le codage agentique long horizon et le travail de connaissance, avec vision native et une fenêtre de contexte d'un million de tokens — au prix d'une API de frontière mais souvent moins cher en pratique parce que les charges de codage touchent le cache de prompt à plus de 90 % du temps.

Trois choses sur K3 qui ne sont pas évidentes d'après les titres

1. "2,8 mille milliards de paramètres" ne signifie pas 2,8 mille milliards d'activations par token

Le chiffre du titre est dramatique, mais K3 est un modèle Mixture-of-Experts. Il a 896 sous-réseaux experts, et seulement 16 experts s'activent par token — c'est le composant "Stable LatentMoE". Le modèle est énorme en stockage mais compact en calcul par forward pass. À l'inférence, l'empreinte de paramètres actifs est bien plus petite que 2,8T. C'est le même compromis architectural que DeepSeek V4 Pro (qui utilise aussi MoE), et c'est pourquoi un modèle de cette taille peut tourner efficacement sur du matériel gérable une fois les poids auto-hébergés.

L'implication pratique : ne comparez pas les comptes de paramètres directement entre modèles denses et MoE. Un MoE 2,8T avec 16/896 experts actifs a un profil de calcul différent d'un 70B dense — et une exigence de matériel très différente pour l'auto-hébergement.

2. Le taux de cache-hit renverse complètement le calcul de coût

Le prix de l'API K3 est de 3,00 $/M tokens d'entrée et 15,00 $/M tokens de sortie — cher au premier regard. Mais Moonshot offre un prix de cache-hit de 0,30 $/M en entrée (une remise de 10×), et dans les charges de codage, l'entreprise rapporte des taux de cache hit au-dessus de 90 %. Cela signifie que le prix effectif par million de tokens d'entrée pour une session de codage continue est plus proche de 0,30–0,45 $, pas 3,00 $.

Voici la comparaison pratique au coût au niveau de la tâche (sourcée d'évaluations tierces) :

ModèleCoût par tâche agentique
Kimi K30,94 $
GPT-5.6 Sol1,04 $
Claude Opus 4.81,80 $

K3 utilise également 21 % de tokens de sortie en moins que K2.6 — il a appris à être plus succinct — ce qui réduit encore la facture. Aux prix affichés, K3 a l'air premium ; aux prix réalistes par tâche, il sous-cote la concurrence de frontière.

3. Les innovations architecturales sont au moment de l'entraînement, pas post hoc

K3 embarque trois nouveaux composants qui sont cuits dans le modèle depuis l'entraînement :

  • Kimi Delta Attention (KDA) — un mécanisme hybride d'attention linéaire qui gère la fenêtre de contexte 1M tokens efficacement sans le coût quadratique de l'attention standard à longue portée.
  • Attention Residuals (AttnRes) — au lieu d'une accumulation uniforme à travers la profondeur, AttnRes récupère sélectivement des représentations des couches antérieures, permettant au modèle de "revoir" sa propre réflexion antérieure pendant un long run agentique.
  • Per-Head Muon et Sigmoid Tanh Unit (SiTU) — améliorations d'optimiseur et d'activation qui ont contribué à ce que Moonshot revendique être une amélioration de 2,5× dans l'efficacité de scaling globale par rapport à K2.

La quantisation de poids MXFP4 (avec activations MXFP8) est aussi consciente de l'entraînement, pas appliquée après coup. Cela compte pour la qualité : la quantisation post hoc coûte typiquement des points de benchmark ; la quantisation consciente de l'entraînement élimine largement cette taxe.

Où K3 se situe dans le paysage des benchmarks

K3 s'est classé 4e globalement sur l'Artificial Analysis Intelligence Index (au juillet 2026) :

RangModèleScore
1Claude Fable 5~60
2GPT-5.6 Sol~59
3(zone d'égalité fermée)
4Kimi K3~57
5Claude Opus 4.8~56

Où K3 mène tous les modèles (ouverts et fermés) : Frontend Code Arena (classé #1 à 1 679 points), une évaluation réelle de la génération de composants UI et du codage visuel itératif. Le contexte 1M tokens du modèle et la capacité vision native contribuent ici.

Où appliquer la prudence : le taux d'hallucination de K3 est d'environ 51 % dans les évaluations indépendantes — plus élevé que les modèles de frontière fermés. La précision des benchmarks a sauté du 33 % de K2.6 au 46 % de K3, mais l'ancrage factuel ne s'est pas amélioré au même rythme. Vérifiez les sorties K3 pour les affirmations factuelles ; il est le plus fort en code et en complétion de tâches structurées, moins fiable sur les questions de connaissance ouverte sans retrieval.

DeepSWE (ingénierie logicielle long horizon) : K3 a marqué 67,3, le score publié le plus élevé sur un modèle open-weight au moment de cette écriture, correspondant au territoire de frontière.

BrowseComp (navigation long-contexte, sans gestion de contexte) : 90,4 avec la fenêtre 1M tokens activée — notablement atteint sans aucune stratégie de chunking ou de retrieval, que la plupart des modèles nécessitent à cette échelle.

Pour quoi K3 est conçu

L'entraînement de K3 de Moonshot s'est appuyé sur des tâches long horizon, à supervision minimale — le genre où un modèle doit planifier, appeler des outils, déboguer, itérer et rester cohérent à travers un grand dépôt ou un workflow de plusieurs heures. Capacités spécifiques que le blog officiel démontre :

  • Optimisation de kernels GPU (travail de niveau CUDA/Triton, pas juste des wrappers Python)
  • Développement de compilateur GPU (a construit un compilateur MiniTriton depuis zéro comme tâche de benchmark)
  • Conception de puces et vérification RTL (ingénierie matérielle)
  • Orchestration multi-agents de sous-agents — K3 peut coordonner plus de 20 sous-agents concurrents dans son propre environnement Kimi Work
  • Visualisations de recherche interactives et génération de dashboards (où le design vision-first et le classement #1 Frontend Code Arena prennent sens)

Le "mode thinking" est toujours activé au lancement (effort maximum). L'API ne supporte pas encore de niveaux d'effort ajustables — au lancement, chaque appel utilise le max thinking, ce qui ajoute des tokens. Des niveaux d'effort de raisonnement additionnels sont sur la roadmap mais pas encore disponibles.

Démarrer avec l'API Kimi K3

K3 utilise une forme d'API compatible OpenAI, donc si votre base de code appelle déjà GPT ou Claude via un shim client OpenAI, le pointer sur Kimi est un petit changement :

Guided walkthrough1 of 3
  1. Connectez-vous sur platform.kimi.ai, créez une clé API. K3 est disponible sous l'ID de modèle `kimi-k3`.

Kimi K3 via le SDK OpenAI (Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_MOONSHOT_KEY",
  base_url="https://api.moonshot.cn/v1",
)

response = client.chat.completions.create(
  model="kimi-k3",
  messages=[{"role": "user", "content": "Refactor this 5,000-line Python codebase..."}],
)
print(response.choices[0].message.content)

Via OpenRouter (clé API unique, vous laisse A/B K3 contre Claude ou GPT facilement) :

Kimi K3 via OpenRouter

import openai

client = openai.OpenAI(
  api_key="YOUR_OPENROUTER_KEY",
  base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
  model="moonshotai/kimi-k3",
  messages=[{"role": "user", "content": "Review this TypeScript and suggest optimizations."}],
)
print(response.choices[0].message.content)

Poids ouverts (auto-hébergement, à partir du 27 juillet 2026) : Les poids seront publiés sur Hugging Face sous la page d'organisation de Moonshot AI. Le modèle est livré nativement en quantisation MXFP4 ; une large compatibilité matérielle était un objectif de design explicite. Les exigences matérielles complètes seront confirmées à la sortie.

K2 vs K3 : lequel choisir

Vous avez peut-être déjà de l'outillage K2 de la page Kimi K2 pour les utilisateurs de Claude. Voici comment décider :

Kimi K2 (1T param)Kimi K3 (2,8T param)
Params totaux1 mille milliard2,8 mille milliards
Params actifs / token~32B~16/896 experts
Vision nativeNonOui
Fenêtre de contexte128K1M
Poids ouverts disponiblesMaintenant27 juillet 2026
Rang benchmark~7e (Artificial Analysis)4e
Coût de sortiePlus bas15 $/M (compensé par cache)
Meilleur pourUtilisation d'outils agentique consciente des coûts, auto-hébergement maintenantCodage visuel long horizon, grands dépôts, tâches multimodales

Recourez à K3 quand : vous avez besoin de la qualité de niveau frontière (top-5 modèles), la tâche est longue et susceptible de toucher le cache de prompt à répétition, ou la vision est requise. Particulièrement utile si vous voulez des poids ouverts pour la conformité/vie privée mais pouvez attendre jusqu'au 27 juillet.

Restez avec K2 quand : vous devez auto-héberger tout de suite, le coût est la contrainte principale et la tâche ne bénéficie pas de la profondeur supplémentaire de K3, ou vous faites déjà tourner K2 en production avec de l'outillage qui marche.

Quiz

Check yourself

0/4
  1. Kimi K3 a 2,8 mille milliards de paramètres. Combien de paramètres sont actifs par token pendant l'inférence ?
  2. À quel prix effectif par million de tokens d'entrée K3 tourne-t-il typiquement dans les longues sessions de codage ?
  3. Sur quel benchmark Kimi K3 se classe-t-il #1 — devant tous les modèles de frontière fermés ?
  4. Quelle est la principale mise en garde pratique avec K3 pour les tâches de connaissance factuelle ?
Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 7

Sources et lectures complémentaires