Passa al contenuto principale

Kimi K3: il più grande modello open-weight al mondo

Intermedio

Il 16 luglio 2026, Moonshot AI ha rilasciato Kimi K3 — un modello Mixture-of-Experts da 2,8 trilioni di parametri, attualmente il più grande rilascio open-weight al mondo in quella categoria. I titoli l'hanno chiamato il moonshot del laboratorio cinese. Il numero da osservare davvero è più silenzioso: K3 si è classificato quarto sull'Artificial Analysis Intelligence Index, dietro Claude Fable 5 e GPT-5.6 Sol, ma nettamente davanti a Claude Opus 4.8. Per un modello i cui pesi completi arrivano su Hugging Face il 27 luglio 2026, è una frase inusuale da scrivere.

Questa pagina copre ciò che è davvero non-ovvio su K3 — i cambiamenti architetturali, la trappola del pricing che lo fa sembrare costoso finché non si controlla il cache hit rate, e i compiti specifici in cui supera ogni altro modello, open o closed.

What you'll learn
  • Capire perché 2,8T parametri non significano 2,8T di compute: l'aritmetica MoE e come funziona l'attivazione sparsa
  • Imparare le tre innovazioni architetturali di K3 (KDA, AttnRes, LatentMoE) che danno un'efficienza di scaling 2,5× migliore rispetto a K2
  • Conoscere la matematica del prezzo cache-hit: perché K3 costa più vicino a $0,30/M che a $3,00/M nei workload reali di coding
  • Collocare K3 nel panorama dei benchmark: dove guida, dove resta indietro e cosa significa il caveat sul tasso di allucinazione
  • Iniziare con l'API in tre righe usando un client OpenAI-compatibile

La versione in una frase

Kimi K3 è un modello open-weight (pesi completi in arrivo il 27 luglio 2026), MoE sparso da 2,8 trilioni di parametri di Moonshot AI, ottimizzato per coding agentico long-horizon e lavoro cognitivo, con vision nativa e finestra di contesto da 1 milione di token — con prezzi da API frontier ma spesso più economico nella pratica perché i workload di coding colpiscono il prompt cache oltre il 90% delle volte.

Tre cose su K3 non ovvie dai titoli

1. "2,8 trilioni di parametri" non significa 2,8 trilioni di attivazioni per token

Il numero titolo è drammatico, ma K3 è un modello Mixture-of-Experts. Ha 896 sotto-reti esperte, e solo 16 esperti si attivano per token — è il componente "Stable LatentMoE". Il modello è enorme in storage ma compatto in compute per forward pass. In inferenza, il footprint dei parametri attivi è molto più piccolo di 2,8T. È lo stesso trade-off architetturale di DeepSeek V4 Pro (che usa anch'esso MoE), ed è il motivo per cui un modello così grande può girare efficientemente su hardware gestibile una volta che i pesi sono self-hosted.

L'implicazione pratica: non confrontare direttamente il numero di parametri tra modelli dense e MoE. Un MoE da 2,8T con 16/896 esperti attivi ha un profilo di compute diverso da un modello dense da 70B — e un requisito hardware molto diverso per il self-hosting.

2. Il tasso di cache-hit ribalta completamente la matematica dei costi

Il pricing API di K3 è $3,00/M token in input e $15,00/M token in output — costoso a prima vista. Ma Moonshot offre un prezzo cache-hit di $0,30/M input (sconto 10×), e nei workload di coding l'azienda riporta cache hit rate superiori al 90%. Questo significa che il prezzo effettivo per milione di token in input in una sessione di coding continuativa è più vicino a $0,30–$0,45, non $3,00.

Ecco il confronto pratico sul costo per task (fonte: valutazioni di terze parti):

ModelloCosto per task agentico
Kimi K3$0,94
GPT-5.6 Sol$1,04
Claude Opus 4.8$1,80

K3 usa anche il 21% in meno di token in output rispetto a K2.6 — ha imparato a essere più conciso — che riduce ulteriormente la bolletta. Ai prezzi di listino K3 sembra premium; ai prezzi realistici per task batte la concorrenza frontier.

3. Le innovazioni architetturali sono a training-time, non post-hoc

K3 include tre nuovi componenti che sono integrati nel modello dal training:

  • Kimi Delta Attention (KDA) — un meccanismo di attenzione lineare ibrido che gestisce efficientemente la finestra di contesto da 1M token senza il costo quadratico dell'attenzione standard su lungo raggio.
  • Attention Residuals (AttnRes) — invece di un'accumulazione uniforme lungo la profondità, AttnRes recupera selettivamente rappresentazioni dai layer precedenti, permettendo al modello di "guardare indietro" al proprio ragionamento passato durante un lungo run agentico.
  • Per-Head Muon e Sigmoid Tanh Unit (SiTU) — miglioramenti all'ottimizzatore e all'attivazione che hanno contribuito a quello che Moonshot dichiara essere un miglioramento del 2,5× nell'efficienza complessiva di scaling rispetto a K2.

Anche la quantizzazione dei pesi MXFP4 (con attivazioni MXFP8) è consapevole del training, non applicata a posteriori. Questo conta per la qualità: la quantizzazione post-hoc costa tipicamente punti nei benchmark; il quantization-aware training elimina in gran parte questa tassa.

Dove si colloca K3 nel panorama dei benchmark

K3 si è classificato 4° assoluto sull'Artificial Analysis Intelligence Index (a luglio 2026):

RankModelloPunteggio
1Claude Fable 5~60
2GPT-5.6 Sol~59
3(area di pareggio closed)
4Kimi K3~57
5Claude Opus 4.8~56

Dove K3 guida tutti i modelli (open e closed): Frontend Code Arena (classificato #1 con 1.679 punti), una valutazione real-world sulla generazione di componenti UI e sul coding visuale iterativo. Il contesto da 1M token del modello e la capacità vision nativa contribuiscono qui.

Dove invece serve cautela: il tasso di allucinazione di K3 è circa il 51% in valutazioni indipendenti — più alto dei modelli closed di frontiera. L'accuratezza sui benchmark è salita dal 33% di K2.6 al 46% di K3, ma il grounding fattuale non è migliorato allo stesso ritmo. Verificate gli output di K3 per affermazioni fattuali; è più forte nel codice e nel completamento di task strutturati, meno affidabile su domande aperte di conoscenza senza retrieval.

DeepSWE (ingegneria del software long-horizon): K3 ha ottenuto 67,3, il punteggio più alto pubblicato su un modello open-weight al momento di questa scrittura, allineato al territorio frontier.

BrowseComp (navigazione long-context, senza gestione del contesto): 90,4 con la finestra da 1M token abilitata — notevolmente raggiunto senza alcuna strategia di chunking o retrieval, che la maggior parte dei modelli richiede a questa scala.

Per cosa è progettato K3

Il training di Moonshot K3 si è concentrato su task long-horizon a supervisione minima — quel tipo dove un modello deve pianificare, chiamare tool, debuggare, iterare e restare coerente su una repo estesa o un workflow di molte ore. Capacità specifiche dimostrate dal blog ufficiale:

  • Ottimizzazione di kernel GPU (lavoro a livello CUDA/Triton, non solo wrapper Python)
  • Sviluppo di compilatori GPU (ha costruito un compilatore MiniTriton da zero come task benchmark)
  • Design di chip e verifica RTL (ingegneria hardware)
  • Orchestrazione multi-agent di subagenti — K3 può coordinare oltre 20 subagenti concorrenti nel suo ambiente Kimi Work
  • Visualizzazioni di ricerca interattive e generazione di dashboard (dove il design vision-first e il ranking #1 su Frontend Code Arena hanno senso)

La "thinking mode" è sempre attiva al lancio (sforzo massimo). L'API non supporta ancora livelli di sforzo regolabili — al lancio, ogni chiamata usa il thinking massimo, che aggiunge token. Livelli aggiuntivi di reasoning effort sono nella roadmap ma non ancora disponibili.

Iniziare con l'API di Kimi K3

K3 usa una forma API OpenAI-compatibile, quindi se la tua codebase chiama già GPT o Claude via un client shim OpenAI, puntarla su Kimi è un cambio piccolo:

Guided walkthrough1 of 3
  1. Accedi a platform.kimi.ai, crea una API key. K3 è disponibile sotto il model ID `kimi-k3`.

Kimi K3 via OpenAI SDK (Python)

import openai

client = openai.OpenAI(
  api_key="YOUR_MOONSHOT_KEY",
  base_url="https://api.moonshot.cn/v1",
)

response = client.chat.completions.create(
  model="kimi-k3",
  messages=[{"role": "user", "content": "Refactor this 5,000-line Python codebase..."}],
)
print(response.choices[0].message.content)

Via OpenRouter (una sola API key, ti permette di fare A/B facilmente K3 contro Claude o GPT):

Kimi K3 via OpenRouter

import openai

client = openai.OpenAI(
  api_key="YOUR_OPENROUTER_KEY",
  base_url="https://openrouter.ai/api/v1",
)

response = client.chat.completions.create(
  model="moonshotai/kimi-k3",
  messages=[{"role": "user", "content": "Review this TypeScript and suggest optimizations."}],
)
print(response.choices[0].message.content)

Pesi open (self-hosting, dal 27 luglio 2026): i pesi saranno rilasciati su Hugging Face sotto la pagina organizzazione di Moonshot AI. Il modello arriva in quantizzazione MXFP4 nativa; l'ampia compatibilità hardware era un obiettivo di design esplicito. I requisiti hardware completi saranno confermati al rilascio.

K2 vs K3: quale scegliere

Potresti già avere il tooling K2 dalla pagina Kimi K2 per utenti Claude. Ecco come decidere:

Kimi K2 (1T param)Kimi K3 (2,8T param)
Parametri totali1 trilione2,8 trilioni
Parametri attivi / token~32B~16/896 esperti
Vision nativaNo
Finestra di contesto128K1M
Pesi open disponibiliOra27 luglio 2026
Rank benchmark~7° (Artificial Analysis)
Costo outputPiù basso$15/M (compensato dalla cache)
Meglio perUso agentico di tool cost-conscious, self-hosting oraCoding visuale long-horizon, repo grandi, task multimodali

Scegli K3 quando: ti serve qualità frontier-tier (top-5), il task è lungo e probabilmente colpirà il prompt cache ripetutamente, o la vision è richiesta. Particolarmente utile se vuoi pesi open per compliance/privacy ma puoi aspettare fino al 27 luglio.

Resta su K2 quando: devi fare self-hosting adesso, il costo è il vincolo primario e il task non beneficia della profondità extra di K3, o stai già facendo girare K2 in produzione con tooling funzionante.

Quiz

Check yourself

0/4
  1. Kimi K3 ha 2,8 trilioni di parametri. Quanti parametri sono attivi per token durante l'inferenza?
  2. A quale prezzo effettivo per milione di token in input gira tipicamente K3 nelle sessioni di coding lunghe?
  3. Su quale benchmark Kimi K3 si classifica #1 — davanti a tutti i modelli frontier closed?
  4. Qual è il principale caveat pratico con K3 per task di conoscenza fattuale?
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 7

Fonti e approfondimenti