Kimi K3: il più grande modello open-weight al mondo
Il 16 luglio 2026, Moonshot AI ha rilasciato Kimi K3 — un modello Mixture-of-Experts da 2,8 trilioni di parametri, attualmente il più grande rilascio open-weight al mondo in quella categoria. I titoli l'hanno chiamato il moonshot del laboratorio cinese. Il numero da osservare davvero è più silenzioso: K3 si è classificato quarto sull'Artificial Analysis Intelligence Index, dietro Claude Fable 5 e GPT-5.6 Sol, ma nettamente davanti a Claude Opus 4.8. Per un modello i cui pesi completi arrivano su Hugging Face il 27 luglio 2026, è una frase inusuale da scrivere.
Questa pagina copre ciò che è davvero non-ovvio su K3 — i cambiamenti architetturali, la trappola del pricing che lo fa sembrare costoso finché non si controlla il cache hit rate, e i compiti specifici in cui supera ogni altro modello, open o closed.
- Capire perché 2,8T parametri non significano 2,8T di compute: l'aritmetica MoE e come funziona l'attivazione sparsa
- Imparare le tre innovazioni architetturali di K3 (KDA, AttnRes, LatentMoE) che danno un'efficienza di scaling 2,5× migliore rispetto a K2
- Conoscere la matematica del prezzo cache-hit: perché K3 costa più vicino a $0,30/M che a $3,00/M nei workload reali di coding
- Collocare K3 nel panorama dei benchmark: dove guida, dove resta indietro e cosa significa il caveat sul tasso di allucinazione
- Iniziare con l'API in tre righe usando un client OpenAI-compatibile
La versione in una frase
Kimi K3 è un modello open-weight (pesi completi in arrivo il 27 luglio 2026), MoE sparso da 2,8 trilioni di parametri di Moonshot AI, ottimizzato per coding agentico long-horizon e lavoro cognitivo, con vision nativa e finestra di contesto da 1 milione di token — con prezzi da API frontier ma spesso più economico nella pratica perché i workload di coding colpiscono il prompt cache oltre il 90% delle volte.
Tre cose su K3 non ovvie dai titoli
1. "2,8 trilioni di parametri" non significa 2,8 trilioni di attivazioni per token
Il numero titolo è drammatico, ma K3 è un modello Mixture-of-Experts. Ha 896 sotto-reti esperte, e solo 16 esperti si attivano per token — è il componente "Stable LatentMoE". Il modello è enorme in storage ma compatto in compute per forward pass. In inferenza, il footprint dei parametri attivi è molto più piccolo di 2,8T. È lo stesso trade-off architetturale di DeepSeek V4 Pro (che usa anch'esso MoE), ed è il motivo per cui un modello così grande può girare efficientemente su hardware gestibile una volta che i pesi sono self-hosted.
L'implicazione pratica: non confrontare direttamente il numero di parametri tra modelli dense e MoE. Un MoE da 2,8T con 16/896 esperti attivi ha un profilo di compute diverso da un modello dense da 70B — e un requisito hardware molto diverso per il self-hosting.
2. Il tasso di cache-hit ribalta completamente la matematica dei costi
Il pricing API di K3 è $3,00/M token in input e $15,00/M token in output — costoso a prima vista. Ma Moonshot offre un prezzo cache-hit di $0,30/M input (sconto 10×), e nei workload di coding l'azienda riporta cache hit rate superiori al 90%. Questo significa che il prezzo effettivo per milione di token in input in una sessione di coding continuativa è più vicino a $0,30–$0,45, non $3,00.
Ecco il confronto pratico sul costo per task (fonte: valutazioni di terze parti):
| Modello | Costo per task agentico |
|---|---|
| Kimi K3 | $0,94 |
| GPT-5.6 Sol | $1,04 |
| Claude Opus 4.8 | $1,80 |
K3 usa anche il 21% in meno di token in output rispetto a K2.6 — ha imparato a essere più conciso — che riduce ulteriormente la bolletta. Ai prezzi di listino K3 sembra premium; ai prezzi realistici per task batte la concorrenza frontier.
3. Le innovazioni architetturali sono a training-time, non post-hoc
K3 include tre nuovi componenti che sono integrati nel modello dal training:
- Kimi Delta Attention (KDA) — un meccanismo di attenzione lineare ibrido che gestisce efficientemente la finestra di contesto da 1M token senza il costo quadratico dell'attenzione standard su lungo raggio.
- Attention Residuals (AttnRes) — invece di un'accumulazione uniforme lungo la profondità, AttnRes recupera selettivamente rappresentazioni dai layer precedenti, permettendo al modello di "guardare indietro" al proprio ragionamento passato durante un lungo run agentico.
- Per-Head Muon e Sigmoid Tanh Unit (SiTU) — miglioramenti all'ottimizzatore e all'attivazione che hanno contribuito a quello che Moonshot dichiara essere un miglioramento del 2,5× nell'efficienza complessiva di scaling rispetto a K2.
Anche la quantizzazione dei pesi MXFP4 (con attivazioni MXFP8) è consapevole del training, non applicata a posteriori. Questo conta per la qualità: la quantizzazione post-hoc costa tipicamente punti nei benchmark; il quantization-aware training elimina in gran parte questa tassa.
Dove si colloca K3 nel panorama dei benchmark
K3 si è classificato 4° assoluto sull'Artificial Analysis Intelligence Index (a luglio 2026):
| Rank | Modello | Punteggio |
|---|---|---|
| 1 | Claude Fable 5 | ~60 |
| 2 | GPT-5.6 Sol | ~59 |
| 3 | (area di pareggio closed) | — |
| 4 | Kimi K3 | ~57 |
| 5 | Claude Opus 4.8 | ~56 |
Dove K3 guida tutti i modelli (open e closed): Frontend Code Arena (classificato #1 con 1.679 punti), una valutazione real-world sulla generazione di componenti UI e sul coding visuale iterativo. Il contesto da 1M token del modello e la capacità vision nativa contribuiscono qui.
Dove invece serve cautela: il tasso di allucinazione di K3 è circa il 51% in valutazioni indipendenti — più alto dei modelli closed di frontiera. L'accuratezza sui benchmark è salita dal 33% di K2.6 al 46% di K3, ma il grounding fattuale non è migliorato allo stesso ritmo. Verificate gli output di K3 per affermazioni fattuali; è più forte nel codice e nel completamento di task strutturati, meno affidabile su domande aperte di conoscenza senza retrieval.
DeepSWE (ingegneria del software long-horizon): K3 ha ottenuto 67,3, il punteggio più alto pubblicato su un modello open-weight al momento di questa scrittura, allineato al territorio frontier.
BrowseComp (navigazione long-context, senza gestione del contesto): 90,4 con la finestra da 1M token abilitata — notevolmente raggiunto senza alcuna strategia di chunking o retrieval, che la maggior parte dei modelli richiede a questa scala.
Per cosa è progettato K3
Il training di Moonshot K3 si è concentrato su task long-horizon a supervisione minima — quel tipo dove un modello deve pianificare, chiamare tool, debuggare, iterare e restare coerente su una repo estesa o un workflow di molte ore. Capacità specifiche dimostrate dal blog ufficiale:
- Ottimizzazione di kernel GPU (lavoro a livello CUDA/Triton, non solo wrapper Python)
- Sviluppo di compilatori GPU (ha costruito un compilatore MiniTriton da zero come task benchmark)
- Design di chip e verifica RTL (ingegneria hardware)
- Orchestrazione multi-agent di subagenti — K3 può coordinare oltre 20 subagenti concorrenti nel suo ambiente Kimi Work
- Visualizzazioni di ricerca interattive e generazione di dashboard (dove il design vision-first e il ranking #1 su Frontend Code Arena hanno senso)
La "thinking mode" è sempre attiva al lancio (sforzo massimo). L'API non supporta ancora livelli di sforzo regolabili — al lancio, ogni chiamata usa il thinking massimo, che aggiunge token. Livelli aggiuntivi di reasoning effort sono nella roadmap ma non ancora disponibili.
Iniziare con l'API di Kimi K3
K3 usa una forma API OpenAI-compatibile, quindi se la tua codebase chiama già GPT o Claude via un client shim OpenAI, puntarla su Kimi è un cambio piccolo:
- Accedi a platform.kimi.ai, crea una API key. K3 è disponibile sotto il model ID `kimi-k3`.
- Imposta la base URL a `https://api.moonshot.cn/v1` e il modello a `kimi-k3`. Il client può essere l'SDK standard `openai` per Python o JS — o OpenRouter se preferisci un unico aggregatore.
- Passa le immagini nell'array messages usando il content type standard `image_url`. Per task da 1M token, nessun parametro speciale è necessario — la finestra di contesto è sempre 1M.
Kimi K3 via OpenAI SDK (Python)
import openai
client = openai.OpenAI(
api_key="YOUR_MOONSHOT_KEY",
base_url="https://api.moonshot.cn/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Refactor this 5,000-line Python codebase..."}],
)
print(response.choices[0].message.content)Via OpenRouter (una sola API key, ti permette di fare A/B facilmente K3 contro Claude o GPT):
Kimi K3 via OpenRouter
import openai
client = openai.OpenAI(
api_key="YOUR_OPENROUTER_KEY",
base_url="https://openrouter.ai/api/v1",
)
response = client.chat.completions.create(
model="moonshotai/kimi-k3",
messages=[{"role": "user", "content": "Review this TypeScript and suggest optimizations."}],
)
print(response.choices[0].message.content)Pesi open (self-hosting, dal 27 luglio 2026): i pesi saranno rilasciati su Hugging Face sotto la pagina organizzazione di Moonshot AI. Il modello arriva in quantizzazione MXFP4 nativa; l'ampia compatibilità hardware era un obiettivo di design esplicito. I requisiti hardware completi saranno confermati al rilascio.
K2 vs K3: quale scegliere
Potresti già avere il tooling K2 dalla pagina Kimi K2 per utenti Claude. Ecco come decidere:
| Kimi K2 (1T param) | Kimi K3 (2,8T param) | |
|---|---|---|
| Parametri totali | 1 trilione | 2,8 trilioni |
| Parametri attivi / token | ~32B | ~16/896 esperti |
| Vision nativa | No | Sì |
| Finestra di contesto | 128K | 1M |
| Pesi open disponibili | Ora | 27 luglio 2026 |
| Rank benchmark | ~7° (Artificial Analysis) | 4° |
| Costo output | Più basso | $15/M (compensato dalla cache) |
| Meglio per | Uso agentico di tool cost-conscious, self-hosting ora | Coding visuale long-horizon, repo grandi, task multimodali |
Scegli K3 quando: ti serve qualità frontier-tier (top-5), il task è lungo e probabilmente colpirà il prompt cache ripetutamente, o la vision è richiesta. Particolarmente utile se vuoi pesi open per compliance/privacy ma puoi aspettare fino al 27 luglio.
Resta su K2 quando: devi fare self-hosting adesso, il costo è il vincolo primario e il task non beneficia della profondità extra di K3, o stai già facendo girare K2 in produzione con tooling funzionante.
Quiz
Check yourself
0/4Fonti e approfondimenti
- Blog tecnico ufficiale Kimi K3 — Moonshot AI — specifiche di architettura, claim di scaling e capacità dimostrate
- Quickstart Kimi K3 — Kimi API Platform — documentazione API e model ID
- Kimi K3 su OpenRouter — pricing aggregato e panoramica benchmark
- Simon Willison su Kimi K3 — analisi indipendente incluso il pelican benchmark e il breakdown dei costi
- Guida completa Kimi K3 — Coder Sera — aggregazione di benchmark e confronti di costo a livello di task
- Tom's Hardware: Moonshot rilascia Kimi K3 da 2,8T — contesto hardware e geopolitico
- Correlato: Kimi K2 per utenti Claude — K2 è ancora disponibile ora con pesi che puoi self-hostare subito
- Correlato: DeepSeek, Qwen e l'ondata open-weight — panorama più ampio degli open-weight
- Correlato: Scegliere un modello — quando scegliere open-weight vs frontier closed