Il panorama dei modelli AI: scegliere tra Claude, ChatGPT, Gemini e i modelli open
Un framework duraturo per scegliere il modello AI giusto per un compito — tra Claude, ChatGPT, Gemini, Llama, Mistral, Grok e i modelli open/locali — più le competenze che si trasferiscono tra tutti.
Claude Fable 5 e Mythos 5: la guida sul campo al flagship
Fable 5 è il modello più capace di Anthropic. La sua API rifiuta in-band (HTTP 200, stop_reason: refusal), ha solo adaptive thinking e non restituisce mai il thinking grezzo. Se stai fissando un modello di fascia alta, questo cambia il modo in cui scrivi le integrazioni. Quando usarlo rispetto a Opus 4.8, il pattern di fallback, gli shift nel prompting.
Claude Opus 5: la guida sul campo
Opus 5 è uscito il 24 luglio 2026 come quarto modello di Anthropic in due mesi — stesso prezzo di Opus 4.8 ($5/$25) ma più del doppio del punteggio Frontier-Bench, 3× ARC-AGI-3 rispetto al miglior concorrente e un nuovo tier di effort xhigh/max. I benchmark che contano, i due errori 400 che rompono le migrazioni ingenue e quando Opus 5 sostituisce Fable 5 nel tuo stack.
Claude Sonnet 5: la guida sul campo
Sonnet 5 è il nuovo default di Claude Code e il successore drop-in di Sonnet 4.6 — ma tre vincoli API ti restituiranno 400 durante la migrazione e un nuovo tokenizer produce circa il 30% di token in più per lo stesso testo. La matematica del pricing, il rimapping dell'effort (Sonnet 5 medium ≈ Sonnet 4.6 high) e i cambi di prompting che colgono i team di sorpresa.
ChatGPT per utenti Claude
Padroneggi Claude e devi usare ChatGPT? Le differenze che contano, cosa si trasferisce e quando scegliere l'uno o l'altro.
GPT-5.6 e ChatGPT Work per utenti Claude
OpenAI ha rilasciato la famiglia GPT-5.6 (Sol, Terra, Luna) e ChatGPT Work il 9 luglio 2026. Cosa è davvero cambiato per un utente Claude — contesto da 1,05M, un tier da 1$, un agente che lavora per ore e le parti del lancio di cui nessuno parla.
OpenAI Astra: la scheda in anteprima
Il 1 agosto 2026 OpenAI ha presentato in anteprima il suo 'prossimo modello principale', Astra, con dieci dimostrazioni matematiche verificate in Lean e quasi zero specifiche di prodotto. Cosa è davvero confermato, cosa resta ignoto e se un utente Claude dovrebbe aspettare — la lettura onesta e documentata.
Accedi con ChatGPT
Il nuovo livello di identità di OpenAI, vecchio di tre giorni. Quali dati attraversano davvero il confine, cosa possono fare gli admin enterprise, e come accettarlo nella tua app senza dare a OpenAI un punto d'appoggio non voluto.
Eseguire modelli AI in locale con Ollama
Esegui modelli open-weight (Llama, Mistral, Qwen…) sulla tua macchina — privati, offline, gratis da eseguire — con Ollama. Setup, CLI e chiamata da codice.
Claude vs GPT vs Gemini per il coding
Un framework (non una classifica) per scegliere un modello di frontiera per il coding — i fattori che contano, e perché una eval sul tuo repo batte ogni benchmark.
CLI per agenti di coding a confronto
Claude Code, Codex CLI, Gemini CLI e gli agenti terminale open-source — come l'harness (non solo il modello) decide i tuoi risultati, e come tenere la tua configurazione portabile con AGENTS.md.
Supabase Evals — Benchmark su Agenti con Backend Reale
Supabase ha rilasciato open-source un benchmark che fa girare Claude Code, Codex e OpenCode contro stack Supabase reali in container — non mock. Ecco cosa misura, cosa ha scoperto su come i modelli usano davvero doc e skill, e come farlo girare in locale in una serata.
Gemini per utenti Claude
Fluente in Claude, ti serve Gemini di Google? Le differenze che contano — Gem, integrazione Workspace, contesto enorme, multimodale — e cosa si trasferisce.
Gemini 3.6 Flash, Flash-Lite e Flash Cyber per utenti Claude
Il 21 luglio 2026 Google ha saltato del tutto Gemini 3.5 Pro e ha rilasciato invece tre modelli di fascia Flash. Prezzi reali, benchmark reali, gli inciampi della migrazione e le cose che quasi nessuno racconta — incluso un fine-tune di cybersecurity che ha battuto Claude Opus 4.6 nella caccia ai bug di V8.
Grok per utenti Claude
Padroneggi Claude, ma ti serve Grok di xAI? Le differenze che contano — ricerca in tempo reale su X/web, un'API compatibile con OpenAI e l'agente di coding Grok Build — più tutto ciò che si trasferisce.
Muse Code + Muse Spark 1.2: l'agente di coding da terminale di Meta
Il 5 agosto 2026 Meta ha rilasciato Muse Code, un agente di coding da terminale, e Muse Spark 1.2, il modello co-addestrato con esso. Cosa ti compra davvero l'event log append-only, perché il tier contributor costa 12,5× meno di quello standard, come si posiziona rispetto a Claude Code su Terminal-Bench 2.1 e le tre skill incluse che vale la pena rubare a prescindere dall'agente che usi.
Framework open-source per agenti AI
Una mappa neutrale rispetto al provider dei principali framework aperti per costruire agenti LLM — LangGraph, LlamaIndex, AutoGen, CrewAI e l'approccio a loop minimale — e come scegliere.
API Multi-Agente Native: Responses Multi-Agent Beta di OpenAI vs Costruirtelo da Solo
Il 9 luglio 2026 OpenAI ha rilasciato la beta multi-agente della Responses API e la Sol Ultra Mode — il primo vendor frontier a rendere 'il modello spawna e sintetizza N sub-agenti in una sola richiesta HTTP' una primitiva di prima classe. Cosa esce davvero, la forma dell'API, la matematica dei costi, cosa fa Anthropic al suo posto, e quando la primitiva nativa batte un fan-out DIY.
A2A: il protocollo Agent-to-Agent
MCP collega gli agenti agli strumenti. A2A collega gli agenti ad altri agenti — tra framework, cloud e aziende diverse. Impara l'Agent Card, i task, gli otto stati del ciclo di vita, streaming vs. webhook, e come A2A si compone con MCP.
Portare i Prompt tra Modelli Diversi
Sposta un prompt tra Claude, GPT, Gemini e modelli open — cosa si trasferisce senza problemi, cosa adattare per ciascun modello e un workflow di migrazione.
DeepSeek, Qwen e l'ondata open-weight
Potenti modelli open-weight (DeepSeek, Qwen, Llama, Mistral) hanno chiuso gran parte del divario. Cosa significa 'open weight', i trade-off vs la frontiera closed, e come usarli.
Kimi K2 per utenti Claude
Kimi K2 di Moonshot è un agente open-weight da un trilione di parametri costruito per catene di uso strumenti lunghe. Cosa lo rende davvero diverso da Claude — pesi INT4 nativi, 200–300 tool call sequenziali, una licenza permissiva — e quando conviene sceglierlo.
GLM-5.2: modello di coding open-weight di frontiera
Il MoE da 753B (~40B attivi) di Z.ai, contesto da 1M token, licenza MIT — arriva a un punto da Claude Opus 4.8 sul coding long-horizon, a circa un sesto del costo API. Cosa fa davvero IndexShare, come lo fai girare in locale, e dove batte Claude Code sul campo.
Inkling: il modello open-weights di Thinking Machines
Il Thinking Machines Lab di Mira Murati ha rilasciato Inkling — un MoE multimodale da 975B parametri sotto Apache 2.0, con una manopola continua per lo sforzo di ragionamento. Cosa ha sbagliato la copertura del lancio, perché perde i benchmark di proposito e cosa fa davvero quella manopola.
Kimi K3: il più grande modello open-weight al mondo
Il modello open-weight da 2,8 trilioni di parametri di Moonshot AI batte Claude Opus 4.8 su molti benchmark e domina la Frontend Code Arena. Cosa lo rende architetturalmente diverso, quando il prezzo cache-hit ribalta il calcolo dei costi, e se vale la pena sceglierlo.
Eseguire Kimi K3 in locale: vLLM, DSpark e il vero conto hardware
La guida pratica definitiva per il self-hosting di Kimi K3, l'open-weight da 2.8T di Moonshot, nel 2026. Cosa fa davvero il speculative decoding DSpark, hardware minimo (1× DGX B300 o 16× DGX Spark), i comandi vLLM esatti, l'asimmetria prefill/decode di cui nessuno ti avverte, e quando l'inferenza hosted batte il tuo rack.
Dentro Grok Build: leggere un harness di agente open
xAI ha pubblicato sotto Apache 2.0 l'intero sorgente Rust del suo agente di coding — il loop dell'agente, il layer dei tool, la TUI e il sistema di estensioni. Cosa insegna la mappa dei crate su come si costruisce un agente, perché qui 'open source' significa source-available, e cosa racconta il codice del data-collector ancora presente nell'albero.
Poolside Laguna: modelli di coding open-weight che colpiscono sopra la loro categoria
La famiglia Laguna di Poolside AI (XS 2.1, S 2.1, M.1) — modelli di coding MoE con 3B–23B parametri attivi, contesto da 1M token, licenza OpenMDW-1.1. Che cosa batte davvero S 2.1 con 8B attivi, perché XS 2.1 con 3B attivi gira su un MacBook, la prima pipeline di training RL in FP8 conosciuta, e quando sceglierlo al posto di Claude, GLM-5.2 o Kimi K3.
Media generativi: AI per immagini, audio e video
Oltre la chat testuale — una mappa dell'AI per immagini, video, voce e musica: gli strumenti principali, le competenze durature, e i diritti/l'etica che contano.
Quanto costa davvero l'AI (tra i vari provider)
Un quadro duraturo per confrontare il costo dell'AI tra i provider — gli archetipi di prezzo, come stimare un carico di lavoro, le leve per ridurre il conto e quando conviene open/locale.
Perché gli agenti AI bruciano token (e come mettere un tetto al conto)
Un run agentico costa 50–1000 volte una chat — non perché il modello sia più stupido, ma per via della valanga di contesto. Il meccanismo, i numeri sorprendenti e le quattro leve che tagliano davvero il conto su Claude, GPT, Gemini e modelli open.
Costruire agenti AI locali
Agenti autonomi che girano interamente sulla tua macchina con un modello locale a pesi aperti — privati, offline, gratuiti da eseguire. L'architettura, i compromessi, e come iniziare.
Claude + modelli locali: pattern ibridi
Fai lavorare in sinergia Claude e i modelli open-weight locali — router, draft-then-refine, redazione della privacy, pre-processing di massa — per il ragionamento della frontiera con la privacy e il costo del locale.
AI Gateway: LiteLLM, OpenRouter, Portkey, Vercel
Un AI gateway di produzione è il router mancante tra la tua app e ogni modello — Claude, GPT, Gemini, Llama. Confronta LiteLLM, OpenRouter, Portkey e Vercel AI Gateway, poi collega Claude Code al tuo proxy.
Agenti di coding locali (e come si abbinano a Claude)
Agenti di coding che girano sulla tua macchina e modificano il tuo repo — Aider, Cline, Continue, OpenHands, Claude Code — alimentati da Claude per la qualità o da un modello locale per la privacy.
Collegare Claude a strumenti e agent locali con MCP
Il Model Context Protocol permette a Claude di orchestrare strumenti, dati e agent che girano in privato sulla tua macchina — la sinergia Claude-come-cervello, capacità-locali. Aggiungi o costruisci un server MCP locale.
Costruisci uno Stack di AI Locale Privato (End-to-End)
Metti tutto insieme: un modello locale (Ollama) + un agente model-agnostic + strumenti tramite un server MCP locale — un assistente privato sulla tua macchina, con Claude come livello intelligente opzionale.
Agente locale o Claude? Una guida alla decisione
Agente completamente locale, alimentato da Claude, o ibrido? I fattori che lo decidono — privacy, difficoltà del compito, costo, latenza, affidabilità — e perché spesso vince l'ibrido.
Mettere in sicurezza gli agenti locali e ibridi
Un agente che può modificare file ed eseguire comandi è potente e pericoloso. Privilegio minimo, sandboxing, approvazione umana, difesa dalla prompt injection, tetti di spesa — come far girare gli agenti in sicurezza.
Modelli di ragionamento a confronto
Budget di pensiero e sforzo di ragionamento tra Claude, GPT, Gemini, DeepSeek e Qwen — quando spendere token per pensare e quando no.
Voice AI full-duplex: perché gli agenti vocali sono diventati di colpo reali
GPT-Live e i nuovi modelli speech-native ascoltano e parlano contemporaneamente. Cosa cambia il full-duplex, come funziona e il panorama della voice-AI oggi.
Claude Voice con Opus e Sonnet (luglio 2026): voce reasoning-first vs GPT-Live
Il 23 luglio 2026 Anthropic ha aperto la voce di Claude a Opus, Sonnet e alle app connesse — ma ha mantenuto lo stack a turni. Cosa è cambiato davvero, quando cambiare modello a metà chiamata e come la scommessa di design differisce dal full-duplex di GPT-Live.
Velocità dei token: perché l'inferenza AI è diventata di colpo 10-15× più veloce
Chip wafer-scale e LPU servono modelli di frontiera a centinaia di token al secondo. Cosa limita davvero la velocità di inferenza, la nuova corsa all'hardware, e perché i token veloci cambiano agenti, voce e ragionamento.
Agenti Computer-Use a confronto
Claude, GPT e Gemini possono ormai tutti pilotare uno schermo — ma ciascuno espone uno spazio d'azione, un contratto sulle coordinate e un gate di sicurezza diversi. Cosa si rompe davvero, e come costruire un loop che sopravviva.
Browser a login condiviso per agenti AI: il pattern ego lite
Una nuova classe di browser — meglio esemplificata da ego lite, che ha raggiunto il #1 su GitHub Trending il 24 luglio 2026 — permette a Claude Code, Codex, Cursor e a qualsiasi altro coding agent di guidare una sessione Chromium isolata che eredita i tuoi login reali. Cosa risolvono davvero Spaces e snapshot semantici, perché insidiano Playwright per il lavoro con agenti, e il costo di sicurezza di condividere i cookie di sessione con un processo autonomo.
SKILL.md: lo standard aperto cross-agent
Un solo file SKILL.md, trentadue agenti. Cos'è davvero lo standard aperto Agent Skills, come la progressive disclosure tiene basso il costo del contesto, cosa rompe la portabilità e come scrivere una skill che gira senza modifiche in Claude Code, Codex, Gemini CLI e Cursor.