Modelli AI e assistenti
Claude è il nostro nucleo — ma le stesse skill viaggiano. Questa sezione allarga la lente all'intero mondo AI: gli assistenti principali, come si differenziano, quando usare quale, e le tecniche che si trasferiscono attraverso tutti.
- Scegliere il modello giusto per un lavoro senza dover ri-imparare il campo ogni volta
- Muoverti tra assistenti — ChatGPT, Gemini, Grok, modelli open — senza perdere la tua tecnica
- Far girare modelli capaci sulla tua macchina, e sapere quando ne vale la pena
- Combinare Claude con modelli locali e framework di agenti
Comincia qui
Se leggi una pagina in questa sezione, leggi questa. Tutto ciò che sta sotto è un ramo da qui.
- Come scegliere un modello — un framework durevole che sopravvive a qualunque release specifica.
Poi segui il filo che corrisponde a quello che stai facendo.
Vieni da un altro assistente
Conosci già uno strumento e vuoi che le tue abitudini si trasferiscano.
- ChatGPT per utenti Claude
- Gemini per utenti Claude
- Grok per utenti Claude
- Portare prompt tra modelli — cosa si trasferisce, cosa si rompe
Confrontare prima di impegnarti
- Claude vs GPT vs Gemini per il coding
- Modelli reasoning a confronto
- Quanto costa l'AI tra i provider
- Media generativi: immagini, audio, video
Far girare modelli in proprio
I modelli locali scambiano un po' di capability per privacy, controllo dei costi e lavoro offline. Queste pagine coprono quando quello scambio vale la pena.
- Far girare modelli in locale con Ollama — il punto di partenza pratico
- DeepSeek, Qwen e i modelli open
- Uno stack AI locale privato
- Claude più modelli locali — usare entrambi, deliberatamente
Agenti oltre Claude
Tutto in questa sezione
La lista completa, incluse pagine aggiunte da quando questo indice è stato scritto.
Modelli AI e assistenti
Claude è il nucleo qui, ma le stesse skill viaggiano. Comincia con come scegliere, poi vai in profondità quanto ti serve su qualsiasi assistente, sul far girare modelli in locale, o sugli agenti.
Il panorama dei modelli AI: scegliere tra Claude, ChatGPT, Gemini e i modelli open
Un framework duraturo per scegliere il modello AI giusto per un compito — tra Claude, ChatGPT, Gemini, Llama, Mistral, Grok e i modelli open/locali — più le competenze che si trasferiscono tra tutti.
Claude Fable 5.1: cosa è cambiato e come migrare
Anthropic ha rilasciato Claude Fable 5.1 e Mythos 5.1 il 1° settembre 2026: stesso prezzo di 10 $/50 $, letture da cache ridotte a 0,25 $, tre breaking change API (errori su tool_choice forzato, blocchi di thinking a senso unico, cronologia append-only) e cinque beta additive. La guida di migrazione sul campo per chi ha fissato claude-fable-5 o claude-opus-5.
Claude Fable 5 e Mythos 5: la guida sul campo al flagship
Fable 5 è il modello più capace di Anthropic. La sua API rifiuta in-band (HTTP 200, stop_reason: refusal), ha solo adaptive thinking e non restituisce mai il thinking grezzo. Se stai fissando un modello di fascia alta, questo cambia il modo in cui scrivi le integrazioni. Quando usarlo rispetto a Opus 4.8, il pattern di fallback, gli shift nel prompting.
Claude Opus 5: la guida sul campo
Opus 5 è uscito il 24 luglio 2026 come quarto modello di Anthropic in due mesi — stesso prezzo di Opus 4.8 ($5/$25) ma più del doppio del punteggio Frontier-Bench, 3× ARC-AGI-3 rispetto al miglior concorrente e un nuovo tier di effort xhigh/max. I benchmark che contano, i due errori 400 che rompono le migrazioni ingenue e quando Opus 5 sostituisce Fable 5 nel tuo stack.
Claude Sonnet 5: la guida sul campo
Sonnet 5 è il nuovo default di Claude Code e il successore drop-in di Sonnet 4.6 — ma tre vincoli API ti restituiranno 400 durante la migrazione e un nuovo tokenizer produce circa il 30% di token in più per lo stesso testo. La matematica del pricing, il rimapping dell'effort (Sonnet 5 medium ≈ Sonnet 4.6 high) e i cambi di prompting che colgono i team di sorpresa.
ChatGPT per utenti Claude
Padroneggi Claude e devi usare ChatGPT? Le differenze che contano, cosa si trasferisce e quando scegliere l'uno o l'altro.
GPT-5.6 e ChatGPT Work per utenti Claude
OpenAI ha rilasciato la famiglia GPT-5.6 (Sol, Terra, Luna) e ChatGPT Work il 9 luglio 2026. Cosa è davvero cambiato per un utente Claude — contesto da 1,05M, un tier da 1$, un agente che lavora per ore e le parti del lancio di cui nessuno parla.
Aggiornamento GPT-5.6 di agosto 2026: slider di effort, pulsante Think gratis e il precipizio dei 272K
Il 6 agosto 2026 OpenAI ha spedito un aggiornamento mid-cycle di GPT-5.6 che quasi tutti i pezzi hanno riassunto con 'Sol è più intelligente'. La vera storia: un controllo di effort a sei livelli che cambia come prezzi una richiesta, un pulsante Think sul piano gratuito, un precipizio di pricing a 272K token che ri-prezza l'intera chiamata, e una modalità Fast che gira solo su Sol. Cosa significa ciascuna cosa per chi usa Claude.
OpenAI Astra: la scheda in anteprima
Il 1 agosto 2026 OpenAI ha presentato in anteprima il suo 'prossimo modello principale', Astra, con dieci dimostrazioni matematiche verificate in Lean e quasi zero specifiche di prodotto. Cosa è davvero confermato, cosa resta ignoto e se un utente Claude dovrebbe aspettare — la lettura onesta e documentata.
Codex Agent Plugins e federazione dei cataloghi (v0.147.0): la guida pratica
Il 7 agosto 2026 OpenAI ha rilasciato Codex CLI v0.147.0 — la versione che trasforma le Skill in Agent Plugin portabili con un catalogo a quattro livelli, introduce un flag --approve-for-me che non fa ciò che sembra, rimuove silenziosamente --full-auto e attiva l'opt-in a MCP 2026-07-28. Cosa fa davvero ogni pezzo, spiegato per chi usa Claude.
Accedi con ChatGPT
Il nuovo livello di identità di OpenAI, vecchio di tre giorni. Quali dati attraversano davvero il confine, cosa possono fare gli admin enterprise, e come accettarlo nella tua app senza dare a OpenAI un punto d'appoggio non voluto.
Eseguire modelli AI in locale con Ollama
Esegui modelli open-weight (Llama, Mistral, Qwen…) sulla tua macchina — privati, offline, gratis da eseguire — con Ollama. Setup, CLI e chiamata da codice.
Claude vs GPT vs Gemini per il coding
Un framework (non una classifica) per scegliere un modello di frontiera per il coding — i fattori che contano, e perché una eval sul tuo repo batte ogni benchmark.
CLI per agenti di coding a confronto
Claude Code, Codex CLI, Gemini CLI e gli agenti terminale open-source — come l'harness (non solo il modello) decide i tuoi risultati, e come tenere la tua configurazione portabile con AGENTS.md.
Supabase Evals — Benchmark su Agenti con Backend Reale
Supabase ha rilasciato open-source un benchmark che fa girare Claude Code, Codex e OpenCode contro stack Supabase reali in container — non mock. Ecco cosa misura, cosa ha scoperto su come i modelli usano davvero doc e skill, e come farlo girare in locale in una serata.
Apple Foundation Models 3 e lo stack LLM on-device per chi usa Claude
I modelli Foundation di terza generazione di Apple (AFM 3) sono arrivati al WWDC 2026 con un modello denso da 3B on-device, un MoE sparso da 20B che gira su iPhone, e un framework Swift-nativo che ora permette di collegare il proprio provider LLM — Claude incluso. Cosa è stato effettivamente rilasciato, i meccanismi non ovvi, e come cambia il quadro on-device per chi spedisce app Claude.
Gemini per utenti Claude
Fluente in Claude, ti serve Gemini di Google? Le differenze che contano — Gem, integrazione Workspace, contesto enorme, multimodale — e cosa si trasferisce.
Gemini 3.6 Flash, Flash-Lite e Flash Cyber per utenti Claude
Il 21 luglio 2026 Google ha saltato del tutto Gemini 3.5 Pro e ha rilasciato invece tre modelli di fascia Flash. Prezzi reali, benchmark reali, gli inciampi della migrazione e le cose che quasi nessuno racconta — incluso un fine-tune di cybersecurity che ha battuto Claude Opus 4.6 nella caccia ai bug di V8.
Gemini 3.7 Flash per utenti Claude: cavallo da soma per agenti di codice a metà prezzo (Ago 2026)
Il 13 agosto 2026, tre settimane dopo 3.6 Flash, Google ha rilasciato Gemini 3.7 Flash a metà del prezzo introduttivo con un salto di 16 punti su DeepSWE. Le insidie che quasi tutti gli articoli saltano: un prezzo introduttivo che scade, un vantaggio di throughput di 3× che conta per i loop degli agenti ma non per la chat, e dove ancora resta indietro rispetto a Claude Sonnet 5.
Grok per utenti Claude
Padroneggi Claude, ma ti serve Grok di xAI? Le differenze che contano — ricerca in tempo reale su X/web, un'API compatibile con OpenAI e l'agente di coding Grok Build — più tutto ciò che si trasferisce.
Muse Code + Muse Spark 1.2: l'agente di coding da terminale di Meta
Il 5 agosto 2026 Meta ha rilasciato Muse Code, un agente di coding da terminale, e Muse Spark 1.2, il modello co-addestrato con esso. Cosa ti compra davvero l'event log append-only, perché il tier contributor costa 12,5× meno di quello standard, come si posiziona rispetto a Claude Code su Terminal-Bench 2.1 e le tre skill incluse che vale la pena rubare a prescindere dall'agente che usi.
Framework open-source per agenti AI
Una mappa neutrale rispetto al provider dei principali framework aperti per costruire agenti LLM — LangGraph, LlamaIndex, AutoGen, CrewAI e l'approccio a loop minimale — e come scegliere.
API Multi-Agente Native: Responses Multi-Agent Beta di OpenAI vs Costruirtelo da Solo
Il 9 luglio 2026 OpenAI ha rilasciato la beta multi-agente della Responses API e la Sol Ultra Mode — il primo vendor frontier a rendere 'il modello spawna e sintetizza N sub-agenti in una sola richiesta HTTP' una primitiva di prima classe. Cosa esce davvero, la forma dell'API, la matematica dei costi, cosa fa Anthropic al suo posto, e quando la primitiva nativa batte un fan-out DIY.
A2A: il protocollo Agent-to-Agent
MCP collega gli agenti agli strumenti. A2A collega gli agenti ad altri agenti — tra framework, cloud e aziende diverse. Impara l'Agent Card, i task, gli otto stati del ciclo di vita, streaming vs. webhook, e come A2A si compone con MCP.
Pagamenti degli agenti: x402, MPP e AgentCore GA
Come gli agenti AI pagano davvero le cose oggi: il protocollo x402 su HTTP 402, gli schemi exact/upto/batch-settlement, i facilitator, la GA di Amazon Bedrock AgentCore Payments di agosto 2026 (payment session, Coinbase Bazar MCP, Stripe Privy, Machine Payment Protocol), e come aggiungere un paywall o un agente che spende senza inventarsi un wallet.
Portare i Prompt tra Modelli Diversi
Sposta un prompt tra Claude, GPT, Gemini e modelli open — cosa si trasferisce senza problemi, cosa adattare per ciascun modello e un workflow di migrazione.
Pattern di Routing dei Modelli: cascate, classificatori e cosa arriva davvero in produzione
I design pattern per inviare ogni richiesta al modello AI giusto — rule-based, classificatore, complessità, cascata, ensemble, fallback. Quando usare ciascuno, cosa si rompe e le ricette che funzionano davvero nel 2026.
DeepSeek, Qwen e l'ondata open-weight
Potenti modelli open-weight (DeepSeek, Qwen, Llama, Mistral) hanno chiuso gran parte del divario. Cosa significa 'open weight', i trade-off vs la frontiera closed, e come usarli.
Qwen3.8-Max: il primo modello Max open-weight (quando i pesi arrivano davvero)
3 agosto 2026: Qwen3.8-Max di Alibaba esce API-only con un MoE da 2.4T parametri (95B attivi), contesto da 1M, doppia API in specifica OpenAI/Anthropic e benchmark che battono GPT-5.6 Sol Max su OSWorld. Cosa c'è davvero di nuovo, cosa significa 'open weight' quando la pagina Hugging Face è vuota e la matematica della sparsità che rende costoso il self-hosting.
DeepSeek V4-Flash-Vision: il primo open weight di frontiera con visione nativa
Il 31 agosto 2026 DeepSeek ha rilasciato open source V4-Flash-Vision-Exp: un MoE da 305B che aggiunge visione nativa a V4-Flash senza intaccare i punteggi degli agenti testuali, eguaglia o batte Claude Opus 4.8 su ApexBench / Agents' Last Exam / ZeroBench a una frazione del prezzo, ed è distribuito con licenza MIT. I numeri specifici, il limite rigido di 384 token per immagine che la maggior parte delle guide ignora, e il modo concreto per eseguirlo.
Kimi K2 per utenti Claude
Kimi K2 di Moonshot è un agente open-weight da un trilione di parametri costruito per catene di uso strumenti lunghe. Cosa lo rende davvero diverso da Claude — pesi INT4 nativi, 200–300 tool call sequenziali, una licenza permissiva — e quando conviene sceglierlo.
GLM-5.2: modello di coding open-weight di frontiera
Il MoE da 753B (~40B attivi) di Z.ai, contesto da 1M token, licenza MIT — arriva a un punto da Claude Opus 4.8 sul coding long-horizon, a circa un sesto del costo API. Cosa fa davvero IndexShare, come lo fai girare in locale, e dove batte Claude Code sul campo.
Inkling: il modello open-weights di Thinking Machines
Il Thinking Machines Lab di Mira Murati ha rilasciato Inkling — un MoE multimodale da 975B parametri sotto Apache 2.0, con una manopola continua per lo sforzo di ragionamento. Cosa ha sbagliato la copertura del lancio, perché perde i benchmark di proposito e cosa fa davvero quella manopola.
Kimi K3: il più grande modello open-weight al mondo
Il modello open-weight da 2,8 trilioni di parametri di Moonshot AI batte Claude Opus 4.8 su molti benchmark e domina la Frontend Code Arena. Cosa lo rende architetturalmente diverso, quando il prezzo cache-hit ribalta il calcolo dei costi, e se vale la pena sceglierlo.
Eseguire Kimi K3 in locale: vLLM, DSpark e il vero conto hardware
La guida pratica definitiva per il self-hosting di Kimi K3, l'open-weight da 2.8T di Moonshot, nel 2026. Cosa fa davvero il speculative decoding DSpark, hardware minimo (1× DGX B300 o 16× DGX Spark), i comandi vLLM esatti, l'asimmetria prefill/decode di cui nessuno ti avverte, e quando l'inferenza hosted batte il tuo rack.
Dentro Grok Build: leggere un harness di agente open
xAI ha pubblicato sotto Apache 2.0 l'intero sorgente Rust del suo agente di coding — il loop dell'agente, il layer dei tool, la TUI e il sistema di estensioni. Cosa insegna la mappa dei crate su come si costruisce un agente, perché qui 'open source' significa source-available, e cosa racconta il codice del data-collector ancora presente nell'albero.
Poolside Laguna: modelli di coding open-weight che colpiscono sopra la loro categoria
La famiglia Laguna di Poolside AI (XS 2.1, S 2.1, M.1) — modelli di coding MoE con 3B–23B parametri attivi, contesto da 1M token, licenza OpenMDW-1.1. Che cosa batte davvero S 2.1 con 8B attivi, perché XS 2.1 con 3B attivi gira su un MacBook, la prima pipeline di training RL in FP8 conosciuta, e quando sceglierlo al posto di Claude, GLM-5.2 o Kimi K3.
Media generativi: AI per immagini, audio e video
Oltre la chat testuale — una mappa dell'AI per immagini, video, voce e musica: gli strumenti principali, le competenze durature, e i diritti/l'etica che contano.
MiniMax H3 (Hailuo 3.0): il modello video omni open-weight
MiniMax ha aperto un transformer single-stream da 33B che genera 4–15s di video 2K con audio stereo nativo in un solo passaggio. La licenza blocca silenziosamente il self-hosting in USA/UE/UK/Corea, la base open è 768p (non 2K), e ~13B dei 33B parametri sono branch AdaLN che puoi saltare in inferenza. Cos'è davvero H3, quanto costa e quando batte le API video chiuse.
Quanto costa davvero l'AI (tra i vari provider)
Un quadro duraturo per confrontare il costo dell'AI tra i provider — gli archetipi di prezzo, come stimare un carico di lavoro, le leve per ridurre il conto e quando conviene open/locale.
Perché gli agenti AI bruciano token (e come mettere un tetto al conto)
Un run agentico costa 50–1000 volte una chat — non perché il modello sia più stupido, ma per via della valanga di contesto. Il meccanismo, i numeri sorprendenti e le quattro leve che tagliano davvero il conto su Claude, GPT, Gemini e modelli open.
Costruire agenti AI locali
Agenti autonomi che girano interamente sulla tua macchina con un modello locale a pesi aperti — privati, offline, gratuiti da eseguire. L'architettura, i compromessi, e come iniziare.
Claude + modelli locali: pattern ibridi
Fai lavorare in sinergia Claude e i modelli open-weight locali — router, draft-then-refine, redazione della privacy, pre-processing di massa — per il ragionamento della frontiera con la privacy e il costo del locale.
AI Gateway: LiteLLM, OpenRouter, Portkey, Vercel
Un AI gateway di produzione è il router mancante tra la tua app e ogni modello — Claude, GPT, Gemini, Llama. Confronta LiteLLM, OpenRouter, Portkey e Vercel AI Gateway, poi collega Claude Code al tuo proxy.
Agenti di coding locali (e come si abbinano a Claude)
Agenti di coding che girano sulla tua macchina e modificano il tuo repo — Aider, Cline, Continue, OpenHands, Claude Code — alimentati da Claude per la qualità o da un modello locale per la privacy.
Collegare Claude a strumenti e agent locali con MCP
Il Model Context Protocol permette a Claude di orchestrare strumenti, dati e agent che girano in privato sulla tua macchina — la sinergia Claude-come-cervello, capacità-locali. Aggiungi o costruisci un server MCP locale.
Costruisci uno Stack di AI Locale Privato (End-to-End)
Metti tutto insieme: un modello locale (Ollama) + un agente model-agnostic + strumenti tramite un server MCP locale — un assistente privato sulla tua macchina, con Claude come livello intelligente opzionale.
Agente locale o Claude? Una guida alla decisione
Agente completamente locale, alimentato da Claude, o ibrido? I fattori che lo decidono — privacy, difficoltà del compito, costo, latenza, affidabilità — e perché spesso vince l'ibrido.
Mettere in sicurezza gli agenti locali e ibridi
Un agente che può modificare file ed eseguire comandi è potente e pericoloso. Privilegio minimo, sandboxing, approvazione umana, difesa dalla prompt injection, tetti di spesa — come far girare gli agenti in sicurezza.
Modelli di ragionamento a confronto
Budget di pensiero e sforzo di ragionamento tra Claude, GPT, Gemini, DeepSeek e Qwen — quando spendere token per pensare e quando no.
Voice AI full-duplex: perché gli agenti vocali sono diventati di colpo reali
GPT-Live e i nuovi modelli speech-native ascoltano e parlano contemporaneamente. Cosa cambia il full-duplex, come funziona e il panorama della voice-AI oggi.
Claude Voice con Opus e Sonnet (luglio 2026): voce reasoning-first vs GPT-Live
Il 23 luglio 2026 Anthropic ha aperto la voce di Claude a Opus, Sonnet e alle app connesse — ma ha mantenuto lo stack a turni. Cosa è cambiato davvero, quando cambiare modello a metà chiamata e come la scommessa di design differisce dal full-duplex di GPT-Live.
Velocità dei token: perché l'inferenza AI è diventata di colpo 10-15× più veloce
Chip wafer-scale e LPU servono modelli di frontiera a centinaia di token al secondo. Cosa limita davvero la velocità di inferenza, la nuova corsa all'hardware, e perché i token veloci cambiano agenti, voce e ragionamento.
Agenti Computer-Use a confronto
Claude, GPT e Gemini possono ormai tutti pilotare uno schermo — ma ciascuno espone uno spazio d'azione, un contratto sulle coordinate e un gate di sicurezza diversi. Cosa si rompe davvero, e come costruire un loop che sopravviva.
Browser a login condiviso per agenti AI: il pattern ego lite
Una nuova classe di browser — meglio esemplificata da ego lite, che ha raggiunto il #1 su GitHub Trending il 24 luglio 2026 — permette a Claude Code, Codex, Cursor e a qualsiasi altro coding agent di guidare una sessione Chromium isolata che eredita i tuoi login reali. Cosa risolvono davvero Spaces e snapshot semantici, perché insidiano Playwright per il lavoro con agenti, e il costo di sicurezza di condividere i cookie di sessione con un processo autonomo.
Cloudflare Kitesurf: il primo runtime browser costruito per agenti AI (non per umani)
Il 6 agosto 2026 Cloudflare ha lanciato Kitesurf, un browser stateless agent-first che gira interamente in V8 isolate su Workers. Usa 3-7x meno CPU e memoria di Chromium su task comuni degli agenti — al costo di ~1.7x più tempo wall-clock. Scritto in Rust, usa il parser CSS di Firefox (Stylo) e il rendering engine Blitz, drop-in compatibile con Puppeteer/Playwright via Chrome DevTools Protocol. Questa pagina: cosa è cambiato, quando raggiungerlo invece di headless Chrome, come collegarlo a Claude Code / Codex / il tuo client MCP, e le quattro cose che al momento proprio non può fare.
SKILL.md: lo standard aperto cross-agent
Un solo file SKILL.md, trentadue agenti. Cos'è davvero lo standard aperto Agent Skills, come la progressive disclosure tiene basso il costo del contesto, cosa rompe la portabilità e come scrivere una skill che gira senza modifiche in Claude Code, Codex, Gemini CLI e Cursor.
Colibrì: far girare un MoE da 744B dal tuo SSD (e cosa ti costa davvero)
Colibrì è un engine in C puro, senza dipendenze, che esegue GLM-5.2 (744B), Kimi K3 (2.8T), DeepSeek V4.1 Flash e altri sei modelli MoE di frontiera su una macchina da 16–32 GB tenendo i layer densi in RAM e facendo streaming degli expert instradati da NVMe. Questa pagina spiega la gerarchia di memoria, i numeri che decidono se è usabile per te (da 0,05 a 6,8 tok/s), le insidie dell'usura SSD e dello speculative decoding, e i comandi esatti per ottenere il primo token.
OpenAI Agents API vs Claude Managed Agents: il loop agentico hosted, a confronto
Il 10 settembre 2026 OpenAI ha messo l'harness di Codex dietro una singola chiamata API: la beta pubblica della Agents API — sessioni durevoli, sandbox hosted o self-hosted, compaction automatica, tool search, subagenti. Anthropic offre la stessa forma da aprile con Managed Agents. Entrambi usano le stesse quattro primitive; differiscono su permessi, segreti, budget, policy di rete e costo della sandbox. Il confronto fianco a fianco, le forme delle richieste, i sei gotcha e quando scegliere quale.
Perché un system prompt da 35 KB si rompe su un modello locale
Spostare un grande system prompt Claude/GPT su Ollama o un altro runtime locale: l'aritmetica del budget di contesto, il troncamento silenzioso a metà prompt di Ollama, i segnali di esaurimento del contesto e la ristrutturazione che funziona davvero.