Il panorama dei modelli AI: scegliere tra Claude, ChatGPT, Gemini e i modelli open
Il cuore di AILmanac è Claude — ma le competenze viaggiano. Le stesse abitudini di prompting, context engineering, tool-use ed eval funzionano su quasi ogni modello moderno. Questa pagina allarga lo sguardo all'intero campo: chi sono i protagonisti principali, come scegliere per un compito, e cosa resta valido qualunque modello tu usi.
- Conoscere i principali assistenti e modelli AI e a quale archetipo appartiene ciascuno
- Usare un framework ripetibile per scegliere un modello per un compito specifico — non per hype
- Vedere quali competenze si trasferiscono su ogni modello (quasi tutte)
- Sapere quali fatti diventano obsoleti in fretta — e dove verificare la verità attuale
I protagonisti principali (per archetipo, non per classifica)
Ragiona in archetipi — le classifiche si rimescolano, gli archetipi restano stabili:
- Anthropic — Claude · modello closed di frontiera. Noto per coding, uso agentico/di strumenti, ragionamento su contesti lunghi e un'impostazione safety-first. (Tutto il resto di questo sito approfondisce qui.)
- OpenAI — ChatGPT / GPT · modello closed di frontiera con il più grande ecosistema consumer e un set di funzionalità molto ampio e multimodale.
- Google — Gemini · modello closed di frontiera, profondamente integrato nei prodotti e nei dati di Google, con finestre di contesto molto grandi.
- Meta — Llama · open-weight: puoi scaricarlo e ospitarlo in proprio. La spina dorsale di gran parte dell'ecosistema locale/open.
- Mistral · open-weight + API, europeo, orientato all'efficienza.
- xAI — Grok · closed, integrato con X, punta sul segnale in tempo reale.
- DeepSeek / Qwen (Alibaba) · potenti modelli open-weight noti per il rapporto capacità/costo; popolari per il self-hosting.
- Il bivio pratico più grande è CLOSED di frontiera (migliore capacità pura, solo hosted) vs OPEN-WEIGHT (self-hostabile, privato, personalizzabile, spesso più economico da eseguire su larga scala).
- Non scegliere dalla classifica. L'unico benchmark che conta è IL TUO compito sui TUOI dati.
Come scegliere un modello per un compito
Guided walkthrough1 of 6
- Cosa deve fare, e cosa è non negoziabile: privacy dei dati (i dati possono lasciare la tua rete?), budget, latenza, contesto massimo, dominio regolamentato, requisito on-device.
- Ti serve la capacità assoluta al top con zero infrastruttura? Un modello closed di frontiera (Claude / GPT / Gemini). Ti serve privacy, self-hosting, forte personalizzazione o il costo di esecuzione più basso su larga scala? Un modello open-weight (Llama / Mistral / Qwen / DeepSeek) che ospiti tu.
- Scegline un paio che plausibilmente rispettano i vincoli — non agonizzare; li testerai.
- 10-50 casi reali con risposte note-corrette. Esegui ogni candidato. Questo batte ogni classifica pubblica per il tuo caso d'uso.
- Moltiplica costo e velocità per chiamata per il traffico atteso. Il modello 'migliore' può essere quello sbagliato se costa 10x per un 2% di qualità in più che non ti serve.
- Rieseguila quando esce un nuovo modello. Cambiare è economico quando hai un'eval; è un lancio di moneta quando non ce l'hai.
Scheletro di system prompt neutrale rispetto al provider (funziona su ogni modello)
You are a {role}.
Goal: {one sentence}.
Rules:
- Use ONLY the provided context; if the answer isn't there, say "I don't know".
- Output: {exact format / schema}.
Context:
{context}
Task: {task}Cosa si trasferisce su (quasi) ogni modello
Il motivo per cui imparare bene Claude ripaga ovunque — queste competenze sono portabili:
- Struttura del prompt — ruolo chiaro, compito esplicito, esempi, formato di output → Basi del prompting
- Context engineering — decidere cosa entra nella finestra → Fondamenti
- Tool use / function calling — il pattern è quasi identico tra i provider → Tool Use
- Retrieval (RAG) — ancorare le risposte ai tuoi dati → RAG
- Eval — misurare la qualità per confrontare i modelli onestamente → Eval
- Output strutturato — rendere i risultati leggibili dalla macchina → Output strutturato
Cosa NON si trasferisce in modo pulito: le esatte forme delle API, i dettagli JSON del tool-calling, i limiti di token, i prezzi e il comportamento di safety/rifiuto — riverifica sempre per ciascun provider.
Vocabolario del panorama
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.1 / 4
Verifica te stesso
0/3- Ragiona in archetipi (closed di frontiera vs open-weight); le classifiche cambiano, gli archetipi no.
- Scegli in base ai vincoli + una piccola eval sui tuoi dati — mai per hype da classifica.
- La maggior parte delle competenze (prompting, contesto, strumenti, RAG, eval) si trasferisce su ogni modello — ecco perché approfondire Claude ripaga ovunque.
- Nomi, prezzi, limiti e benchmark diventano obsoleti in fretta — verifica i dettagli attuali alla fonte.
Fonti e approfondimenti
- Anthropic — Panoramica dei modelli — la lineup attuale di Claude.
- OpenAI — Modelli · Google — Modelli Gemini · Meta — Llama · Mistral — Modelli — la fonte di verità attuale di ciascun provider.
- Artificial Analysis — confronti indipendenti e aggiornati di frequente su capacità/prezzo/velocità.
- Ollama · LM Studio — esegui modelli open-weight localmente.
Prossimi passi
- Approfondisci il core → Quale Claude dovrei usare?
- Rendi misurabile la tua scelta → Eval
- Le competenze che viaggiano → Basi del prompting · Fondamenti