DeepSeek, Qwen e l'ondata open-weight
Per lungo tempo la storia della "buona AI" era la storia di una manciata di modelli closed di frontiera che potevi solo affittare tramite un'API. Non è più tutta la storia. Un'ondata di modelli open-weight — molti da laboratori cinesi come DeepSeek e Qwen di Alibaba, insieme a Llama di Meta e Mistral francese — è diventata abbastanza buona, abbastanza economica e abbastanza piccola da rendere lo scaricare ed eseguire il proprio modello capace un'opzione reale. Questa pagina è la mappa duratura di quel panorama: perché è successo, cosa significa davvero "open weight", i trade-off onesti rispetto ai modelli closed di frontiera, e come usare concretamente questi modelli oggi.
- Capire PERCHÉ i modelli open-weight sono diventati competitivi — capacità-per-costo e ragionamento aperto
- Fissare cosa significa davvero 'open weight' — vs open-source e vs open-data
- Riconoscere gli archetipi: chat generale, ragionamento, coding e modelli piccoli/efficienti
- Pesare i trade-off reali vs la frontiera closed — divario di capacità sui compiti più difficili, e possedere la propria infra e safety
- Conoscere i due modi per usarli concretamente: un'API hosted, o il self-hosting via Ollama
Perché i modelli open-weight sono diventati competitivi all'improvviso
Tre cose sono cambiate all'incirca nello stesso momento, e insieme hanno chiuso gran parte del divario quotidiano.
- La capacità-per-costo è crollata. Ricette di training migliori, curatela dei dati e architetture mixture-of-experts (MoE) (dove solo una frazione dei parametri di un modello grande si attiva per token) hanno permesso ai laboratori di spedire modelli che rendono ben oltre il loro costo. Per una grossa fetta di compiti reali — redigere, riassumere, estrazione, classificazione, coding di routine — un buon modello open è ora "abbastanza buono", a una frazione del costo di un'API di frontiera.
- Sono arrivati i modelli di ragionamento aperti. La linea di ragionamento di DeepSeek è stata un punto di svolta: ha mostrato che la capacità "pensa passo per passo prima di rispondere" — prima il fossato di pochi modelli closed — poteva essere allenata e rilasciata con pesi aperti. Una volta che un laboratorio l'ha dimostrato, il resto dell'ecosistema open ha seguito.
- I modelli piccoli sono diventati davvero usabili. Modelli sotto i 10B e persino sotto 1B sono diventati coerenti e utili, il che significa che puoi eseguire qualcosa di capace su un laptop o un server economico. Questo cambia l'economia di privacy, latenza e scala.
L'effetto netto: il divario con la frontiera closed non è svanito, ma per la maggior parte del lavoro ha smesso di essere il fattore decisivo. I fattori decisivi sono diventati costo, controllo e dove vivono i tuoi dati.
Cosa significa davvero "open weight"
Questo è il punto più confuso in assoluto in tutto lo spazio. "Open" fa molto lavoro in tre modi diversi, e non sono la stessa cosa.
| Termine | Cosa ottieni davvero | Cosa di solito NON ottieni |
|---|---|---|
| Open weight | Il file del modello allenato (i pesi). Puoi scaricarlo, eseguirlo, fare fine-tuning e self-host. | I dati di training, e a volte il codice di training completo. L'uso può essere governato da una licenza custom. |
| Open source (stretto) | I pesi più il codice di training/inference sotto una licenza in stile OSI, con libertà di usare, modificare e ridistribuire. | Spesso comunque non i dati di training. |
| Open data | I dataset effettivi su cui il modello è stato allenato, pubblicati apertamente. | Raro per modelli su scala di frontiera; la maggior parte dei modelli "open" è open-weight, non open-data. |
Il succo pratico: la maggior parte dei modelli che la gente chiama "open source" è in realtà open-weight. Puoi eseguirli e adattarli, ma tipicamente non puoi riprodurli da zero, e devi leggere la licenza. Le licenze variano:
- Alcuni escono sotto licenze permissive (Apache 2.0, MIT) pulite per l'uso commerciale — i modelli Qwen e Mistral, per esempio, hanno storicamente usato Apache 2.0, e DeepSeek ha usato MIT per le release principali.
- Alcuni escono sotto licenze community custom con condizioni — la licenza Llama di Meta, per esempio, ha storicamente incluso una clausola che limita le aziende più grandi (per utenti attivi mensili) dall'usarla liberamente.
Controlla sempre la model card specifica per la sua licenza prima di costruirci sopra. Neutrale ma importante: il fatto che un modello sia open-weight ti dice che puoi ospitarlo tu; non ti dice i termini legali, e non fa sparire le questioni di licenza o residenza dei dati — le sposta a te.
I quattro archetipi
Le famiglie open-weight arrivano quasi sempre come uno spread di varianti, non un singolo modello. Impara i quattro archetipi e potrai leggere la lineup di qualsiasi laboratorio a colpo d'occhio.
Una singola famiglia — Qwen è l'esempio più chiaro — tipicamente ti dà l'intera scala: modelli minuscoli per edge e laptop, modelli di taglia media per server, un grande flagship per i compiti più difficili, più varianti specializzate per coding e ragionamento. Scegli il gradino che si adatta al tuo hardware e compito, non "il modello".
I trade-off onesti vs la frontiera closed
I modelli open-weight non sono un upgrade netto. Sono un affare diverso. Ecco lo scambio in modo neutrale.
| Dimensione | Open-weight (self-host o host economico) | Frontiera closed (API hosted) |
|---|---|---|
| Capacità sui compiti più difficili | Forte e in rapido recupero, ma la frontiera closed di solito guida ancora sui compiti di ragionamento, agentici a lungo orizzonte e di nicchia più difficili in assoluto | Tipicamente il tetto sui compiti più tosti |
| Costo su scala | Può essere drasticamente più economico, specialmente self-hosted o via host economici | Premium per token; prevedibile ma si somma |
| Privacy / residenza dei dati | Puoi tenere i dati completamente dentro il tuo ambiente | I dati lasciano la tua rete verso il provider |
| Controllo e personalizzazione | Pieno: fine-tune, quantizza, blocca una versione, esegui offline | Limitato a ciò che l'API espone; le versioni possono cambiare sotto di te |
| Chi possiede safety e ops | Tu — guardrail, filtraggio degli abusi, uptime, scaling e patching sono compito tuo | Il provider gestisce l'infra e spedisce una safety di base |
Quell'ultima riga è quella che la gente sottovaluta. Quando self-host un modello open-weight erediti anche le responsabilità che un laboratorio di frontiera normalmente assorbe per te: safety dei contenuti e mitigazione degli abusi, tenere il deployment patchato, capacità e uptime, e valutare tu stesso ogni nuova versione del modello. "Open weight" ti compra controllo, e il controllo è un costo tanto quanto un beneficio. Per l'intuizione sui costi sul lato API di questo scambio, vedi Economia dei token.
Come usare concretamente un modello open
Ci sono esattamente due vie, e la maggior parte dei team le usa entrambe in fasi diverse.
- API hosted — molti provider (inclusi i laboratori stessi e host di inference di terze parti) servono modelli open-weight dietro un'API, spesso OpenAI-compatibile. Ottieni l'economia dei modelli open con zero lavoro di infrastruttura. Meglio quando vuoi basso costo senza gestire server, ma nota che i tuoi dati lasciano comunque la tua rete.
- Self-host — scarica i pesi ed eseguili nel tuo ambiente. Massima privacy e controllo, e l'unica opzione quando i dati davvero non possono lasciare la tua rete. La rampa d'accesso più facile è Ollama, che scarica ed esegue modelli open con un singolo comando.
Prova un modello localmente in quattro passi
- Scaricalo da ollama.com/download (macOS/Windows) o usa lo script di installazione Linux. Questo ti dà il comando ollama e un servizio locale in background. Guida completa sulla pagina Eseguire modelli localmente.
- I modelli più piccoli richiedono meno RAM/VRAM. Un laptop esegue comodamente varianti piccole (pochi GB); i grandi flagship necessitano di una vera GPU o server. Parti piccolo per confermare che tutto funzioni, poi scala se la qualità non basta.
- ollama run <model> scarica i pesi al primo uso (diversi GB), poi ti lascia in una chat interattiva. La prima esecuzione è lenta perché sta scaricando; le esecuzioni successive sono istantanee dalla cache.
- Ollama espone un endpoint locale OpenAI-compatibile, quindi puoi puntare un SDK esistente in stile OpenAI a localhost invece che al cloud. Ora lo stesso codice gira contro un modello privato e locale.
Scarica ed esegui un modello open localmente con Ollama
ollama run qwen3
Quel singolo comando scarica un modello open-weight Qwen e avvia una chat locale — nessuna API key, nessun dato che lascia la tua macchina. Sostituisci qwen3 con un'altra famiglia (per esempio un tag Llama, Mistral o DeepSeek) per confrontarli sul tuo compito. Scegliere il modello giusto per un dato lavoro è una competenza a sé: vedi Scegliere un modello.
Scegliere tra open e closed, in pratica
Non scegliere dalla classifica. Scegli in base al vincolo:
- I dati non possono lasciare la tua rete → open-weight self-hosted è la risposta, punto.
- Alto volume, sensibile al costo, qualità "abbastanza buona" → open-weight (hosted o self-hosted) di solito vince sul costo.
- Ti serve il meglio in assoluto sui compiti più difficili → la frontiera closed tende ancora a guidare — usala dove conta e instrada il traffico più facile a modelli open più economici.
- Vuoi fare fine-tune, quantizzare, bloccare una versione o eseguire offline → solo i pesi aperti ti danno quel controllo.
La mossa più duratura è eseguire una piccola valutazione sui tuoi dati reali tra un candidato open e uno closed. I benchmark descrivono il compito di qualcun altro; la tua eval descrive il tuo.
Verifica te stesso
0/3- I modelli open-weight hanno chiuso gran parte del divario quotidiano grazie a capacità-per-costo, modelli di ragionamento aperti e modelli piccoli davvero usabili
- 'Open weight' = pesi scaricabili che puoi eseguire e fare fine-tuning — NON necessariamente codice open-source, dati di training aperti o una licenza permissiva; leggi sempre la model card
- Leggi qualsiasi lineup per archetipo: chat generale, ragionamento, coding e piccolo/efficiente — la maggior parte delle famiglie spedisce l'intera scala di taglie
- Lo scambio è reale: open compra costo, privacy e controllo, ma la frontiera closed di solito guida ancora sui compiti più difficili e tu erediti safety e infra
- Due modi per usarli: un'API hosted (spesso OpenAI-compatibile), o self-host via Ollama con un comando — poi valuta sui TUOI dati, non su una classifica