Passa al contenuto principale

DeepSeek, Qwen e l'ondata open-weight

Intermedio

Per lungo tempo la storia della "buona AI" era la storia di una manciata di modelli closed di frontiera che potevi solo affittare tramite un'API. Non è più tutta la storia. Un'ondata di modelli open-weight — molti da laboratori cinesi come DeepSeek e Qwen di Alibaba, insieme a Llama di Meta e Mistral francese — è diventata abbastanza buona, abbastanza economica e abbastanza piccola da rendere lo scaricare ed eseguire il proprio modello capace un'opzione reale. Questa pagina è la mappa duratura di quel panorama: perché è successo, cosa significa davvero "open weight", i trade-off onesti rispetto ai modelli closed di frontiera, e come usare concretamente questi modelli oggi.

What you'll learn
  • Capire PERCHÉ i modelli open-weight sono diventati competitivi — capacità-per-costo e ragionamento aperto
  • Fissare cosa significa davvero 'open weight' — vs open-source e vs open-data
  • Riconoscere gli archetipi: chat generale, ragionamento, coding e modelli piccoli/efficienti
  • Pesare i trade-off reali vs la frontiera closed — divario di capacità sui compiti più difficili, e possedere la propria infra e safety
  • Conoscere i due modi per usarli concretamente: un'API hosted, o il self-hosting via Ollama

Perché i modelli open-weight sono diventati competitivi all'improvviso

Tre cose sono cambiate all'incirca nello stesso momento, e insieme hanno chiuso gran parte del divario quotidiano.

  • La capacità-per-costo è crollata. Ricette di training migliori, curatela dei dati e architetture mixture-of-experts (MoE) (dove solo una frazione dei parametri di un modello grande si attiva per token) hanno permesso ai laboratori di spedire modelli che rendono ben oltre il loro costo. Per una grossa fetta di compiti reali — redigere, riassumere, estrazione, classificazione, coding di routine — un buon modello open è ora "abbastanza buono", a una frazione del costo di un'API di frontiera.
  • Sono arrivati i modelli di ragionamento aperti. La linea di ragionamento di DeepSeek è stata un punto di svolta: ha mostrato che la capacità "pensa passo per passo prima di rispondere" — prima il fossato di pochi modelli closed — poteva essere allenata e rilasciata con pesi aperti. Una volta che un laboratorio l'ha dimostrato, il resto dell'ecosistema open ha seguito.
  • I modelli piccoli sono diventati davvero usabili. Modelli sotto i 10B e persino sotto 1B sono diventati coerenti e utili, il che significa che puoi eseguire qualcosa di capace su un laptop o un server economico. Questo cambia l'economia di privacy, latenza e scala.

L'effetto netto: il divario con la frontiera closed non è svanito, ma per la maggior parte del lavoro ha smesso di essere il fattore decisivo. I fattori decisivi sono diventati costo, controllo e dove vivono i tuoi dati.

Cosa significa davvero "open weight"

Questo è il punto più confuso in assoluto in tutto lo spazio. "Open" fa molto lavoro in tre modi diversi, e non sono la stessa cosa.

TermineCosa ottieni davveroCosa di solito NON ottieni
Open weightIl file del modello allenato (i pesi). Puoi scaricarlo, eseguirlo, fare fine-tuning e self-host.I dati di training, e a volte il codice di training completo. L'uso può essere governato da una licenza custom.
Open source (stretto)I pesi più il codice di training/inference sotto una licenza in stile OSI, con libertà di usare, modificare e ridistribuire.Spesso comunque non i dati di training.
Open dataI dataset effettivi su cui il modello è stato allenato, pubblicati apertamente.Raro per modelli su scala di frontiera; la maggior parte dei modelli "open" è open-weight, non open-data.

Il succo pratico: la maggior parte dei modelli che la gente chiama "open source" è in realtà open-weight. Puoi eseguirli e adattarli, ma tipicamente non puoi riprodurli da zero, e devi leggere la licenza. Le licenze variano:

  • Alcuni escono sotto licenze permissive (Apache 2.0, MIT) pulite per l'uso commerciale — i modelli Qwen e Mistral, per esempio, hanno storicamente usato Apache 2.0, e DeepSeek ha usato MIT per le release principali.
  • Alcuni escono sotto licenze community custom con condizioni — la licenza Llama di Meta, per esempio, ha storicamente incluso una clausola che limita le aziende più grandi (per utenti attivi mensili) dall'usarla liberamente.

Controlla sempre la model card specifica per la sua licenza prima di costruirci sopra. Neutrale ma importante: il fatto che un modello sia open-weight ti dice che puoi ospitarlo tu; non ti dice i termini legali, e non fa sparire le questioni di licenza o residenza dei dati — le sposta a te.

I quattro archetipi

Le famiglie open-weight arrivano quasi sempre come uno spread di varianti, non un singolo modello. Impara i quattro archetipi e potrai leggere la lineup di qualsiasi laboratorio a colpo d'occhio.

Archetipi dei modelli open-weight
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 4

Una singola famiglia — Qwen è l'esempio più chiaro — tipicamente ti dà l'intera scala: modelli minuscoli per edge e laptop, modelli di taglia media per server, un grande flagship per i compiti più difficili, più varianti specializzate per coding e ragionamento. Scegli il gradino che si adatta al tuo hardware e compito, non "il modello".

I trade-off onesti vs la frontiera closed

I modelli open-weight non sono un upgrade netto. Sono un affare diverso. Ecco lo scambio in modo neutrale.

DimensioneOpen-weight (self-host o host economico)Frontiera closed (API hosted)
Capacità sui compiti più difficiliForte e in rapido recupero, ma la frontiera closed di solito guida ancora sui compiti di ragionamento, agentici a lungo orizzonte e di nicchia più difficili in assolutoTipicamente il tetto sui compiti più tosti
Costo su scalaPuò essere drasticamente più economico, specialmente self-hosted o via host economiciPremium per token; prevedibile ma si somma
Privacy / residenza dei datiPuoi tenere i dati completamente dentro il tuo ambienteI dati lasciano la tua rete verso il provider
Controllo e personalizzazionePieno: fine-tune, quantizza, blocca una versione, esegui offlineLimitato a ciò che l'API espone; le versioni possono cambiare sotto di te
Chi possiede safety e opsTu — guardrail, filtraggio degli abusi, uptime, scaling e patching sono compito tuoIl provider gestisce l'infra e spedisce una safety di base

Quell'ultima riga è quella che la gente sottovaluta. Quando self-host un modello open-weight erediti anche le responsabilità che un laboratorio di frontiera normalmente assorbe per te: safety dei contenuti e mitigazione degli abusi, tenere il deployment patchato, capacità e uptime, e valutare tu stesso ogni nuova versione del modello. "Open weight" ti compra controllo, e il controllo è un costo tanto quanto un beneficio. Per l'intuizione sui costi sul lato API di questo scambio, vedi Economia dei token.

Come usare concretamente un modello open

Ci sono esattamente due vie, e la maggior parte dei team le usa entrambe in fasi diverse.

  1. API hosted — molti provider (inclusi i laboratori stessi e host di inference di terze parti) servono modelli open-weight dietro un'API, spesso OpenAI-compatibile. Ottieni l'economia dei modelli open con zero lavoro di infrastruttura. Meglio quando vuoi basso costo senza gestire server, ma nota che i tuoi dati lasciano comunque la tua rete.
  2. Self-host — scarica i pesi ed eseguili nel tuo ambiente. Massima privacy e controllo, e l'unica opzione quando i dati davvero non possono lasciare la tua rete. La rampa d'accesso più facile è Ollama, che scarica ed esegue modelli open con un singolo comando.

Prova un modello localmente in quattro passi

Guided walkthrough1 of 4
  1. Scaricalo da ollama.com/download (macOS/Windows) o usa lo script di installazione Linux. Questo ti dà il comando ollama e un servizio locale in background. Guida completa sulla pagina Eseguire modelli localmente.

Scarica ed esegui un modello open localmente con Ollama

ollama run qwen3

Quel singolo comando scarica un modello open-weight Qwen e avvia una chat locale — nessuna API key, nessun dato che lascia la tua macchina. Sostituisci qwen3 con un'altra famiglia (per esempio un tag Llama, Mistral o DeepSeek) per confrontarli sul tuo compito. Scegliere il modello giusto per un dato lavoro è una competenza a sé: vedi Scegliere un modello.

Scegliere tra open e closed, in pratica

Non scegliere dalla classifica. Scegli in base al vincolo:

  • I dati non possono lasciare la tua rete → open-weight self-hosted è la risposta, punto.
  • Alto volume, sensibile al costo, qualità "abbastanza buona" → open-weight (hosted o self-hosted) di solito vince sul costo.
  • Ti serve il meglio in assoluto sui compiti più difficili → la frontiera closed tende ancora a guidare — usala dove conta e instrada il traffico più facile a modelli open più economici.
  • Vuoi fare fine-tune, quantizzare, bloccare una versione o eseguire offline → solo i pesi aperti ti danno quel controllo.

La mossa più duratura è eseguire una piccola valutazione sui tuoi dati reali tra un candidato open e uno closed. I benchmark descrivono il compito di qualcun altro; la tua eval descrive il tuo.

Verifica te stesso

0/3
  1. Cosa ti garantisce di ottenere 'open weight'?
  2. Devi elaborare dati che legalmente non possono lasciare la tua rete. Quale via si adatta?
  3. Quale nuova responsabilità ti assumi quando self-host un modello open-weight?
Key takeaways
  • I modelli open-weight hanno chiuso gran parte del divario quotidiano grazie a capacità-per-costo, modelli di ragionamento aperti e modelli piccoli davvero usabili
  • 'Open weight' = pesi scaricabili che puoi eseguire e fare fine-tuning — NON necessariamente codice open-source, dati di training aperti o una licenza permissiva; leggi sempre la model card
  • Leggi qualsiasi lineup per archetipo: chat generale, ragionamento, coding e piccolo/efficiente — la maggior parte delle famiglie spedisce l'intera scala di taglie
  • Lo scambio è reale: open compra costo, privacy e controllo, ma la frontiera closed di solito guida ancora sui compiti più difficili e tu erediti safety e infra
  • Due modi per usarli: un'API hosted (spesso OpenAI-compatibile), o self-host via Ollama con un comando — poi valuta sui TUOI dati, non su una classifica

Fonti e approfondimenti