Passa al contenuto principale

Quanto costa davvero l'AI (tra i vari provider)

Intermedio

"Quanto costa l'AI?" non ha una risposta unica — dipende da quale archetipo di prezzo stai acquistando e da quanto effettivamente la usi. Le cifre in dollari cambiano ogni pochi mesi; la struttura del costo si muove appena. Questa pagina insegna la forma duratura: i tre modi in cui l'AI viene tariffata, come stimare un carico di lavoro prima di costruirlo, le leve che riducono il conto e il vero bivio tra affittare un'API e l'auto-hosting.

What you'll learn
  • Distinguere i tre archetipi di costo: API per-token, abbonamento flat e open/self-hosted
  • Stimare il costo di qualsiasi carico di lavoro da token × tariffa × volume — prima di metterlo in produzione
  • Tirare le grandi leve che riducono la spesa senza intaccare la qualità
  • Sapere quando open/self-hosted batte l'API sul costo, e quando vince l'API
  • Sapere quali numeri diventano obsoleti in fretta — e dove verificare la verità di oggi

I tre archetipi di costo

Quasi ogni modo in cui puoi pagare l'AI si riduce a una di tre forme. Impara le forme, non i prezzi.

  • API per-token (basata sull'uso). Chiami un modello ospitato tramite un'API e paghi per token — e input e output sono tariffati separatamente, con l'output quasi sempre il più costoso dei due. Modelli più grandi/intelligenti costano di più per token; modelli più piccoli costano molto meno. La maggior parte dei provider offre anche sconti: una tariffa ridotta per l'input in cache che re-invii, e uno sconto batch fisso per i lavori asincroni non urgenti. È così che paghi quando costruisci un prodotto su Claude, GPT o Gemini. Il costo scala direttamente con l'uso — pochi centesimi su piccola scala, la voce di spesa dominante su larga scala.
  • Abbonamento flat consumer/per postazione. Una tariffa mensile fissa per un'app di chat o un assistente IDE (i piani consumer di Claude / ChatGPT / Gemini, le postazioni in stile Copilot). Non vedi i token; ottieni un'allocazione d'uso e dei rate limit. Prevedibile ed economico per un umano a una tastiera — ma non scala al lavoro programmatico/ad alto volume, e i costi per postazione si sommano in un team.
  • Open / locale (self-hosted). Fai girare un modello a pesi aperti (Llama, Mistral, Qwen, DeepSeek) sul tuo hardware o su una GPU noleggiata. Non c'è alcun prezzo per chiamata — paghi per l'hardware (o il noleggio orario della GPU) + elettricità + operatività, che il modello sia occupato o inattivo. Il costo marginale di una chiamata in più è di fatto prossimo a zero su scala, ma sostieni un costo fisso e un onere operativo. Vedi Esegui i Modelli in Locale con Ollama.
Pro tip
  • La distinzione chiave: API e abbonamenti sono costo MARGINALE (paghi per uso); il self-hosting è per lo più costo FISSO (paghi per mantenere la capacità attiva, usata o meno).
  • Sull'API, la singola sorpresa più grande è che i token di OUTPUT di solito costano diverse volte più dell'input — le risposte prolisse costano soldi veri.
  • Un abbonamento flat è lo strumento giusto per un umano che chatta; l'API per-token è lo strumento giusto per un'app che chiama il modello in un ciclo.

Come stimare il costo di un carico di lavoro

Puoi dimensionare un conto API prima di scrivere una riga di codice in produzione. L'intero modello è una sola formula:

costo ≈ (token di input × tariffa input) + (token di output × tariffa output), per chiamata × numero di chiamate

Le tariffe sono quotate per milione di token, e input e output hanno tariffe diverse — quindi stima le due metà separatamente e sommale. Una regola empirica approssimativa per i token: ~1 token ≈ 4 caratteri di inglese, o ~0,75 parole. Per conteggi esatti, usa l'area Stimatore di Token e leggi Token e Prezzi. L'intera meccanica di dove si nascondono i token è in L'Economia dei Token.

Guided walkthrough1 of 5
  1. Somma l'input: system prompt + strumenti + contesto recuperato + cronologia + il turno dell'utente. Poi stima l'output che richiedi. Conta input e output separatamente — sono tariffati in modo diverso.

Stima a spanne (inserisci le tariffe di oggi)

Per call:
input_tokens  = system + tools + context + history + user_turn
output_tokens = the answer you ask for
call_cost = (input_tokens  * input_rate_per_million  / 1e6)
          + (output_tokens * output_rate_per_million / 1e6)

Per month:
monthly_cost = call_cost * calls_per_day * 30

Then adjust:
- cached repeated input -> use the (lower) cache-read rate for that slice
- offline / non-urgent  -> apply the batch discount to the whole job
Rates change monthly — pull today's numbers from the provider's pricing page.

Le grandi leve per ridurre il costo

La maggior parte dei carichi di lavoro reali porta con sé peso morto. Queste leve, all'incirca in ordine di efficacia, riducono la spesa senza toccare la qualità — tira prima quelle strutturali ed economiche.

  • Dimensiona correttamente il modello. Non pagare la tariffa di un modello di punta per un lavoro che un modello piccolo/economico svolge bene. Classificazione, estrazione, instradamento e formattazione semplice di solito girano benissimo sul tier più piccolo a una frazione del prezzo per-token. Riserva il modello grande per il ragionamento davvero difficile, e considera il routing: il modello economico gestisce la maggioranza facile, escalation solo per i casi difficili. Vedi Scegliere un Modello.
  • Riduci il contesto che invii. Il token più economico è quello che non invii mai. Sfoltisci i system prompt gonfi, comprimi le lunghe cronologie in un riassunto continuo, ed esponi solo gli strumenti che il compito richiede — ognuno è input che ri-paghi a ogni chiamata.
  • RAG invece di stipare un contesto enorme. Incollare un documento di 50 pagine per rispondere a una domanda fa pagare 50 pagine a ogni chiamata. Il recupero (retrieval) preleva solo i pochi passaggi rilevanti — molti meno token di input per la stessa risposta (spesso migliore). Ricorri a una finestra di contesto gigantesca solo quando hai davvero bisogno di avere l'intero corpus sotto gli occhi contemporaneamente.
  • Prompt caching. Se molte chiamate condividono un grande prefisso immutabile (system prompt, catalogo strumenti, documento di riferimento), la cache lo elabora una volta e lo ri-serve a un forte sconto a ogni chiamata successiva. Il singolo cambiamento strutturale a maggiore efficacia per i carichi di lavoro di chat e agenti, perché ripaga a ogni turno.
  • Metti in batch il non urgente. Eval, etichettatura di massa, riassumere un archivio — tutto ciò per cui non ti serve la risposta in pochi secondi — passa attraverso un percorso batch asincrono a uno sconto fisso sulla maggior parte dei provider. Baratta l'immediatezza per un conto sensibilmente più basso.
  • Accorcia l'output. L'output è il lato più costoso. Chiedi JSON o uno schema stretto invece di un paragrafo chiacchierone: meno token di output e nessuna incertezza di parsing a valle.
  • Modelli più piccoli / open per la fetta facile. Per la maggioranza di chiamate ad alto volume e bassa difficoltà, un modello open o piccolo può essere drasticamente più economico per chiamata — a volte quasi gratis se già fai self-hosting. Tieni il modello di frontiera per i casi che ne hanno davvero bisogno.
Pro tip
  • Queste si compongono moltiplicativamente: input in cache × modello dimensionato correttamente × output più conciso × sconto batch si combinano in un grande taglio totale su un compito facile — con la qualità invariata.
  • Tira le leve strutturali (dimensionamento, cache, RAG, batch) prima di micro-ottimizzare la formulazione — spostano il conto molto di più.
  • MISURA sempre il cambiamento rispetto al conto reale, non a una supposizione. Il manuale approfondito è L'Economia dei Token.

Quando open/self-hosted batte l'API — e quando vince l'API

Questa è la decisione che sposta davvero il tuo budget AI. È un incrocio tra costo fisso e costo marginale, e il volume è la variabile che la decide.

  • Open / self-hosted vince ad ALTO volume costante. Una volta che stai eseguendo abbastanza chiamate da tenere una GPU occupata la maggior parte del tempo, il costo marginale prossimo a zero per chiamata batte il pagare per token all'infinito. Ammortizzi il costo fisso di hardware/noleggio su un numero enorme di chiamate, guadagni privacy dei dati e personalizzazione completa — e accetti l'onere operativo (provisioning, scaling, uptime, MLOps) come prezzo d'ingresso.
  • L'API vince a volume BASSO o A PICCHI, o senza infrastruttura. Se il traffico è ridotto, a raffiche o imprevedibile, pagare per token significa che paghi solo per ciò che usi e nulla quando sei inattivo — nessuna GPU tenuta calda alle 3 del mattino. Salti anche tutta l'operatività. Per la maggior parte dei team che mettono in produzione un prodotto, prototipano o hanno traffico che arriva a picchi, l'API è al tempo stesso più economica e molto meno lavoro.
Watch out
  • Il self-hosting è raramente 'gratis'. I pesi del modello possono essere gratuiti, ma GPU, elettricità e le ore-ingegnere per tenerlo in piedi non lo sono — contale onestamente prima di dichiarare un risparmio.
  • Le GPU inattive sono pura perdita: l'infrastruttura a costo fisso batte il prezzo per-token solo quando l'utilizzo è ALTO. Traffico basso o a picchi favorisce l'API ogni volta.
  • Il punto di incrocio si sposta ogni volta che i prezzi delle API calano o l'hardware costa meno — rifai i conti periodicamente, non decidere una volta e dimenticartene.
Vocabolario del costo AI
Premi Invio o Spazio per girare la carta. Usa le frecce sinistra e destra per spostarti tra le carte.Termine mostrato.
1 / 6

Mettiti alla prova

0/3
  1. Su un'API per-token, quale lato del conto è quasi sempre più costoso?
  2. Hai traffico basso, a picchi, imprevedibile e nessuna infrastruttura ML. Cosa è di solito più economico?
  3. Qual è il modo più affidabile per ridurre un conto API su un compito facile e ad alto volume?
Key takeaways
  • Tre archetipi: API per-token (basata sull'uso, input vs output tariffati separatamente), abbonamento flat (prevedibile, non scala all'alto volume) e open/self-hosted (costo fisso, prossimo a zero per chiamata).
  • Stima prima di costruire: (input × tariffa input) + (output × tariffa output), per chiamata × volume — poi applica gli sconti cache e batch.
  • Leve maggiori: dimensiona correttamente il modello, riduci il contesto, RAG al posto di un contesto enorme, prompt caching, batch del non urgente, accorcia l'output.
  • Il self-hosting vince ad ALTO volume costante (ammortizzi il costo fisso); l'API vince a volume BASSO/a picchi o senza infrastruttura (paghi solo per l'uso).
  • Ogni cifra in dollari diventa obsoleta in fretta — verifica sulla pagina di prezzo del provider e su un tracker, ed esegui i tuoi numeri nel Calcolatore di Costi.

Fonti e approfondimenti

Prossimi passi