Passa al contenuto principale

Token, contesto e prezzi

Principiante
What you'll learn
  • Contare correttamente i token con gli strumenti di Anthropic (non con il tokenizer di un altro modello)
  • Distinguere max_tokens dalla finestra di contesto — e perché la differenza conta
  • Stimare il costo dell'API a partire dai token di input + output alle tariffe per modello
  • Tagliare i costi senza perdere qualità: dimensiona bene, usa la cache, sfoltisci, raggruppa in batch

Costo e limiti sull'API sono tutti misurati in token (~¾ di una parola). Tre cose da fare bene.

1. Conta correttamente i token

Non tirare a indovinare e non usare il tokenizer di un altro modello (ad esempio tiktoken) — il conteggio dei token differisce per famiglia di modelli. Usa l'endpoint/l'helper SDK di token counting di Anthropic per misurare una richiesta prima di inviarla.

Pro tip
  • Regola approssimativa di pianificazione: ~750 parole ≈ ~1.000 token (un token è all'incirca ¾ di una parola).

2. max_tokens ≠ finestra di contesto

Questi due limiti si confondono facilmente, ma regolano cose diverse.

LimiteCosa limitaQuando cambiarlo
max_tokensLa lunghezza della risposta (solo output)Alzalo se l'output viene troncato
Finestra di contestoBudget totale per input + outputInput grandi lasciano meno spazio per l'output
Watch out
  • Imposta max_tokens su quanto serve al task. Troppo basso tronca la risposta. Inutilmente alto non costa di più — paghi solo i token effettivamente generati — ma può lasciare che le risposte divaghino.

3. Stima il costo

Ti viene addebitato per token di input + token di output, a tariffe per modello (Opus > Sonnet > Haiku). Una stima veloce:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Recupera le tariffe attuali dalla pagina ufficiale dei prezzi — qui non le codifichiamo di proposito.

Ridurre il costo (senza perdere qualità)

Guided walkthrough1 of 4
  1. Parti da Sonnet; riserva Opus per le parti difficili. Vedi Scegliere un modello (/docs/api/choosing-a-model).

Più strategia in Compromessi tra costo e latenza.

Mettiti alla prova

0/4
  1. Stai pianificando una richiesta e vuoi conoscere il suo conteggio di token prima di inviarla. Cosa dovresti usare?
  2. La tua risposta continua a essere troncata a metà frase. Quale impostazione cambi?
  3. Come ti viene addebitato sull'API?
  4. Qual è la prima mossa migliore per tagliare i costi senza perdere qualità?
Key takeaways
  • Tutto si misura in token (~¾ di una parola); ~750 parole ≈ ~1.000 token.
  • Conta i token con gli strumenti di Anthropic — mai con il tokenizer di un altro modello.
  • max_tokens limita la risposta; la finestra di contesto è il budget totale di input + output.
  • Fatturazione = token di input + token di output a tariffe per modello (Opus > Sonnet > Haiku).
  • Taglia i costi dimensionando bene il modello, mettendo in cache i prefissi, sfoltendo gli input e raggruppando in batch.

Avanti