Token, contesto e prezzi
- Contare correttamente i token con gli strumenti di Anthropic (non con il tokenizer di un altro modello)
- Distinguere max_tokens dalla finestra di contesto — e perché la differenza conta
- Stimare il costo dell'API a partire dai token di input + output alle tariffe per modello
- Tagliare i costi senza perdere qualità: dimensiona bene, usa la cache, sfoltisci, raggruppa in batch
Costo e limiti sull'API sono tutti misurati in token (~¾ di una parola). Tre cose da fare bene.
1. Conta correttamente i token
Non tirare a indovinare e non usare il tokenizer di un altro modello (ad esempio tiktoken) — il conteggio dei token differisce per famiglia di modelli. Usa l'endpoint/l'helper SDK di token counting di Anthropic per misurare una richiesta prima di inviarla.
- Regola approssimativa di pianificazione: ~750 parole ≈ ~1.000 token (un token è all'incirca ¾ di una parola).
2. max_tokens ≠ finestra di contesto
Questi due limiti si confondono facilmente, ma regolano cose diverse.
| Limite | Cosa limita | Quando cambiarlo |
|---|---|---|
max_tokens | La lunghezza della risposta (solo output) | Alzalo se l'output viene troncato |
| Finestra di contesto | Budget totale per input + output | Input grandi lasciano meno spazio per l'output |
- Imposta max_tokens su quanto serve al task. Troppo basso tronca la risposta. Inutilmente alto non costa di più — paghi solo i token effettivamente generati — ma può lasciare che le risposte divaghino.
3. Stima il costo
Ti viene addebitato per token di input + token di output, a tariffe per modello (Opus > Sonnet > Haiku). Una stima veloce:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
Recupera le tariffe attuali dalla pagina ufficiale dei prezzi — qui non le codifichiamo di proposito.
Ridurre il costo (senza perdere qualità)
Guided walkthrough1 of 4
- Parti da Sonnet; riserva Opus per le parti difficili. Vedi Scegliere un modello (/docs/api/choosing-a-model).
- Riutilizza un prefisso di prompt stabile tra le chiamate. Vedi Prompt Caching (/docs/api/prompt-caching).
- Invia solo il contesto che conta. È anche qui che RAG (/docs/foundations/rag) aiuta.
- Raggruppa in batch i job dove la latenza non conta.
Più strategia in Compromessi tra costo e latenza.
Mettiti alla prova
0/4- Tutto si misura in token (~¾ di una parola); ~750 parole ≈ ~1.000 token.
- Conta i token con gli strumenti di Anthropic — mai con il tokenizer di un altro modello.
- max_tokens limita la risposta; la finestra di contesto è il budget totale di input + output.
- Fatturazione = token di input + token di output a tariffe per modello (Opus > Sonnet > Haiku).
- Taglia i costi dimensionando bene il modello, mettendo in cache i prefissi, sfoltendo gli input e raggruppando in batch.