Tokens, Contexto e Preços
- Contar tokens corretamente com a própria ferramenta da Anthropic (não o tokenizador de outro modelo)
- Distinguir max_tokens da janela de contexto — e por que a diferença importa
- Estimar o custo da API a partir dos tokens de entrada + saída, segundo as tarifas de cada modelo
- Reduzir custo sem perder qualidade: dimensionar corretamente, fazer cache, enxugar, processar em lote
Custo e limites na API são todos medidos em tokens (~¾ de uma palavra). Três coisas para acertar.
1. Conte tokens corretamente
Não chute, e não use o tokenizador de outro modelo (por exemplo, tiktoken) — a contagem de tokens difere entre famílias de modelos. Use o endpoint/auxiliar do SDK de contagem de tokens da Anthropic para medir uma requisição antes de enviá-la.
- Regra prática de planejamento: ~750 palavras ≈ ~1.000 tokens (um token é mais ou menos ¾ de uma palavra).
2. max_tokens ≠ janela de contexto
Esses dois limites são fáceis de confundir, mas governam coisas diferentes.
| Limite | O que ele limita | Quando alterá-lo |
|---|---|---|
max_tokens | O tamanho da resposta (apenas saída) | Aumente se a saída for cortada |
| Janela de contexto | Orçamento total para entrada + saída | Entradas grandes deixam menos espaço para a saída |
- Defina max_tokens conforme a tarefa exige. Baixo demais trunca a resposta. Desnecessariamente alto não custa mais — você paga apenas pelos tokens efetivamente gerados — mas pode deixar as respostas prolixas.
3. Estime o custo
Você é cobrado por tokens de entrada + tokens de saída, segundo as tarifas de cada modelo (Opus > Sonnet > Haiku). Uma estimativa rápida:
cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)
Obtenha as tarifas atuais na página oficial de preços — de propósito, não as fixamos aqui.
Reduzindo o custo (sem perder qualidade)
Guided walkthrough1 of 4
- Comece com o Sonnet; reserve o Opus para as partes difíceis. Veja Escolhendo um Modelo (/docs/api/choosing-a-model).
- Reutilize um prefixo de prompt estável entre chamadas. Veja Cache de Prompt (/docs/api/prompt-caching).
- Envie apenas o contexto que importa. É também aqui que o RAG (/docs/foundations/rag) ajuda.
- Agrupe em lote as tarefas em que a latência não importa.
Mais estratégia em Trade-offs de Custo e Latência.
Teste seus conhecimentos
0/4- Tudo é medido em tokens (~¾ de uma palavra); ~750 palavras ≈ ~1.000 tokens.
- Conte tokens com a própria ferramenta da Anthropic — nunca com o tokenizador de outro modelo.
- max_tokens limita a resposta; a janela de contexto é o orçamento total de entrada + saída.
- Cobrança = tokens de entrada + tokens de saída segundo as tarifas de cada modelo (Opus > Sonnet > Haiku).
- Reduza custo dimensionando o modelo corretamente, fazendo cache de prefixos, enxugando entradas e processando em lote.