Pular para o conteúdo principal

Tokens, Contexto e Preços

Iniciante
What you'll learn
  • Contar tokens corretamente com a própria ferramenta da Anthropic (não o tokenizador de outro modelo)
  • Distinguir max_tokens da janela de contexto — e por que a diferença importa
  • Estimar o custo da API a partir dos tokens de entrada + saída, segundo as tarifas de cada modelo
  • Reduzir custo sem perder qualidade: dimensionar corretamente, fazer cache, enxugar, processar em lote

Custo e limites na API são todos medidos em tokens (~¾ de uma palavra). Três coisas para acertar.

1. Conte tokens corretamente

Não chute, e não use o tokenizador de outro modelo (por exemplo, tiktoken) — a contagem de tokens difere entre famílias de modelos. Use o endpoint/auxiliar do SDK de contagem de tokens da Anthropic para medir uma requisição antes de enviá-la.

Pro tip
  • Regra prática de planejamento: ~750 palavras ≈ ~1.000 tokens (um token é mais ou menos ¾ de uma palavra).

2. max_tokens ≠ janela de contexto

Esses dois limites são fáceis de confundir, mas governam coisas diferentes.

LimiteO que ele limitaQuando alterá-lo
max_tokensO tamanho da resposta (apenas saída)Aumente se a saída for cortada
Janela de contextoOrçamento total para entrada + saídaEntradas grandes deixam menos espaço para a saída
Watch out
  • Defina max_tokens conforme a tarefa exige. Baixo demais trunca a resposta. Desnecessariamente alto não custa mais — você paga apenas pelos tokens efetivamente gerados — mas pode deixar as respostas prolixas.

3. Estime o custo

Você é cobrado por tokens de entrada + tokens de saída, segundo as tarifas de cada modelo (Opus > Sonnet > Haiku). Uma estimativa rápida:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Obtenha as tarifas atuais na página oficial de preços — de propósito, não as fixamos aqui.

Reduzindo o custo (sem perder qualidade)

Guided walkthrough1 of 4
  1. Comece com o Sonnet; reserve o Opus para as partes difíceis. Veja Escolhendo um Modelo (/docs/api/choosing-a-model).

Mais estratégia em Trade-offs de Custo e Latência.

Teste seus conhecimentos

0/4
  1. Você está planejando uma requisição e quer saber a contagem de tokens antes de enviá-la. O que deve usar?
  2. Sua resposta fica sendo cortada no meio da frase. Qual configuração você altera?
  3. Como você é cobrado na API?
  4. Qual é a melhor primeira ação para reduzir custo sem perder qualidade?
Key takeaways
  • Tudo é medido em tokens (~¾ de uma palavra); ~750 palavras ≈ ~1.000 tokens.
  • Conte tokens com a própria ferramenta da Anthropic — nunca com o tokenizador de outro modelo.
  • max_tokens limita a resposta; a janela de contexto é o orçamento total de entrada + saída.
  • Cobrança = tokens de entrada + tokens de saída segundo as tarifas de cada modelo (Opus > Sonnet > Haiku).
  • Reduza custo dimensionando o modelo corretamente, fazendo cache de prefixos, enxugando entradas e processando em lote.

A seguir