Raciocínio Estendido & Esforço
Para problemas difíceis, o Claude pode gastar computação extra pensando antes de responder — melhorando a precisão em raciocínio de múltiplas etapas, código complicado e matemática. Você controla aproximadamente quanto esforço gastar. Esta lição ensina você a ajustar a profundidade à tarefa, ativar o raciocínio via API e orçá-lo sem pagar a mais.
- Explicar o trade-off: menos raciocínio é mais rápido e mais barato, mais raciocínio é melhor em problemas difíceis
- Escolher o nível de esforço certo (Baixo / Médio / Alto) para uma dada carga de trabalho
- Ativar o raciocínio estendido na Messages API e ler de volta os blocos de raciocínio e de texto
- Orçar os tokens de raciocínio corretamente para que budget_tokens fique abaixo de max_tokens
- Aplicar o esforço com sabedoria em agentes e junto ao prompting de cadeia de pensamento (chain-of-thought)
A única ideia por trás do esforço
O raciocínio é um botão giratório, não um interruptor. Imagine os dois extremos:
- Menos raciocínio = mais rápido, mais barato — adequado para tarefas simples e bem especificadas.
- Mais raciocínio = melhor em problemas genuinamente difíceis, com maior latência/custo.
Aqui está a pegadinha que confunde as pessoas: o raciocínio extra não faz nada por uma tarefa que já era fácil. Você só paga a latência e o custo. A habilidade está em gastar profundidade onde isso muda a resposta.
Modelos mais novos expõem isso como um controle de esforço (e adaptam a profundidade do raciocínio automaticamente); neles, você escolhe um nível em vez de um orçamento bruto de tokens. Ajuste o nível à tarefa.
Passo 1 — Escolha sua profundidade
Antes de tocar em qualquer código, pergunte: quão difícil é essa tarefa, de verdade? Mapeie-a a um nível.
| Tarefa | Esforço sugerido |
|---|---|
| Formatação, extração, perguntas e respostas simples | Baixo |
| Codificação do dia a dia, redação, análise | Médio |
| Depuração difícil, algoritmos complicados, provas cuidadosas | Alto |
- Não coloque tudo no máximo por padrão — você paga em latência e custo por um raciocínio que a tarefa não precisa.
- Comece no médio; aumente apenas onde a qualidade exigir.
Experimente você mesmo: antes de continuar a leitura, classifique estas três — (a) "extraia o e-mail deste texto", (b) "refatore esta função", (c) "prove esta desigualdade". Qual nível se encaixa em cada uma? Confira suas respostas na tabela acima.
Passo 2 — Ative-o (API)
Na Messages API, ative o raciocínio com um bloco thinking e um orçamento de tokens. Siga estes passos.
- Passe thinking={"type": "enabled", "budget_tokens": N} em messages.create para ativar o raciocínio estendido.
- O orçamento é retirado do mesmo pool de saída, então budget_tokens deve ser menor que max_tokens.
- A resposta volta como um bloco de raciocínio seguido pelo texto da resposta — itere por message.content e trate cada block.type.
Agora coloque isso em prática. Copie este código, execute-o e observe a resposta chegar em dois blocos — primeiro o raciocínio, depois a resposta.
Ative o raciocínio estendido (Python)
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "Prove that 2^n > n^2 for all n >= 5."}],
)
for block in message.content:
if block.type == "thinking":
print("REASONING:", block.thinking)
elif block.type == "text":
print("ANSWER:", block.text)Um orçamento maior compra mais espaço para raciocinar, não a garantia de que o Claude usará tudo — a profundidade se adapta ao problema. Defina o orçamento como um teto e, depois, reduza se a latência incomodar. Os IDs de modelo vêm da tabela de modelos; o formato exato do parâmetro pode diferir em modelos mais novos, então confirme com a fonte vinculada acima.
Passo 3 — Use-o bem na prática
Três hábitos separam quem ativa o raciocínio de quem o domina:
- O raciocínio estendido combina bem com o prompting de cadeia de pensamento (chain-of-thought) — mas em modelos de raciocínio você muitas vezes não precisa pedir o passo a passo; o raciocínio acontece internamente.
- O raciocínio consome tokens, o que afeta o custo — orce de acordo.
- Para agentes, mais esforço na etapa de planejamento e menos em chamadas de ferramenta rotineiras é uma boa divisão.
- Esforço/raciocínio troca latência e custo por precisão em problemas difíceis — não faz nada por tarefas que já são simples.
- Níveis: Baixo para formatação/extração/perguntas e respostas simples, Médio para codificação/redação/análise do dia a dia, Alto para depuração difícil/algoritmos/provas.
- Na Messages API, budget_tokens vem do mesmo pool de saída, então deve ser menor que max_tokens; a resposta é um bloco de raciocínio seguido de um bloco de texto.
- Trate o orçamento como um teto, não como uma meta — o Claude usa apenas o quanto o problema precisa.
- Em agentes, gaste esforço no planejamento e economize em chamadas de ferramenta rotineiras.
Fixe o conteúdo
Recordação rápida antes de você sair — vire cada cartão e responda em voz alta.