Pular para o conteúdo principal

Raciocínio Estendido & Esforço

Intermediário

Para problemas difíceis, o Claude pode gastar computação extra pensando antes de responder — melhorando a precisão em raciocínio de múltiplas etapas, código complicado e matemática. Você controla aproximadamente quanto esforço gastar. Esta lição ensina você a ajustar a profundidade à tarefa, ativar o raciocínio via API e orçá-lo sem pagar a mais.

What you'll learn
  • Explicar o trade-off: menos raciocínio é mais rápido e mais barato, mais raciocínio é melhor em problemas difíceis
  • Escolher o nível de esforço certo (Baixo / Médio / Alto) para uma dada carga de trabalho
  • Ativar o raciocínio estendido na Messages API e ler de volta os blocos de raciocínio e de texto
  • Orçar os tokens de raciocínio corretamente para que budget_tokens fique abaixo de max_tokens
  • Aplicar o esforço com sabedoria em agentes e junto ao prompting de cadeia de pensamento (chain-of-thought)

A única ideia por trás do esforço

O raciocínio é um botão giratório, não um interruptor. Imagine os dois extremos:

  • Menos raciocínio = mais rápido, mais barato — adequado para tarefas simples e bem especificadas.
  • Mais raciocínio = melhor em problemas genuinamente difíceis, com maior latência/custo.

Aqui está a pegadinha que confunde as pessoas: o raciocínio extra não faz nada por uma tarefa que já era fácil. Você só paga a latência e o custo. A habilidade está em gastar profundidade onde isso muda a resposta.

Modelos mais novos expõem isso como um controle de esforço (e adaptam a profundidade do raciocínio automaticamente); neles, você escolhe um nível em vez de um orçamento bruto de tokens. Ajuste o nível à tarefa.

Passo 1 — Escolha sua profundidade

Antes de tocar em qualquer código, pergunte: quão difícil é essa tarefa, de verdade? Mapeie-a a um nível.

TarefaEsforço sugerido
Formatação, extração, perguntas e respostas simplesBaixo
Codificação do dia a dia, redação, análiseMédio
Depuração difícil, algoritmos complicados, provas cuidadosasAlto
Pro tip
  • Não coloque tudo no máximo por padrão — você paga em latência e custo por um raciocínio que a tarefa não precisa.
  • Comece no médio; aumente apenas onde a qualidade exigir.

Experimente você mesmo: antes de continuar a leitura, classifique estas três — (a) "extraia o e-mail deste texto", (b) "refatore esta função", (c) "prove esta desigualdade". Qual nível se encaixa em cada uma? Confira suas respostas na tabela acima.

Passo 2 — Ative-o (API)

Na Messages API, ative o raciocínio com um bloco thinking e um orçamento de tokens. Siga estes passos.

Guided walkthrough1 of 3
  1. Passe thinking={"type": "enabled", "budget_tokens": N} em messages.create para ativar o raciocínio estendido.

Agora coloque isso em prática. Copie este código, execute-o e observe a resposta chegar em dois blocos — primeiro o raciocínio, depois a resposta.

Ative o raciocínio estendido (Python)

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
  model="claude-sonnet-5",
  max_tokens=16000,
  thinking={"type": "enabled", "budget_tokens": 10000},
  messages=[{"role": "user", "content": "Prove that 2^n > n^2 for all n >= 5."}],
)

for block in message.content:
  if block.type == "thinking":
      print("REASONING:", block.thinking)
  elif block.type == "text":
      print("ANSWER:", block.text)

Um orçamento maior compra mais espaço para raciocinar, não a garantia de que o Claude usará tudo — a profundidade se adapta ao problema. Defina o orçamento como um teto e, depois, reduza se a latência incomodar. Os IDs de modelo vêm da tabela de modelos; o formato exato do parâmetro pode diferir em modelos mais novos, então confirme com a fonte vinculada acima.

Passo 3 — Use-o bem na prática

Três hábitos separam quem ativa o raciocínio de quem o domina:

  • O raciocínio estendido combina bem com o prompting de cadeia de pensamento (chain-of-thought) — mas em modelos de raciocínio você muitas vezes não precisa pedir o passo a passo; o raciocínio acontece internamente.
  • O raciocínio consome tokens, o que afeta o custo — orce de acordo.
  • Para agentes, mais esforço na etapa de planejamento e menos em chamadas de ferramenta rotineiras é uma boa divisão.
Key takeaways
  • Esforço/raciocínio troca latência e custo por precisão em problemas difíceis — não faz nada por tarefas que já são simples.
  • Níveis: Baixo para formatação/extração/perguntas e respostas simples, Médio para codificação/redação/análise do dia a dia, Alto para depuração difícil/algoritmos/provas.
  • Na Messages API, budget_tokens vem do mesmo pool de saída, então deve ser menor que max_tokens; a resposta é um bloco de raciocínio seguido de um bloco de texto.
  • Trate o orçamento como um teto, não como uma meta — o Claude usa apenas o quanto o problema precisa.
  • Em agentes, gaste esforço no planejamento e economize em chamadas de ferramenta rotineiras.

Fixe o conteúdo

Recordação rápida antes de você sair — vire cada cartão e responda em voz alta.

Pressione Enter ou Espaço para virar o cartão. Use as setas esquerda e direita para navegar entre os cartões.Termo exibido.
1 / 5

Verifique você mesmo

0/5
  1. Qual é o trade-off central de gastar mais esforço de raciocínio?
  2. Qual nível de esforço se encaixa em codificação, redação e análise do dia a dia?
  3. Na Messages API, o que deve ser verdadeiro sobre budget_tokens?
  4. Como a resposta volta quando o raciocínio estendido está ativado?
  5. Para agentes, como você deve dividir o esforço?

A seguir