Saltar al contenido principal

Pensamiento extendido y esfuerzo

Intermedio

Para problemas difíciles, Claude puede dedicar cómputo adicional a pensar antes de responder, lo que mejora la precisión en razonamientos de varios pasos, código complicado y matemáticas. Tú controlas aproximadamente cuánto esfuerzo dedicar. Esta lección te enseña a ajustar la profundidad a la tarea, activar el pensamiento mediante la API y presupuestarlo sin pagar de más.

What you'll learn
  • Explicar el equilibrio: pensar menos es más rápido y barato, pensar más es mejor en problemas difíciles
  • Elegir el nivel de esfuerzo adecuado (Bajo / Medio / Alto) para una carga de trabajo dada
  • Activar el pensamiento extendido en la API de Mensajes y leer los bloques de pensamiento y de texto
  • Presupuestar correctamente los tokens de pensamiento para que budget_tokens se mantenga por debajo de max_tokens
  • Aplicar el esfuerzo con criterio en agentes y junto con el prompting de cadena de pensamiento

La idea central del esfuerzo

El pensamiento es un dial, no un interruptor. Imagina los dos extremos:

  • Pensar menos = más rápido, más barato — adecuado para tareas simples y bien especificadas.
  • Pensar más = mejor en problemas genuinamente difíciles, a costa de mayor latencia/coste.

Aquí está la trampa que hace tropezar a la gente: el pensamiento adicional no aporta nada a una tarea que ya era fácil. Solo pagas la latencia y el coste. La habilidad está en gastar profundidad donde cambia la respuesta.

Los modelos más nuevos exponen esto como un control de esfuerzo (y adaptan la profundidad del pensamiento automáticamente); en ellos, eliges un nivel en lugar de un presupuesto de tokens en bruto. Ajusta el nivel a la tarea.

Paso 1 — Elige tu profundidad

Antes de tocar código, pregúntate: ¿qué tan difícil es esta tarea, realmente? Asígnala a un nivel.

TareaEsfuerzo sugerido
Formateo, extracción, preguntas y respuestas simplesBajo
Programación cotidiana, redacción, análisisMedio
Depuración difícil, algoritmos complicados, demostraciones cuidadosasAlto
Pro tip
  • No pongas todo en máximo por defecto: pagas en latencia y coste por un pensamiento que la tarea no necesita.
  • Empieza en medio; súbelo solo donde la calidad lo exija.

Pruébalo tú mismo: antes de seguir leyendo, clasifica estos tres — (a) "extrae el correo de este texto", (b) "refactoriza esta función", (c) "demuestra esta desigualdad". ¿Qué nivel le corresponde a cada uno? Comprueba tus respuestas con la tabla de arriba.

Paso 2 — Actívalo (API)

En la API de Mensajes, activa el pensamiento con un bloque thinking y un presupuesto de tokens. Sigue estos pasos.

Guided walkthrough1 of 3
  1. Pasa thinking={"type": "enabled", "budget_tokens": N} en messages.create para activar el razonamiento extendido.

Ahora conéctalo todo. Copia esto, ejecútalo y observa cómo la respuesta llega en dos bloques — primero el razonamiento, luego la respuesta.

Activar el pensamiento extendido (Python)

import anthropic

client = anthropic.Anthropic()

message = client.messages.create(
  model="claude-sonnet-5",
  max_tokens=16000,
  thinking={"type": "enabled", "budget_tokens": 10000},
  messages=[{"role": "user", "content": "Prove that 2^n > n^2 for all n >= 5."}],
)

for block in message.content:
  if block.type == "thinking":
      print("REASONING:", block.thinking)
  elif block.type == "text":
      print("ANSWER:", block.text)

Un presupuesto mayor compra más margen para razonar, no la garantía de que Claude lo use por completo — la profundidad se adapta al problema. Establece el presupuesto como un techo y luego redúcelo si la latencia molesta. Los IDs de modelo provienen de la tabla de modelos; la forma exacta del parámetro puede diferir en los modelos más nuevos, así que confírmala con la fuente enlazada arriba.

Paso 3 — Úsalo bien en la práctica

Tres hábitos separan a quienes activan el pensamiento de quienes lo dominan:

  • El pensamiento extendido se combina bien con el prompting de cadena de pensamiento — pero en los modelos de razonamiento a menudo no necesitas pedir el paso a paso; el pensamiento ocurre internamente.
  • El pensamiento consume tokens, lo que afecta al coste — presupuesta en consecuencia.
  • Para agentes, más esfuerzo en el paso de planificación y menos en las llamadas a herramientas rutinarias es un buen reparto.
Key takeaways
  • El esfuerzo/pensamiento intercambia latencia y coste por precisión en problemas difíciles — no aporta nada en tareas que ya son simples.
  • Niveles: Bajo para formateo/extracción/preguntas y respuestas simples, Medio para programación cotidiana/redacción/análisis, Alto para depuración difícil/algoritmos/demostraciones.
  • En la API de Mensajes, budget_tokens proviene del mismo conjunto de salida, así que debe ser menor que max_tokens; la respuesta es un bloque de pensamiento y luego un bloque de texto.
  • Trata el presupuesto como un techo, no como un objetivo — Claude usa solo lo que el problema necesita.
  • En los agentes, dedica esfuerzo a la planificación y consérvalo en las llamadas a herramientas rutinarias.

Fíjalo

Repaso rápido antes de irte — voltea cada tarjeta y responde en voz alta.

Pulsa Intro o Espacio para girar la tarjeta. Usa las flechas izquierda y derecha para moverte entre las tarjetas.Término mostrado.
1 / 5

Comprueba tus conocimientos

0/5
  1. ¿Cuál es el equilibrio fundamental de dedicar más esfuerzo de pensamiento?
  2. ¿Qué nivel de esfuerzo encaja con la programación cotidiana, la redacción y el análisis?
  3. En la API de Mensajes, ¿qué debe cumplirse respecto a budget_tokens?
  4. ¿Cómo llega la respuesta cuando el pensamiento extendido está activado?
  5. Para agentes, ¿cómo deberías repartir el esfuerzo?

Siguiente