Pensamiento extendido y esfuerzo
Para problemas difíciles, Claude puede dedicar cómputo adicional a pensar antes de responder, lo que mejora la precisión en razonamientos de varios pasos, código complicado y matemáticas. Tú controlas aproximadamente cuánto esfuerzo dedicar. Esta lección te enseña a ajustar la profundidad a la tarea, activar el pensamiento mediante la API y presupuestarlo sin pagar de más.
- Explicar el equilibrio: pensar menos es más rápido y barato, pensar más es mejor en problemas difíciles
- Elegir el nivel de esfuerzo adecuado (Bajo / Medio / Alto) para una carga de trabajo dada
- Activar el pensamiento extendido en la API de Mensajes y leer los bloques de pensamiento y de texto
- Presupuestar correctamente los tokens de pensamiento para que budget_tokens se mantenga por debajo de max_tokens
- Aplicar el esfuerzo con criterio en agentes y junto con el prompting de cadena de pensamiento
La idea central del esfuerzo
El pensamiento es un dial, no un interruptor. Imagina los dos extremos:
- Pensar menos = más rápido, más barato — adecuado para tareas simples y bien especificadas.
- Pensar más = mejor en problemas genuinamente difíciles, a costa de mayor latencia/coste.
Aquí está la trampa que hace tropezar a la gente: el pensamiento adicional no aporta nada a una tarea que ya era fácil. Solo pagas la latencia y el coste. La habilidad está en gastar profundidad donde cambia la respuesta.
Los modelos más nuevos exponen esto como un control de esfuerzo (y adaptan la profundidad del pensamiento automáticamente); en ellos, eliges un nivel en lugar de un presupuesto de tokens en bruto. Ajusta el nivel a la tarea.
Paso 1 — Elige tu profundidad
Antes de tocar código, pregúntate: ¿qué tan difícil es esta tarea, realmente? Asígnala a un nivel.
| Tarea | Esfuerzo sugerido |
|---|---|
| Formateo, extracción, preguntas y respuestas simples | Bajo |
| Programación cotidiana, redacción, análisis | Medio |
| Depuración difícil, algoritmos complicados, demostraciones cuidadosas | Alto |
- No pongas todo en máximo por defecto: pagas en latencia y coste por un pensamiento que la tarea no necesita.
- Empieza en medio; súbelo solo donde la calidad lo exija.
Pruébalo tú mismo: antes de seguir leyendo, clasifica estos tres — (a) "extrae el correo de este texto", (b) "refactoriza esta función", (c) "demuestra esta desigualdad". ¿Qué nivel le corresponde a cada uno? Comprueba tus respuestas con la tabla de arriba.
Paso 2 — Actívalo (API)
En la API de Mensajes, activa el pensamiento con un bloque thinking y un presupuesto de tokens. Sigue estos pasos.
- Pasa thinking={"type": "enabled", "budget_tokens": N} en messages.create para activar el razonamiento extendido.
- El presupuesto se extrae del mismo conjunto de salida, así que budget_tokens debe ser menor que max_tokens.
- La respuesta llega como un bloque de pensamiento seguido del texto de la respuesta: itera sobre message.content y maneja cada block.type.
Ahora conéctalo todo. Copia esto, ejecútalo y observa cómo la respuesta llega en dos bloques — primero el razonamiento, luego la respuesta.
Activar el pensamiento extendido (Python)
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "Prove that 2^n > n^2 for all n >= 5."}],
)
for block in message.content:
if block.type == "thinking":
print("REASONING:", block.thinking)
elif block.type == "text":
print("ANSWER:", block.text)Un presupuesto mayor compra más margen para razonar, no la garantía de que Claude lo use por completo — la profundidad se adapta al problema. Establece el presupuesto como un techo y luego redúcelo si la latencia molesta. Los IDs de modelo provienen de la tabla de modelos; la forma exacta del parámetro puede diferir en los modelos más nuevos, así que confírmala con la fuente enlazada arriba.
Paso 3 — Úsalo bien en la práctica
Tres hábitos separan a quienes activan el pensamiento de quienes lo dominan:
- El pensamiento extendido se combina bien con el prompting de cadena de pensamiento — pero en los modelos de razonamiento a menudo no necesitas pedir el paso a paso; el pensamiento ocurre internamente.
- El pensamiento consume tokens, lo que afecta al coste — presupuesta en consecuencia.
- Para agentes, más esfuerzo en el paso de planificación y menos en las llamadas a herramientas rutinarias es un buen reparto.
- El esfuerzo/pensamiento intercambia latencia y coste por precisión en problemas difíciles — no aporta nada en tareas que ya son simples.
- Niveles: Bajo para formateo/extracción/preguntas y respuestas simples, Medio para programación cotidiana/redacción/análisis, Alto para depuración difícil/algoritmos/demostraciones.
- En la API de Mensajes, budget_tokens proviene del mismo conjunto de salida, así que debe ser menor que max_tokens; la respuesta es un bloque de pensamiento y luego un bloque de texto.
- Trata el presupuesto como un techo, no como un objetivo — Claude usa solo lo que el problema necesita.
- En los agentes, dedica esfuerzo a la planificación y consérvalo en las llamadas a herramientas rutinarias.
Fíjalo
Repaso rápido antes de irte — voltea cada tarjeta y responde en voz alta.