Saltar al contenido principal

Tokens, contexto y precios

Principiante
What you'll learn
  • Cuenta los tokens correctamente con las herramientas propias de Anthropic (no con el tokenizador de otro modelo)
  • Distingue max_tokens de la ventana de contexto, y por qué importa la diferencia
  • Estima el coste de la API a partir de los tokens de entrada + salida según las tarifas de cada modelo
  • Reduce el coste sin perder calidad: ajusta el tamaño, cachea, recorta, procesa por lotes

El coste y los límites de la API se miden todos en tokens (~¾ de una palabra). Tres cosas que conviene acertar.

1. Cuenta los tokens correctamente

No adivines, y no uses el tokenizador de otro modelo (p. ej., tiktoken): los recuentos de tokens difieren según la familia de modelos. Usa el endpoint de conteo de tokens de Anthropic o el ayudante del SDK para medir una solicitud antes de enviarla.

Pro tip
  • Regla aproximada de planificación: ~750 palabras ≈ ~1.000 tokens (un token es aproximadamente ¾ de una palabra).

2. max_tokens ≠ ventana de contexto

Estos dos límites se confunden con facilidad, pero gobiernan cosas distintas.

LímiteQué limitaCuándo cambiarlo
max_tokensLa longitud de la respuesta (solo la salida)Súbelo si la salida se corta
Ventana de contextoPresupuesto total para entrada + salidaLas entradas grandes dejan menos espacio para la salida
Watch out
  • Ajusta max_tokens a lo que necesite la tarea. Demasiado bajo trunca la respuesta. Innecesariamente alto no cuesta más (solo pagas por los tokens realmente generados), pero puede dejar que las respuestas se extiendan sin rumbo.

3. Estima el coste

Se te factura por tokens de entrada + tokens de salida, a tarifas por modelo (Opus > Sonnet > Haiku). Una estimación rápida:

cost ≈ (input_tokens × input_rate) + (output_tokens × output_rate)

Obtén las tarifas actuales en la página oficial de precios: aquí no las codificamos a propósito.

Reducir el coste (sin perder calidad)

Guided walkthrough1 of 4
  1. Empieza con Sonnet; reserva Opus para las partes difíciles. Consulta Elegir un modelo (/docs/api/choosing-a-model).

Más estrategia en Compromisos de coste y latencia.

Compruébate

0/4
  1. Estás planificando una solicitud y quieres conocer su recuento de tokens antes de enviarla. ¿Qué deberías usar?
  2. Tu respuesta se sigue cortando a mitad de frase. ¿Qué ajuste cambias?
  3. ¿Cómo se te factura en la API?
  4. ¿Cuál es el mejor primer paso para reducir el coste sin perder calidad?
Key takeaways
  • Todo se mide en tokens (~¾ de una palabra); ~750 palabras ≈ ~1.000 tokens.
  • Cuenta los tokens con las herramientas propias de Anthropic, nunca con el tokenizador de otro modelo.
  • max_tokens limita la respuesta; la ventana de contexto es el presupuesto total de entrada + salida.
  • Facturación = tokens de entrada + tokens de salida a tarifas por modelo (Opus > Sonnet > Haiku).
  • Reduce el coste ajustando el tamaño del modelo, cacheando prefijos, recortando entradas y procesando por lotes.

Siguiente