Saltar al contenido principal

Tokens, contexto y memoria

Principiante

Tres ideas resuelven muchos momentos de "¿por qué hizo eso?": los tokens, la ventana de contexto y la memoria. Si entiendes esto, dejarás de sorprenderte por la deriva, los olvidos y las facturas inesperadas.

What you'll learn
  • Leer el texto como lo hace un modelo: en tokens, no en palabras ni caracteres
  • Imaginar la ventana de contexto como un escritorio finito y predecir cuándo se caen las cosas de él
  • Reconocer el 'deterioro de contexto': por qué los modelos pueden perder la parte central de una entrada larga
  • Conocer las cuatro fuentes reales de 'memoria' y cómo proporcionarla a propósito

Tokens: la unidad en la que piensan los modelos

Los modelos no leen caracteres ni palabras: leen tokens, fragmentos de texto de aproximadamente ¾ de una palabra en inglés. "Unbelievable" podría ser de 3 a 4 tokens; las palabras comunes son uno cada una; un espacio, una coma o un fragmento de código también cuestan tokens. Tanto tu entrada como la salida del modelo se contabilizan, y los tokens son exactamente la unidad con la que se miden los precios y límites.

No necesitas contarlos a mano, pero ayuda tener una idea aproximada: ~750 palabras ≈ ~1.000 tokens. Escribe algo y observa:

11palabras
68caracteres
~1517tokens estimados

Solo una idea aproximada (~caracteres ÷ 4, o palabras × 1,33). El recuento de tokens depende del modelo: nunca uses el tokenizador de otro modelo. Para cifras exactas, usa el endpoint de recuento de tokens de Anthropic.

:::tip Por qué cambia la proporción El inglés común ronda los ¾ de palabra por token. El código, JSON, los alfabetos no latinos, las URL largas y las palabras raras se dividen en más tokens, así que un archivo de 500 líneas o un párrafo en chino cuestan más de lo que sugiere su recuento de palabras. Cuando una factura o un límite te sorprenden, esta suele ser la razón. :::

La ventana de contexto: memoria de trabajo

La ventana de contexto es el número máximo de tokens que el modelo puede considerar a la vez: tu prompt de sistema, toda la conversación hasta ahora, los archivos adjuntos y la respuesta que está escribiendo, todo junto. Imagínalo como el escritorio del modelo: grande, pero finito. Los tamaños de la ventana varían según el modelo y siguen creciendo; consulta Modelos y precios para ver las cifras actuales en lugar de memorizar una.

Todo lo que el modelo "sabe" en el momento vive en ese escritorio:

Cuando una conversación crece más allá de la ventana, el contenido más antiguo se cae. Por eso un chat muy largo puede parecer "olvidar" cómo empezó, o desviarse de tu instrucción original.

Deterioro de contexto: no es solo lleno vs vacío

Un problema más sutil: incluso cuando todo todavía cabe, los modelos tienden a usar el principio y el final de una entrada larga de forma más fiable que la parte central. Entierra la única frase que importa en el centro de un pegado de 50 páginas y puede que reciba poco peso, un modo de fallo a menudo llamado "perdido en el medio".

Guided walkthrough1 of 4
  1. Pon la instrucción o pregunta real primero, antes de pegar un documento largo, no enterrada después de él.

Aquí está la misma petición, estructurada para que la instrucción quede en las posiciones fuertes:

Instrucción al principio, reiterada al final

Tarea: Encuentra cada lugar donde este contrato limite nuestra responsabilidad y cita la cláusula exacta.

[... pega aquí el contrato completo de 40 páginas ...]

Recordatorio de la tarea: enumera solo las cláusulas de límite de responsabilidad, con citas exactas y números de sección. Ignora todo lo demás.

:::tip En Claude Code Las sesiones largas de agente chocan con el mismo techo. Claude Code lo gestiona deliberadamente: compactando el historial y dejándote dirigir qué permanece a la vista. Consulta Gestión del contexto e Ingeniería de contexto. :::

Memoria: no hay ninguna, a menos que la proporciones

Por defecto, cada conversación es una hoja en blanco. El modelo no recuerda tu último chat. Todo lo que parece memoria es una de cuatro cosas:

FuenteQué esLo controlas mediante
Historial reenviadoLas apps de chat reenvían la conversación en cada turno, hasta que la ventana se llenaIniciar chats nuevos; mantener los hilos enfocados
Funciones de memoriaAlgunas superficies de Claude transfieren datos entre chatsAjustes de Memoria entre chats
Archivos que proporcionasContexto persistente que adjuntas a propósitoProyectos, CLAUDE.md
Tu propio códigoLa API es sin estado: tú reenvías los mensajes previosPrimera llamada a la API

La idea central: si quieres que el modelo recuerde algo, tienes que seguir poniéndolo sobre el escritorio.

Por qué esto importa

Casi todos los problemas de "ignoró mi instrucción anterior" o "perdió el hilo" se remontan a una de tres cosas: la ventana se llenó, una nueva sesión empezó en frío, o el detalle clave quedó en el medio muerto de un pegado largo. Sabiendo esto, estructurarás tus prompts y sesiones para mantener lo importante a la vista.

Comprueba lo aprendido

Check yourself

0/3
  1. Aproximadamente, ¿cuántos tokens son 750 palabras de inglés común?
  2. Un chat largo empieza a 'olvidar' cómo comenzó. La causa más probable es:
  3. Debes pegar un documento enorme más una instrucción clave. ¿La mejor ubicación?

Términos clave

Fija el vocabulario
Pulsa Intro o Espacio para girar la tarjeta. Usa las flechas izquierda y derecha para moverte entre las tarjetas.Término mostrado.
1 / 4

:::note Conclusiones

  • Los tokens son la unidad tanto del pensamiento como de la facturación: ~1.000 por cada 750 palabras en inglés, más para código y otros alfabetos.
  • La ventana de contexto es un escritorio finito; los chats largos olvidan porque el contenido antiguo se cae de él.
  • Incluso dentro de la ventana, empieza con tu instrucción y reitérala al final: el medio se infrautiliza.
  • No hay memoria por defecto. Proporciónala deliberadamente con archivos, Proyectos, CLAUDE.md o reenviando el historial. :::

Siguiente