Ingeniería de Contexto
La ingeniería de prompts trata sobre las palabras que eliges. La ingeniería de contexto trata sobre el espacio de trabajo que le entregas al modelo: qué hay en él, en qué orden está y qué dejaste fuera deliberadamente.
La distinción importa porque una ventana de contexto no es un bloc de notas. Es un recurso limitado, caro y atencional. Cómo la llenas cambia en qué se enfoca el modelo, cuánto te cuesta y si sigue siendo útil a medida que las sesiones crecen.
- Distinguir la ingeniería de contexto de la ingeniería de prompts, y saber por qué el campo evolucionó
- Tratar la ventana de contexto como un presupuesto de atención, no como un cajón de almacenamiento
- Detectar el deterioro del contexto y el efecto 'perdido en el medio' antes de que arruinen una sesión larga
- Colocar las instrucciones donde la atención realmente aterriza: arriba, al final, nunca enterradas en el medio
- Aplicar las tres tácticas de cabecera: compactación, toma de notas y recuperación justo a tiempo
El presupuesto de contexto
Cada modelo tiene un tamaño máximo de contexto: un techo rígido medido en tokens. Piénsalo como un presupuesto. Lo gastas en:
- Tu prompt de sistema y tus instrucciones permanentes
- Documentos recuperados, fragmentos de código, definiciones de herramientas
- El historial de conversación
- La salida del modelo (que también cuenta contra la ventana en sesiones de múltiples turnos)
Cuando te quedas sin presupuesto, algo tiene que ceder. O se descarta contenido antiguo, o la sesión choca contra un muro.
La mayoría de las guías para principiantes tratan la ventana de contexto como "más es mejor". La ingeniería de contexto la trata como un recurso que se debe asignar con cuidado: gástalo en lo que el modelo realmente necesita para este turno, no en todo lo que podría ser relevante. Anthropic plantea toda la disciplina como una búsqueda del "conjunto más pequeño posible de tokens de alta señal": cada token que añades compite por un presupuesto de atención finito, una consecuencia directa de cómo un transformer relaciona cada token con todos los demás.
Deterioro del contexto y "perdido en el medio"
Existe un fenómeno bien documentado en los LLM de contexto largo: los modelos prestan una atención desproporcionada al contenido cercano al principio y al final de su contexto, y su recuperación del contenido enterrado en el medio se degrada. Los investigadores que estudiaron este efecto lo llamaron "perdido en el medio" (lost in the middle).
La consecuencia práctica: si rellenas un contexto de 100.000 tokens con documentos y entierras la instrucción más crítica en la posición 60.000, el modelo puede efectivamente ignorarla, no porque sea incapaz de leer tan lejos, sino porque la atención no se distribuye de forma uniforme a lo largo de la ventana.
El "deterioro del contexto" (context rot) es el patrón más amplio: a medida que una sesión crece, la calidad de las respuestas tiende a derivar. Las instrucciones iniciales se diluyen. El ir y venir repetido desplaza la tarea original. El modelo empieza a matizar en exceso, a repetirse o a perder el hilo de lo que realmente le pediste.
Estos no son errores que puedas arreglar por completo con un mejor prompt. Son propiedades estructurales de cómo funciona la atención a gran escala. La respuesta de ingeniería es mantener el contexto más pequeño y más afilado, no llenarlo y esperar.
El orden importa
Dónde colocas el contenido es tan importante como qué incluyes. Buenas prácticas establecidas:
| Posición | Qué poner ahí |
|---|---|
| Muy arriba (prompt de sistema) | Instrucciones estables y duraderas. Persona, reglas, requisitos de formato. |
| Después del prompt de sistema | La tarea actual, en términos claros. |
| Justo antes del último turno del usuario | El contexto más crítico y específico para esta petición exacta. |
| En el medio | Documentos de apoyo, fragmentos recuperados, ordenados por relevancia, no por cronología. |
| Historial de conversación | Solo lo necesario para la continuidad. Poda de forma agresiva. |
La regla general: cuanto más cerca del turno actual, más atención recibe. Las instrucciones críticas que viven solo en el medio de un historial largo están en riesgo.
La "altitud correcta" para las instrucciones
Un prompt de sistema puede fallar de dos formas opuestas. Demasiado bajo y codificas una lógica frágil de si-esto-entonces-aquello que se rompe en cuanto la realidad difiere. Demasiado alto y escribes una guía vaga que asume un contexto que el modelo no tiene. Anthropic llama al objetivo la "altitud correcta" (right altitude): la zona de Ricitos de Oro que es "lo suficientemente específica para guiar el comportamiento de forma eficaz, pero lo suficientemente flexible para ofrecer heurísticas sólidas". Apunta ahí: reglas y ejemplos concretos, no un árbol de decisiones, y tampoco una vaga sensación.
Recuperación en lugar de relleno
La tentación es meterlo todo: todos los documentos, el código completo, toda la conversación. Resístela.
El mejor enfoque es la recuperación selectiva: identificar lo que el modelo realmente necesita para esta petición específica e inyectar solo eso. Un fragmento de 2.000 tokens bien recuperado del documento correcto supera a un volcado de 40.000 tokens donde la respuesta está en algún lugar del medio.
Por eso existe la generación aumentada por recuperación (RAG): no solo para superar los límites de contexto, sino para mejorar la calidad manteniendo el contexto curado. La versión agéntica es la recuperación justo a tiempo (just-in-time retrieval): en lugar de precargar cada documento, el agente mantiene identificadores ligeros (rutas de archivos, IDs, consultas) y trae el contenido real al contexto solo en el momento en que se necesita.
Para sesiones interactivas, aplica la misma lógica: en lugar de acumularlo todo, compacta o limpia el historial periódicamente para eliminar el contenido que ya no es relevante para la tarea actual. Los comandos /compact y /clear de Claude Code son herramientas de ingeniería de contexto, no solo de gestión de sesiones. En la API, el mismo patrón se automatiza mediante la edición de memoria y contexto: los resultados antiguos de las herramientas se podan de la ventana mientras lo que importa se escribe en un almacén de memoria persistente.
Las tres tácticas de cabecera
Para el trabajo de largo horizonte, tres técnicas hacen la mayor parte del esfuerzo. Se componen: la mayoría de los agentes reales usan las tres.
- Cuando una sesión se acerca al límite de la ventana, resúmela y reinicialízala con la versión destilada. Conserva los detalles que sostienen el peso (decisiones arquitectónicas, errores sin resolver, decisiones clave de implementación) y descarta el relato jugada a jugada. Esto es lo que hace /compact en Claude Code.
- Haz que el agente escriba hechos duraderos en una memoria externa (un archivo, un borrador, un CLAUDE.md) y los lea después. Esto proporciona memoria persistente con una sobrecarga mínima dentro de la ventana: las notas viven fuera del presupuesto hasta que se necesitan.
- No rellenes de antemano cada documento. Mantén referencias ligeras y carga el contenido real en tiempo de ejecución, solo para el paso que lo necesita. Una extracción dirigida de 2.000 tokens vence a un volcado de 40.000 tokens.
El ángulo del coste
Los tokens que envías son tokens que pagas, tanto en dinero como en latencia. Rellenar el contexto con material vagamente relevante infla ambos. La ingeniería de contexto y la eficiencia de costes son el mismo problema.
Más concretamente:
- Un prompt de sistema inflado que copias y pegas de una plantilla se paga en cada una de las llamadas.
- El historial de conversación antiguo que arrastras porque "podría ser útil" se paga en cada una de las llamadas.
- Los documentos que inyectas "por si acaso" se pagan en cada una de las llamadas.
Recortar lo que no necesita estar ahí es a la vez mejor para la calidad y más barato de ejecutar.
Tácticas prácticas para usuarios de Claude
En Claude.ai:
- Usa conversaciones distintas para tareas distintas. No dejes que una tarde de digresiones contamine el contexto de un proyecto enfocado.
- Resume los hilos largos antes de hacer una pregunta compleja que dependa de ellos. Un resumen explícito suele ser más útil que el historial en bruto.
- Pon lo específico que quieres al final de un mensaje largo, no enterrado en el medio.
En Claude Code:
- Mantén tu archivo
CLAUDE.mdligero. Cada línea que contiene se inyecta en cada sesión. Consulta CLAUDE.md y Gestión de Contexto. - Usa
/clearcuando cambies a una tarea genuinamente distinta. Usa/compactcuando quieras continuar pero la sesión esté creciendo. - Referencia los archivos por ruta en lugar de pegar su contenido cuando el archivo completo no sea necesario para el paso actual.
A nivel de API:
- Diseña los prompts de sistema para que contengan solo lo que cada petición realmente necesita. Mueve las instrucciones específicas de la tarea al turno del usuario.
- Para los casos de uso con muchos documentos, recupera e inyecta los fragmentos relevantes en lugar de subir un corpus entero.
- Estructura el prompt para que el prefijo estable y reutilizable vaya primero; esto también habilita el caché de prompts, que es un complemento natural de la ingeniería de contexto.
Cuando quieras entregar un documento largo a Claude, la regla de colocación vence al volumen bruto siempre:
Instrucción primero, repetida al final
Tarea: Encuentra cada cláusula donde este contrato limita nuestra responsabilidad, y cita cada una textualmente con su número de sección. [... pega aquí el contrato completo de 40 páginas ...] Recordatorio de la tarea: enumera arriba cada cláusula de límite de responsabilidad, citada exactamente, con números de sección. Si no hay ninguna, dilo explícitamente.
La misma instrucción se sitúa arriba y abajo, las dos posiciones que la atención favorece, de modo que sobrevive incluso a un medio muy largo.
El cambio de mentalidad
La ingeniería de prompts pregunta: "¿Qué debería decir?" La ingeniería de contexto pregunta: "¿Qué debería ver el modelo, en qué orden, y qué debería dejar fuera deliberadamente?"
La segunda pregunta es más difícil, pero es la que realmente determina la calidad a escala.
Check yourself
0/3- La ventana de contexto es un presupuesto de atención, no almacenamiento: gástala solo en tokens de alta señal.
- La posición vence al volumen: las instrucciones críticas van arriba y justo antes del turno final, nunca enterradas en el medio.
- La compactación, la toma de notas y la recuperación justo a tiempo son las tres tácticas que mantienen coherentes a los agentes largos.
- Curar el contexto es la misma palanca que recortar el coste: menos tokens, mejores respuestas, una factura más baja.