Cómo funciona realmente la memoria de los agentes
Haz a un chatbot la misma pregunta dos veces en dos sesiones y te responderá como un desconocido ambas veces. Eso no es un error — es el comportamiento por defecto. Un modelo de lenguaje puro no tiene memoria entre llamadas. Todo lo que "recuerda" dentro de una conversación vive en la ventana de contexto, y cuando esa conversación termina, desaparece.
La memoria es la maquinaria que le añades para arreglar eso: los sistemas que deciden qué debe arrastrar un agente hacia adelante, dónde almacenarlo y cómo recuperar la pieza correcta en el momento correcto. En 2026 esto dejó de ser una misión secundaria y se convirtió en una parte de primer nivel del diseño de agentes, con sus propios benchmarks, frameworks y una auténtica literatura de investigación. Esta página es el mapa.
- Entender por qué una ventana de contexto no es memoria — y dónde está realmente la frontera
- Distinguir los cuatro tipos de memoria que usan los agentes: de trabajo, episódica, semántica, procedimental
- Comparar los cuatro patrones de almacenamiento: contexto completo, vector/RAG, grafo de conocimiento y compactación/resumen
- Ver cómo Claude, ChatGPT y Gemini implementan hoy la memoria cada uno
- Elegir un enfoque de memoria para tu propio agente sin sobreingeniería
La idea que hay que retener: contexto ≠ memoria
La confusión más común es tratar una gran ventana de contexto como "memoria". No lo es. La ventana de contexto es espacio de trabajo para un turno — se rellena desde cero en cada llamada, es finita y es cara. La atención también se degrada a lo largo de ella (el efecto "perdido en el medio" tratado en Ingeniería de contexto).
La memoria es diferente en tres aspectos:
| Ventana de contexto | Memoria | |
|---|---|---|
| Duración | Una petición | A lo largo de sesiones, días, para siempre |
| Tamaño | Techo fijo de tokens | Prácticamente ilimitada (almacén externo) |
| Coste | Se paga en cada turno | Se paga una vez al escribir; barato de referenciar |
| Acceso | Todo, siempre a la vista | Selectivo — recuperas solo lo relevante |
Todo el juego de la memoria de los agentes consiste en mover la información correcta entre estas dos: escribir hechos duraderos fuera de la ventana para no pagar por ellos en cada turno, y traerlos de vuelta dentro solo cuando este paso concreto los necesita. Consigue que ese flujo funcione y un agente podrá operar durante semanas con una ventana de contexto que solo alberga en cada momento unos pocos miles de tokens relevantes.
Los cuatro tipos de memoria
Tomando prestado (libremente) de la ciencia cognitiva, el ecosistema de agentes de 2026 ha convergido en cuatro categorías. Rara vez necesitas las cuatro — pero nombrarlas te evita construir un único amasijo que lo hace todo mal.
- Lo que está en la ventana de contexto ahora mismo — la tarea actual, los últimos turnos, los resultados de herramientas de este paso. Volátil por diseño. Es el borrador, no el archivo. Gestionarla bien es ingeniería de contexto; no es persistencia.
- Cosas concretas que ocurrieron, con una marca temporal. 'El martes el usuario dijo que el pago fallaba; el miércoles soporte lo marcó como resuelto.' La memoria episódica es inherentemente temporal — el orden y el cuándo importan. Es lo que permite a un agente razonar sobre una historia en lugar de una instantánea.
- Hechos y preferencias duraderos, despojados de cuándo los aprendiste. 'El usuario prefiere unidades métricas.' 'Este cliente está en el plan enterprise.' La memoria semántica es en gran medida atemporal — representa lo que el agente cree que es cierto actualmente, no el evento donde lo descubrió.
- Cómo hacer algo — habilidades reutilizables, flujos de trabajo y rutinas aprendidas. La menos madura de las cuatro en la práctica. En herramientas como Claude Code esto suele vivir como archivos de instrucciones (CLAUDE.md) y habilidades reutilizables en lugar de un almacén automático.
Una prueba útil: si responderías con "¿cuándo ocurrió eso?" es episódica; si responderías con "¿qué es cierto?" es semántica; si responderías con "así se hace" es procedimental; y si solo importa durante los próximos segundos, es memoria de trabajo y no necesita persistirse en absoluto.
Los cuatro patrones de almacenamiento
Una vez que sabes qué recordar, eliges cómo almacenarlo y recuperarlo. Hay cuatro patrones dominantes, aproximadamente en orden de complejidad. La mayoría de los sistemas reales combinan dos o tres.
1. Contexto completo (mételo todo)
Conserva todo el historial y reenvíalo en cada turno. Cero infraestructura, recuerdo perfecto — hasta que topas con el techo de tokens, la curva de coste o el "perdido en el medio". Bien para asistentes cortos; un callejón sin salida para cualquier cosa de larga duración. Es la línea base que todos los demás patrones mejoran.
2. Memoria vector / RAG
Escribe cada recuerdo como un embedding en una base de datos vectorial; en el momento de la consulta, generas el embedding del turno actual y recuperas los top-k recuerdos más similares. Esto es generación aumentada por recuperación apuntada al historial de conversación en lugar de a documentos. Barato, escalable y la opción por defecto para el recuerdo semántico de hechos y preferencias.
Su debilidad: similitud ≠ relevancia para preguntas temporales o de múltiples saltos. "¿Qué decidimos después de que se recortara el presupuesto?" es una pregunta de ordenación, y la similitud coseno no tiene noción del tiempo ni de encadenar dos hechos.
3. Memoria de grafo de conocimiento
Almacena los recuerdos como entidades y relaciones — nodos y aristas, a menudo con marcas temporales en las aristas. Para responder una pregunta recorres el grafo en lugar de hacer coincidencias difusas de vectores. Esto es lo que hace tratable el razonamiento de múltiples saltos y temporal ("¿quién reemplazó a la persona que era dueña de la cuenta de la que se quejó el usuario?"). Frameworks como Zep/Graphiti construyeron toda su propuesta en torno a grafos de conocimiento temporales. El coste es ingeniería real: extracción, resolución de entidades y evitar que el grafo se pudra.
4. Compactación y resumen
Comprime periódicamente el historial en curso en un resumen destilado y continúa a partir de ahí — cambiando el recuerdo literal por una ventana más pequeña y barata. Esto es lo que hace /compact en Claude Code, y lo que hace el "auto-resumen" en muchos productos de chat. Es la forma más barata de memoria a largo plazo y a menudo la primera que realmente necesitas. Su riesgo: el resumen descarta silenciosamente el único detalle que necesitabas. Ver Harnesses para agentes de larga duración para ver cómo se manifiesta esto a lo largo de ejecuciones de horas.
Los sistemas reales combinan estos en capas. Un stack común en 2026: compactación para la conversación en curso, vector para hechos semánticos y un grafo por encima solo cuando las consultas temporales/de múltiples saltos aparecen realmente en tu tráfico. No construyas el grafo hasta que sientas el dolor que el grafo resuelve.
Cómo lo hacen los tres grandes
Todo asistente importante incluye ahora algún tipo de memoria. No son lo mismo, y las diferencias importan.
| Producto | Qué recuerda | Cómo funciona (a grandes rasgos) |
|---|---|---|
| Claude | Dos capas: una memoria a nivel de app de tus preferencias, y una herramienta de memoria orientada al desarrollador para agentes. | La memoria de la app de Claude almacena hechos entre chats; la herramienta de memoria más edición de contexto de la API permite a un agente escribir notas en un almacén del lado del cliente y podar automáticamente resultados de herramientas obsoletos para sobrevivir a ejecuciones largas. |
| ChatGPT | "Recuerdos guardados" (hechos explícitos) más referencia a tus chats pasados. | Una mezcla de hechos declarados por el usuario y preferencias extraídas automáticamente, inyectados en el contexto del sistema en turnos posteriores. Editable y activable/desactivable por el usuario. |
| Gemini | Contexto personal extraído de tus chats y, opcionalmente, de la superficie más amplia de la cuenta de Google. | Recuerda detalles de conversaciones anteriores y puede personalizar usando el contexto de la cuenta, sujeto a tus controles de privacidad. |
Dos conclusiones. Primera, la memoria de consumo es mayormente semántica — preferencias y hechos — no una repetición episódica completa. Segunda, si estás construyendo un agente, la memoria integrada del producto no es tu sistema de memoria; esa capa la posees tú, usando primitivos como la herramienta de memoria de Claude o un framework externo.
Convierte un modelo puro en un agente que toma notas (la memoria real más barata)
You have a file called MEMORY.md that persists between our sessions. At the END of each session, append any durable facts worth keeping: - my stable preferences (tools, formats, style) - decisions we made and WHY - open threads to resume next time At the START of each session, read MEMORY.md first and use it. Keep it under 30 lines — when it grows past that, consolidate and delete anything stale. Never store secrets or credentials.
Ese único patrón — escribir notas duraderas en un archivo externo, releerlas la próxima vez — es el 80/20 de la memoria de los agentes. La mayor parte de la maquinaria de frameworks de abajo es una versión más automática y más escalable de exactamente esto.
Medir la memoria: el benchmark LoCoMo
No puedes mejorar lo que no puedes medir, y la memoria era difícil de medir hasta que llegaron los benchmarks. El más citado es LoCoMo ("Evaluating Very Long-Term Conversational Memory of LLM Agents"): conversaciones multisesión muy largas — cientos de turnos a lo largo de decenas de sesiones — con pares pregunta-respuesta en cinco sabores: de un solo salto, de múltiples saltos (entre sesiones), razonamiento temporal, de dominio abierto y adversarial.
Lo que revela LoCoMo es el patrón en torno al cual diseñar: los sistemas se defienden bien en el recuerdo factual de un solo salto y se desmoronan en preguntas temporales y de múltiples saltos. Ese modo de fallo es exactamente por qué existe la memoria de grafo de conocimiento — es el patrón que más eleva esas dos categorías. Cuando evalúes la memoria de tu propio agente, pondera mucho los casos de múltiples saltos y temporales; el recuerdo de un solo salto hace quedar bien a casi todo.
Elegir un enfoque sin sobreconstruir
- No hagas nada. La memoria de trabajo (la ventana de contexto) es suficiente. Añadir un almacén de memoria aquí es puro sobrecoste.
- Empieza tomando notas en un archivo externo, o con la memoria integrada del producto. Esto cubre la mayoría de las necesidades de 'recuerda mis preferencias' a coste casi cero.
- Añade compactación/resumen. Conserva los hechos que sostienen la estructura, descarta la narración jugada a jugada. Aquí es donde viven los agentes de larga duración.
- Añade memoria vector/RAG. Recupera los top-k recuerdos relevantes por turno en lugar de reenviarlo todo.
- Solo ahora recurre a un grafo de conocimiento — o a un framework gestionado (Mem0, Letta, Zep, LangMem) que te dé uno sin tener que fabricar a mano la extracción y la resolución de entidades.
La trampa es empezar por el paso cinco. La memoria de grafo impresiona en las demos y es cara en producción. Sube la escalera; detente en el primer peldaño que resuelva tu problema real.
Check yourself
0/4La conclusión
La memoria no es una función que enciendes — es un flujo que diseñas: qué sale de la ventana, dónde se almacena y cómo vuelve. Nombra los cuatro tipos de memoria para no construir un único amasijo para todos ellos. Empieza por el patrón de almacenamiento más barato que resuelva tu problema y sube solo cuando sientas el dolor del siguiente. Y mide con casos temporales y de múltiples saltos, porque el recuerdo de un solo salto hace que todo parezca más inteligente de lo que es.
La memoria es la otra mitad de la Ingeniería de contexto: la ingeniería de contexto decide qué llena la ventana en este turno; la memoria decide qué sobrevive entre turnos. Juntas son lo que separa a un chatbot de un agente que mejora cuanto más tiempo trabajas con él.
Fuentes y lecturas adicionales
- Evaluating Very Long-Term Conversational Memory of LLM Agents (LoCoMo) — el benchmark canónico; página del proyecto.
- Effective context engineering for AI agents — Anthropic sobre compactación, toma de notas y recuperación justo a tiempo.
- Claude memory tool & context editing docs — el primitivo orientado al desarrollador.
- Agent Memory Techniques — 30 notebooks ejecutables que cubren buffers de conversación, almacenes vectoriales, grafos de conocimiento, memoria episódica/semántica, Mem0, Letta, Zep, Graphiti y LoCoMo.
- The State of AI Agent Memory 2026 — informe de proveedor sobre arquitecturas de memoria y benchmarks (léelo con la cautela habitual ante los números auto-reportados).
- Relacionado en AILmanac: Ingeniería de contexto · Harnesses para agentes de larga duración · RAG · Memoria de la app de Claude · Memoria y edición de contexto (API).