Saltar al contenido principal
Intermedio

Cómo funciona realmente la memoria de los agentes

Haz a un chatbot la misma pregunta dos veces en dos sesiones y te responderá como un desconocido ambas veces. Eso no es un error — es el comportamiento por defecto. Un modelo de lenguaje puro no tiene memoria entre llamadas. Todo lo que "recuerda" dentro de una conversación vive en la ventana de contexto, y cuando esa conversación termina, desaparece.

La memoria es la maquinaria que le añades para arreglar eso: los sistemas que deciden qué debe arrastrar un agente hacia adelante, dónde almacenarlo y cómo recuperar la pieza correcta en el momento correcto. En 2026 esto dejó de ser una misión secundaria y se convirtió en una parte de primer nivel del diseño de agentes, con sus propios benchmarks, frameworks y una auténtica literatura de investigación. Esta página es el mapa.

What you'll learn
  • Entender por qué una ventana de contexto no es memoria — y dónde está realmente la frontera
  • Distinguir los cuatro tipos de memoria que usan los agentes: de trabajo, episódica, semántica, procedimental
  • Comparar los cuatro patrones de almacenamiento: contexto completo, vector/RAG, grafo de conocimiento y compactación/resumen
  • Ver cómo Claude, ChatGPT y Gemini implementan hoy la memoria cada uno
  • Elegir un enfoque de memoria para tu propio agente sin sobreingeniería

La idea que hay que retener: contexto ≠ memoria

La confusión más común es tratar una gran ventana de contexto como "memoria". No lo es. La ventana de contexto es espacio de trabajo para un turno — se rellena desde cero en cada llamada, es finita y es cara. La atención también se degrada a lo largo de ella (el efecto "perdido en el medio" tratado en Ingeniería de contexto).

La memoria es diferente en tres aspectos:

Ventana de contextoMemoria
DuraciónUna peticiónA lo largo de sesiones, días, para siempre
TamañoTecho fijo de tokensPrácticamente ilimitada (almacén externo)
CosteSe paga en cada turnoSe paga una vez al escribir; barato de referenciar
AccesoTodo, siempre a la vistaSelectivo — recuperas solo lo relevante

Todo el juego de la memoria de los agentes consiste en mover la información correcta entre estas dos: escribir hechos duraderos fuera de la ventana para no pagar por ellos en cada turno, y traerlos de vuelta dentro solo cuando este paso concreto los necesita. Consigue que ese flujo funcione y un agente podrá operar durante semanas con una ventana de contexto que solo alberga en cada momento unos pocos miles de tokens relevantes.

Los cuatro tipos de memoria

Tomando prestado (libremente) de la ciencia cognitiva, el ecosistema de agentes de 2026 ha convergido en cuatro categorías. Rara vez necesitas las cuatro — pero nombrarlas te evita construir un único amasijo que lo hace todo mal.

Guided walkthrough1 of 4
  1. Lo que está en la ventana de contexto ahora mismo — la tarea actual, los últimos turnos, los resultados de herramientas de este paso. Volátil por diseño. Es el borrador, no el archivo. Gestionarla bien es ingeniería de contexto; no es persistencia.

Una prueba útil: si responderías con "¿cuándo ocurrió eso?" es episódica; si responderías con "¿qué es cierto?" es semántica; si responderías con "así se hace" es procedimental; y si solo importa durante los próximos segundos, es memoria de trabajo y no necesita persistirse en absoluto.

Los cuatro patrones de almacenamiento

Una vez que sabes qué recordar, eliges cómo almacenarlo y recuperarlo. Hay cuatro patrones dominantes, aproximadamente en orden de complejidad. La mayoría de los sistemas reales combinan dos o tres.

1. Contexto completo (mételo todo)

Conserva todo el historial y reenvíalo en cada turno. Cero infraestructura, recuerdo perfecto — hasta que topas con el techo de tokens, la curva de coste o el "perdido en el medio". Bien para asistentes cortos; un callejón sin salida para cualquier cosa de larga duración. Es la línea base que todos los demás patrones mejoran.

2. Memoria vector / RAG

Escribe cada recuerdo como un embedding en una base de datos vectorial; en el momento de la consulta, generas el embedding del turno actual y recuperas los top-k recuerdos más similares. Esto es generación aumentada por recuperación apuntada al historial de conversación en lugar de a documentos. Barato, escalable y la opción por defecto para el recuerdo semántico de hechos y preferencias.

Su debilidad: similitud ≠ relevancia para preguntas temporales o de múltiples saltos. "¿Qué decidimos después de que se recortara el presupuesto?" es una pregunta de ordenación, y la similitud coseno no tiene noción del tiempo ni de encadenar dos hechos.

3. Memoria de grafo de conocimiento

Almacena los recuerdos como entidades y relaciones — nodos y aristas, a menudo con marcas temporales en las aristas. Para responder una pregunta recorres el grafo en lugar de hacer coincidencias difusas de vectores. Esto es lo que hace tratable el razonamiento de múltiples saltos y temporal ("¿quién reemplazó a la persona que era dueña de la cuenta de la que se quejó el usuario?"). Frameworks como Zep/Graphiti construyeron toda su propuesta en torno a grafos de conocimiento temporales. El coste es ingeniería real: extracción, resolución de entidades y evitar que el grafo se pudra.

4. Compactación y resumen

Comprime periódicamente el historial en curso en un resumen destilado y continúa a partir de ahí — cambiando el recuerdo literal por una ventana más pequeña y barata. Esto es lo que hace /compact en Claude Code, y lo que hace el "auto-resumen" en muchos productos de chat. Es la forma más barata de memoria a largo plazo y a menudo la primera que realmente necesitas. Su riesgo: el resumen descarta silenciosamente el único detalle que necesitabas. Ver Harnesses para agentes de larga duración para ver cómo se manifiesta esto a lo largo de ejecuciones de horas.

Pro tip

Los sistemas reales combinan estos en capas. Un stack común en 2026: compactación para la conversación en curso, vector para hechos semánticos y un grafo por encima solo cuando las consultas temporales/de múltiples saltos aparecen realmente en tu tráfico. No construyas el grafo hasta que sientas el dolor que el grafo resuelve.

Cómo lo hacen los tres grandes

Todo asistente importante incluye ahora algún tipo de memoria. No son lo mismo, y las diferencias importan.

ProductoQué recuerdaCómo funciona (a grandes rasgos)
ClaudeDos capas: una memoria a nivel de app de tus preferencias, y una herramienta de memoria orientada al desarrollador para agentes.La memoria de la app de Claude almacena hechos entre chats; la herramienta de memoria más edición de contexto de la API permite a un agente escribir notas en un almacén del lado del cliente y podar automáticamente resultados de herramientas obsoletos para sobrevivir a ejecuciones largas.
ChatGPT"Recuerdos guardados" (hechos explícitos) más referencia a tus chats pasados.Una mezcla de hechos declarados por el usuario y preferencias extraídas automáticamente, inyectados en el contexto del sistema en turnos posteriores. Editable y activable/desactivable por el usuario.
GeminiContexto personal extraído de tus chats y, opcionalmente, de la superficie más amplia de la cuenta de Google.Recuerda detalles de conversaciones anteriores y puede personalizar usando el contexto de la cuenta, sujeto a tus controles de privacidad.

Dos conclusiones. Primera, la memoria de consumo es mayormente semántica — preferencias y hechos — no una repetición episódica completa. Segunda, si estás construyendo un agente, la memoria integrada del producto no es tu sistema de memoria; esa capa la posees tú, usando primitivos como la herramienta de memoria de Claude o un framework externo.

Convierte un modelo puro en un agente que toma notas (la memoria real más barata)

You have a file called MEMORY.md that persists between our sessions.

At the END of each session, append any durable facts worth keeping:
- my stable preferences (tools, formats, style)
- decisions we made and WHY
- open threads to resume next time

At the START of each session, read MEMORY.md first and use it.
Keep it under 30 lines — when it grows past that, consolidate and
delete anything stale. Never store secrets or credentials.

Ese único patrón — escribir notas duraderas en un archivo externo, releerlas la próxima vez — es el 80/20 de la memoria de los agentes. La mayor parte de la maquinaria de frameworks de abajo es una versión más automática y más escalable de exactamente esto.

Medir la memoria: el benchmark LoCoMo

No puedes mejorar lo que no puedes medir, y la memoria era difícil de medir hasta que llegaron los benchmarks. El más citado es LoCoMo ("Evaluating Very Long-Term Conversational Memory of LLM Agents"): conversaciones multisesión muy largas — cientos de turnos a lo largo de decenas de sesiones — con pares pregunta-respuesta en cinco sabores: de un solo salto, de múltiples saltos (entre sesiones), razonamiento temporal, de dominio abierto y adversarial.

Lo que revela LoCoMo es el patrón en torno al cual diseñar: los sistemas se defienden bien en el recuerdo factual de un solo salto y se desmoronan en preguntas temporales y de múltiples saltos. Ese modo de fallo es exactamente por qué existe la memoria de grafo de conocimiento — es el patrón que más eleva esas dos categorías. Cuando evalúes la memoria de tu propio agente, pondera mucho los casos de múltiples saltos y temporales; el recuerdo de un solo salto hace quedar bien a casi todo.

Elegir un enfoque sin sobreconstruir

Guided walkthrough1 of 5
  1. No hagas nada. La memoria de trabajo (la ventana de contexto) es suficiente. Añadir un almacén de memoria aquí es puro sobrecoste.

La trampa es empezar por el paso cinco. La memoria de grafo impresiona en las demos y es cara en producción. Sube la escalera; detente en el primer peldaño que resuelva tu problema real.

Check yourself

0/4
  1. ¿Por qué una gran ventana de contexto no es lo mismo que la memoria de un agente?
  2. Un usuario pregunta: '¿Qué decidimos justo después de que se recortara el presupuesto?' ¿Qué enfoque de memoria es más probable que responda correctamente?
  3. ¿Qué clasificación es correcta para 'el usuario prefiere unidades métricas'?
  4. Estás construyendo un bot de ayuda corto de una sola sesión. ¿Cuál es el diseño de memoria correcto?
Vocabulario de memoria de agentes
Pulsa Intro o Espacio para girar la tarjeta. Usa las flechas izquierda y derecha para moverte entre las tarjetas.Término mostrado.
1 / 8

La conclusión

La memoria no es una función que enciendes — es un flujo que diseñas: qué sale de la ventana, dónde se almacena y cómo vuelve. Nombra los cuatro tipos de memoria para no construir un único amasijo para todos ellos. Empieza por el patrón de almacenamiento más barato que resuelva tu problema y sube solo cuando sientas el dolor del siguiente. Y mide con casos temporales y de múltiples saltos, porque el recuerdo de un solo salto hace que todo parezca más inteligente de lo que es.

La memoria es la otra mitad de la Ingeniería de contexto: la ingeniería de contexto decide qué llena la ventana en este turno; la memoria decide qué sobrevive entre turnos. Juntas son lo que separa a un chatbot de un agente que mejora cuanto más tiempo trabajas con él.

Fuentes y lecturas adicionales