En pocas palabras: La Agentic Context Management (ACM) trata la memoria y el costo de los agentes IA como problemas de arquitectura: cinco primitivas que gestionan qué recordar y compactan el contexto dentro de un presupuesto de tokens, alcanzando 92% en LongMemEval y 93,2% en LoCoMo con la implementación Maximem Synap.
La gestión de contexto en agentes IA se volvió el verdadero cuello de botella de producción: los modelos razonan bien, pero se ahogan en su propio historial y pagan tokens de más en cada turno. Esa es la tesis del paper de Agentic Context Management que Gaurav Dadhich publicó en arXiv el 23 de julio de 2026.
La Agentic Context Management (ACM) es la disciplina que trata la memoria de un agente de IA como un ciclo de vida, desde decidir qué vale la pena recordar hasta compactar el contexto dentro de un presupuesto de tokens sin perder lo relevante. El autor la descompone en cinco primitivos y la respalda con Maximem Synap, una implementación de referencia multi-tenant que reporta 92% en LongMemEval y 93,2% en LoCoMo.
En 30 segundos
- Origen y fecha: el paper se publicó en arXiv el 23 de julio de 2026, con Gaurav Dadhich como autor.
- El diagnóstico: los agentes fallan en producción porque acumulan historiales, prompts grandes y salidas de herramientas, no porque razonen mal.
- La propuesta: cinco primitivos: architecting, ingesting, scoping, anticipating y compacting & consolidation.
- La matemática: sin gestión, el costo de tokens crece de forma cuadrática con el largo de la conversación; con compactación validada, vuelve a ser lineal sin perder fidelidad.
- Los números: Maximem Synap, la implementación de referencia, reporta 92% en LongMemEval y 93,2% en LoCoMo bajo la configuración de la sección 6 del paper.
¿Por qué los agentes de IA se ahogan en su propio historial?
Porque acumulan más de lo que pueden sostener. Según el paper de Dadhich, los fallos de agentes en producción vienen menos de una incapacidad para razonar y más de no poder administrar lo que hay en el contexto de razonamiento: historiales de conversación, prompts enormes, definiciones de herramientas extensas y salidas de tools que se inflan turno a turno. La frase que resume el drama: los agentes “se ahogan en su propia historia acumulada mientras pagan un costo de tokens que crece en cada turno”.
Ponele que armaste un agente de soporte: el usuario pregunta algo, el agente consulta una API, la respuesta ocupa dos mil tokens, esa salida entra al historial, el historial entra entero al próximo prompt, el prompt pesa más, la siguiente respuesta también se suma, y a la vigésima interacción estás mandando treinta mil tokens de los cuales la mitad es basura acumulada que nadie pidió.
El resultado, según el trabajo: recalls faltantes dentro de la misma conversación y también entre sesiones distintas. O sea, el agente olvida lo que habló hace diez minutos y lo que resolvió la semana pasada.
¿Te suena familiar? Seguro.
¿Qué cambia entre tratar el contexto como almacén y como ciclo de vida?
Cambia todo el diseño. El enfoque dominante a agosto de 2026, heredero de RAG y de los módulos de memoria de frameworks como LangChain o proyectos tipo MemGPT y Letta, piensa el contexto como un problema de almacenamiento y recuperación: guardás, buscás, pegás. El paper sostiene que ese encuadre queda corto, porque administrar contexto es un ciclo de vida que arranca antes de guardar y termina después de recuperar. En gestión de dispositivos y seguridad con Microsoft Intune profundizamos sobre esto.
Ese ciclo incluye decidir qué recordar, extraer y estructurar la información, elegir el almacén correcto según cada tipo de dato, consolidar y olvidar preservando la procedencia, calcular relevancia para el turno actual, anticipar lo que hará falta después y compactar todo dentro de un presupuesto. Son siete decisiones distintas que la visión de “guardar y buscar” ni siquiera considera.
Si alguna vez montaste una base vectorial “universal” para la memoria de un bot, ya sabés que no zafa.
| Aspecto | Visión tradicional (store & retrieval) | ACM (ciclo de vida) |
|---|---|---|
| Problema central | Dónde guardar y cómo recuperar | Qué recordar, cuándo y a qué costo |
| Olvido | No existe (o es un bug) | Consolidación con procedencia preservada |
| Almacenes | Uno solo para todo | Store correcto según el tipo de dato |
| Costo | Crece con el historial | Se presupuesta y se compacta |
| Alcance | Una conversación por usuario | Jerarquía organizacional multi-tenant |

La diferencia práctica: en el modelo viejo decidís dónde guardar; en ACM decidís qué merece existir en memoria y a qué precio, durante toda la vida del dato. De paso, el paper se suma a la discusión de context engineering, o sea, diseñar qué entra en la ventana del modelo, algo bastante distinto del prompt engineering clásico.
¿Cuáles son los cinco primitivos de la gestión de contexto en agentes IA?
Son cinco: architecting, ingesting, scoping, anticipating y compacting & consolidation. Cada uno cubre una etapa del ciclo de vida del recuerdo y juntos forman la columna vertebral de la ACM según el paper. Acá va el mapa con ejemplos de uso real. Sobre eso hablamos en cómo gestiona la memoria conversacional ChatGPT.
- Architecting (qué recordar): decidís qué datos merecen persistencia antes de que existan. Ejemplo: definir que del CRM solo va a memoria lo comercial cerrado, no cada charla informal del prospecto.
- Ingesting (extraer y estructurar): transformás conversación cruda en información usable. Ejemplo: convertir una llamada de ventas en campos concretos: producto, objeciones, próximo paso.
- Scoping (relevancia ahora): elegís qué parte de la memoria entra al contexto de este turno. Ejemplo: ante un reclamo de facturación, traés solo el historial de pagos, no la biografía completa del cliente.
- Anticipating (qué vendrá): precargás lo que el agente va a necesitar. Ejemplo: si el usuario entró al checkout, dejás ya disponibles las políticas de devolución.
- Compacting & consolidation (presupuesto sin pérdidas): condensás el historial viejo dentro de un límite de tokens, consolidando duplicados y olvidando con criterio, siempre conservando la procedencia. Ejemplo: cerrar un ticket y dejar cinco hechos validados en lugar de cuarenta mensajes.
Ojo con esto: los cinco operan sobre una jerarquía organizacional, no sobre un usuario aislado. La memoria de un agente corporativo vive en capas (equipo, área, compañía) y eso cambia cómo se diseña absolutamente todo.
¿Cuánto crece el costo de tokens si no gestionás el contexto?
En el peor caso, de forma cuadrática. El paper plantea tres regímenes claros: la acumulación ingenua de contexto hace crecer el costo de manera cuadrática respecto del largo de la conversación; el resumido crudo compra costo lineal al precio de un acantilado de precisión; y solo la compactación validada logra linealidad conservando fidelidad. Traducido a plata: duplicás el largo de la charla y el gasto se multiplica por cuatro.
¿Por qué cuadrático? Porque cada turno reenvía todo el historial acumulado. Si cada mensaje aporta una unidad de contexto, en el turno n pagás n unidades, y sumando todos los turnos el total escala con n².
| Estrategia | Costo según el largo (n) | Fidelidad |
|---|---|---|
| Acumulación ingenua | Cuadrática O(n²) | Total, pero insostenible |
| Resumido crudo | Lineal O(n) | Caída de precisión (“accuracy cliff”) |
| Compactación validada | Lineal O(n) | Preservada |
Acá viene la parte incómoda para los negocios. Si facturás tu agente por suscripción y pagás los modelos en dólares, el costo por conversación resuelta puede crecer más rápido que el valor de esa conversación. La compactación validada aparece como el único régimen donde escalás sin sacrificar ni presupuesto ni exactitud, y por eso el paper le da tanto peso. Cubrimos ese tema en detalle en cómo funciona el razonamiento en los modelos de lenguaje.
¿Qué es Maximem Synap y qué resultados reporta?
Maximem Synap es la implementación de referencia con la que Dadhich cierra el paper: un servicio multi-tenant que materializa los cinco primitivos como producto funcional. Bajo la configuración detallada en la sección 6 del documento, reporta 92% en LongMemEval y 93,2% en LoCoMo, los dos benchmarks estándar de memoria conversacional de largo plazo.
Ahora, tomémoslo con pinzas. Es un paper de un solo autor, con resultados generados por su propia implementación. ¿Alguien de afuera replicó esos porcentajes? Todavía no. Que los números sean buenos no los vuelve independientes.
Tampoco queda claro, por ahora, si Synap estará disponible comercialmente, a qué precio o si quedará como referencia conceptual. El paper no lo especifica.
¿Cómo validás que la compresión de contexto no pierde información?
Comparando memoria contra memoria. La evaluación corre sobre LongMemEval, un benchmark de 2024 que mide memoria interactiva de largo plazo en asistentes, y sobre LoCoMo, también de 2024, enfocado en conversaciones muy extensas con preguntas de recuerdo razonado. La lógica: le hacés al agente preguntas cuya respuesta vive en partes comprimidas del historial, y medís si sobrevivió.
Fuera de los benchmarks formales, la prueba casera es directa: guardá un set de preguntas con respuestas conocidas sobre el historial original, corré la misma batería después de comprimir y compará tasas de acierto. Y si después de comprimir el agente “recuerda” cosas que nunca pasaron, tu compresión está inventando. Ahí no hay tuning que salve: cambiá de estrategia. Te puede servir nuestra cobertura de el ecosistema de IA de Google.
El propio paper admite lo que falta medir: latencia, eficiencia de tokens y resistencia al context rot, esa degradación silenciosa cuando el contexto se pudre de viejo. Ningún benchmark actual captura esas dimensiones, así que un score alto no garantiza un sistema rápido ni barato.
¿Qué significa para equipos tech de Latinoamérica?
Se resume en una palabra: dólares. La mayoría de los equipos de la región paga los tokens en USD mientras factura en pesos, así que cada turno inflado golpea directo la rentabilidad. Si estás construyendo un agente de soporte o ventas para volumen (WhatsApp empresarial, por ejemplo), el diseño de contexto pasa a ser decisión de producto, porque define cuánto cuesta resolver una conversación. Medilo desde el día uno: retrofittear memoria después sale mucho más caro que diseñarla bien.
¿Qué está confirmado y qué sigue pendiente?
- Confirmado: el paper existe y salió en arXiv el 23 de julio de 2026, firmado por Gaurav Dadhich.
- Confirmado: los cinco primitivos y el argumento económico (crecimiento cuadrático vs. lineal) están explícitos en el resumen del documento.
- Confirmado: Maximem Synap figura como implementación de referencia multi-tenant, con 92% en LongMemEval y 93,2% en LoCoMo bajo la configuración de la sección 6.
- Pendiente: la revisión por pares del paper y cualquier replicación independiente de los puntajes.
- Pendiente: disponibilidad comercial, precios y detalles técnicos completos de Synap, que el resumen no detalla.
Errores comunes al diseñar la memoria de un agente
- Resumir todo con el mismo modelo y esperar lo mejor. El resumido crudo baja el costo a lineal pero produce el acantilado de precisión que describe el paper: el agente contesta seguro y equivocado. Sin validación posterior, no sabés qué información murió en el resumen.
- Mandar el historial completo “por las dudas”. Es la ruta directa al crecimiento cuadrático de costos, porque cada turno nuevo encarece todos los anteriores.
- Usar un único almacén para todos los tipos de datos. Hechos estructurados, preferencias y episodios conversacionales no viven bien en el mismo lugar; el paper insiste en elegir el store correcto por tipo de dato.
- Borrar o consolidar sin procedencia. Si olvidás con criterio pero perdés el origen del dato, después no podés auditar ni corregir. La procedencia es tu red de seguridad.
Preguntas Frecuentes
¿Qué es la gestión de contexto en agentes de IA?
Es la disciplina que administra todo lo que un agente mantiene en su contexto de razonamiento: historiales, prompts, definiciones de herramientas y salidas. Según el paper de Gaurav Dadhich (julio de 2026), se organiza en cinco primitivos: architecting, ingesting, scoping, anticipating y compacting & consolidation.
¿Por qué el costo de tokens crece en forma cuadrática sin gestión de contexto?
Porque cada turno reenvía el historial completo al modelo. Si la conversación tiene n turnos, el total de tokens procesados escala con n², según el análisis económico del paper. Con compactación validada, ese crecimiento vuelve a ser lineal.
¿Cómo puedo reducir el costo de tokens sin perder información?
Con compactación validada en lugar de resúmenes crudos: condensás el historial a un presupuesto de tokens verificando que los hechos clave sobrevivan. Complementá eligiendo el almacén adecuado para cada tipo de dato y aplicando scoping, es decir, trayendo al contexto solo lo relevante para el turno actual.
¿Qué diferencia hay entre compresión cruda y compaction validada?
La compresión cruda resume sin verificar y compra costo lineal a cambio de una caída de precisión. La compaction validada alcanza el mismo costo lineal preservando fidelidad, porque valida que lo comprimido conserve lo que importa. Esa distinción es el corazón económico del paper.
¿Qué es Maximem Synap?
Es la implementación de referencia de la ACM descrita por Dadhich: un servicio multi-tenant que implementa los cinco primitivos. Reporta 92% en LongMemEval y 93,2% en LoCoMo bajo la configuración de la sección 6 del paper, aunque por ahora sin replicación independiente.
Conclusión
El aporte de este paper es un cambio de marco: la memoria del agente se trata como decisión de arquitectura con presupuesto, lejos de la vieja idea de guardar y buscar. Para quien construye agentes, el orden de operaciones es concreto. Primero, medí cuántos tokens consumís por turno hoy y cómo crece esa curva. Segundo, detectá qué recuerda tu agente que no debería y qué olvida que debería recordar. Tercero, si vas a comprimir, validá la compresión con benchmarks de memoria antes de confiarsela a clientes reales. La ventana de contexto va a seguir siendo finita y los tokens van a seguir costando plata; lo único que controlás vos es qué entra.
Fuentes
- Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems – paper original de Gaurav Dadhich en arXiv (julio 2026)
- LongMemEval – benchmark de memoria interactiva de largo plazo para asistentes (arXiv)
- LoCoMo – benchmark de memoria en conversaciones de muy largo plazo (arXiv)
