En pocas palabras: Zero-Mem es un sistema de memoria para agentes IA que gasta cero tokens al guardar y recuperar información. Lo presentó el equipo de Yilin Xiao en arXiv (julio 2026): guarda las trazas originales en un grafo entidad-contexto y es 57,6% más rápido que LightMem.
La memoria sin tokens para agentes IA ya tiene nombre propio: Zero-Mem, un sistema que elimina las llamadas al modelo en cada operación de memoria (cero tokens para guardar y recuperar). Lo presentó un equipo encabezado por Yilin Xiao en un paper de arXiv de julio de 2026, con un 57,6% menos de tiempo por operación que el baseline más rápido.
Zero-Mem es un sistema de gestión de memoria para agentes basados en modelos de lenguaje que no consume tokens al almacenar ni al recuperar información. Guarda las trazas originales de interacción como fuente de verdad y las organiza en dos estructuras: un grafo entidad-contexto y una jerarquía temporal. Solo el paso final, responder la pregunta, invoca al LLM. Lo firma un grupo de once investigadores.
En 30 segundos
- Cero tokens en memoria: Zero-Mem gastó 0 tokens en operaciones de memoria contra los 28,6 millones de GAM en el mismo test.
- 57,6% más rápido: reduce ese porcentaje de tiempo por operación frente a LightMem, el baseline más veloz.
- 0,22 segundos por consulta: latencia medida en LoCoMO con GPT-4o-mini.
- 59,15 de F1 promedio en LoCoMO: +5,40 puntos sobre GAM (BLEU-1: 52,96, +5,45).
- Aguanta contextos largos: en HotpotQA a 224K tokens marca 66,43 de F1, +5,52 sobre el mejor rival.
¿Qué es Zero-Mem y cómo separa la memoria del LLM?
Zero-Mem es un sistema que le da memoria de largo plazo a un agente LLM sin usar el modelo para gestionarla. La idea central: separar dos cosas que hasta ahora venían pegadas. Por un lado, las operaciones de memoria (guardar lo que pasó, buscar lo relevante). Por otro, la respuesta final al usuario. Solo la segunda usa tokens del modelo.
Ponele que tu agente tuvo 50 conversaciones con un cliente. Cada vez que quiere “acordarse” de algo, la mayoría de los sistemas actuales le pide al LLM que resuma, reescriba o decida qué guardar. Eso son llamadas al modelo, o sea plata y latencia, en cada paso. Zero-Mem no hace nada de eso: guarda la traza original tal cual y la indexa.
El paper lo resume así: “Zero-Mem logra un rendimiento competitivo mientras elimina las llamadas al LLM y el consumo de tokens de las operaciones de memoria”. El encoder de embeddings sí cuenta aparte (no es magia), pero es un costo distinto y mucho más barato que una llamada generativa. En protección de datos en sistemas empresariales profundizamos sobre esto.
¿Por qué la memoria sin tokens para agentes IA baja los costos?
Porque el gasto de tokens en memoria crece con cada interacción, y con volumen se vuelve el costo dominante. En el test de LoCoMO, GAM (uno de los sistemas comparados) consumió 28,6 millones de tokens solo en operaciones de memoria. Zero-Mem gastó cero en esa capa, según el paper original en arXiv.
Pensalo en escala. Un agente de soporte que atiende miles de conversaciones por día está pagando dos veces: una por responder y otra por recordar. La segunda es invisible hasta que llega la factura.
El otro efecto es la latencia. Cada llamada al modelo para gestionar memoria es cientos de milisegundos que el usuario espera. Zero-Mem reporta 0,22 segundos de latencia por consulta y un 57,6% menos de tiempo total que LightMem, el baseline más rápido del lote. ¿Se nota eso en un chat en vivo? Bastante, sobre todo cuando el agente encadena varias búsquedas antes de contestar.
¿Qué es el grafo entidad-contexto?
Es la primera de las dos estructuras de Zero-Mem, y sirve para el acceso relacional a la evidencia. Guarda qué entidades (personas, productos, fechas, conceptos) aparecen juntas en las trazas y cómo se conectan entre sí, sin pedirle al LLM que arme ese mapa.
Cuando el agente necesita recuperar algo, el grafo le devuelve no solo el dato puntual sino las relaciones de soporte y el contexto alrededor. Si preguntás por “el pedido que hizo Marta en marzo”, el grafo trae a Marta, el pedido, la fecha y las interacciones adyacentes. Todo por recuperación estructurada, sin generar texto nuevo.
¿Cómo funciona la jerarquía temporal?
La jerarquía temporal es la segunda estructura y preserva la localidad conversacional: el orden en que pasaron las cosas y el estado de cada sesión. El grafo entidad-contexto te dice “qué se relaciona con qué”; la jerarquía temporal te dice “qué pasó antes y qué después”. Esto se conecta con lo que analizamos en cómo ChatGPT maneja su memoria.
Las dos trabajan juntas. Y hay un detalle fino que a mí me parece lo más interesante del diseño: una calibración determinista que descarta evidencia en conflicto antes de armar la respuesta. O sea, no le tira al modelo tres versiones contradictorias de lo mismo para que él decida (eso gastaría tokens y abriría la puerta a alucinaciones). Filtra primero, con reglas, y recién ahí pasa la evidencia limpia al paso final.
Resultados en benchmarks: los números reales
Zero-Mem se midió contra 10 sistemas de referencia (LONG-LLM, RAG, A-Mem, Mem0, MemoryOS, LightMem, SimpleMem, CompassMem, GAM y HippoRAG) en dos benchmarks: LoCoMO para memoria conversacional larga y HotpotQA para preguntas multi-hop. Todo con el mismo lector de QA final y el mismo presupuesto de contexto, para que la comparación sea pareja. Acá los datos de LoCoMO con GPT-4o-mini:
| Métrica | Zero-Mem | Referencia |
|---|---|---|
| Tokens en operaciones de memoria | 0 | GAM: 28,6 millones |
| F1 promedio | 59,15 | +5,40 sobre GAM |
| BLEU-1 promedio | 52,96 | +5,45 sobre GAM |
| Latencia por consulta | 0,22 s | 57,6% más rápido que LightMem |
| Tiempo total del test | 334,77 s | s/d |

Si abrís el F1 por tipo de pregunta, Zero-Mem saca 66,65 en single-hop, 41,61 en multi-hop, 35,52 en temporales y 59,15 en open-domain. Las multi-hop y temporales siguen siendo las difíciles para todos, ojo, no es que Zero-Mem las resuelva de taquito. Pero gana en el promedio gastando cero tokens de memoria, que es el punto.
HotpotQA: preguntas multi-hop en contextos gigantes
En HotpotQA la prueba fue de estrés: contextos de 56K, 224K y 448K tokens, donde muchos sistemas de memoria se caen. Zero-Mem mantuvo la competitividad en los tres tamaños, con una mejora promedio de 5,52 puntos de F1 sobre el baseline más fuerte, según la versión HTML del paper.
| Contexto | F1 de Zero-Mem (GPT-4o-mini) |
|---|---|
| 56K tokens | 72,07 |
| 224K tokens | 66,43 |
| 448K tokens | 65,04 |
Fijate que el F1 baja poco entre 56K y 448K (de 72 a 65). Eso es lo relevante: el sistema no colapsa cuando el contexto se infla, que es justo donde muchos rivales pierden pie.
¿En qué se diferencia de prompt caching o de RAG?
La diferencia clave es qué hace cada uno con el modelo. El prompt caching guarda tokens ya procesados para no recalcularlos, pero seguís pasando ese contexto al LLM en cada turno. RAG recupera documentos por similitud y también se los inyecta al modelo. Zero-Mem, en cambio, saca al LLM de toda la fase de memoria: la recuperación es puramente estructural sobre el grafo y la jerarquía. Ya lo cubrimos antes en fundamentos de modelos de lenguaje.
Dicho esto, no son excluyentes. Zero-Mem se para en la capa de memoria del agente; podés seguir usando caching en el reader final si querés. Y comparte ADN con RAG en la parte de recuperación, con la diferencia de que agrega estructura relacional y temporal en vez de solo buscar por vector.
¿Qué está confirmado y qué todavía no?
Confirmado (está en el paper de arXiv, julio 2026):
- Cero tokens en memoria: las operaciones de memoria no llaman al LLM, medido contra 10 baselines.
- Los números de LoCoMO y HotpotQA: F1 59,15 promedio, 0,22 s de latencia, 57,6% de reducción de tiempo, todo con GPT-4o-mini.
- La arquitectura dual: grafo entidad-contexto más jerarquía temporal, con calibración determinista.
Todavía no está claro:
- Reproducción independiente: los resultados son del propio paper. ¿Alguien externo los replicó? Al 5 de agosto de 2026, no que se sepa. Tomalo con pinzas hasta que haya código y terceros midiendo.
- Costo real del encoder: el paper cuenta los embeddings aparte, pero no vi un desglose fino de cuánto pesa esa capa en una carga de producción sostenida.
- Frameworks soportados: no hay confirmación oficial de integración lista para LangChain, LlamaIndex u otros. Habría que ver.
Errores comunes al pensar la memoria de un agente
Creer que “memoria” es solo meter todo en el contexto. Meter el historial entero en cada prompt escala en costo de forma brutal y encima degrada la calidad cuando el contexto se llena. Zero-Mem existe justamente porque recuperar lo justo le gana a arrastrar todo.
Confundir cero tokens con cero costo. Zero-Mem no gasta tokens del LLM en memoria, pero sí corre un encoder de embeddings y mantiene estructuras de datos. Es mucho más barato, no gratis. Si alguien te vende “memoria gratis”, desconfiá.
Asumir que sirve para cualquier caso. Si tu agente responde preguntas sueltas sin historial, no necesitás nada de esto. Zero-Mem brilla en conversaciones multi-sesión y en QA sobre corpus largos. Para un chatbot sin estado, es sobreingeniería.
Deployar sin dimensionar la infra. El grafo, la jerarquía y el índice de embeddings viven en algún lado. Si vas a correr un agente con memoria persistente en producción, necesitás un servidor que banque ese almacenamiento y el cómputo del encoder; un VPS o cloud con recursos dedicados como los de donweb.com alcanza para arrancar y medir antes de escalar.
Preguntas Frecuentes
¿Qué es Zero-Mem?
Zero-Mem es un sistema de memoria para agentes LLM que no consume tokens del modelo al guardar ni al recuperar información. Guarda las trazas originales de interacción y las organiza en un grafo entidad-contexto y una jerarquía temporal. Solo el paso de responder la pregunta usa el LLM. Relacionado: avances en agentes de Google.
¿Por qué importa la memoria sin tokens en agentes IA?
Importa porque las operaciones de memoria son un costo recurrente que crece con cada interacción. Eliminarlas baja la factura de tokens (0 contra 28,6 millones de GAM en LoCoMO) y reduce la latencia a 0,22 segundos por consulta, un 57,6% menos de tiempo que el baseline más rápido.
¿Cuál es la diferencia entre Zero-Mem y prompt caching?
El prompt caching evita recalcular tokens ya procesados, pero igual se los pasás al LLM en cada turno. Zero-Mem saca al modelo de toda la fase de memoria: la recuperación es estructural sobre el grafo y la jerarquía temporal, sin generar texto ni gastar tokens hasta la respuesta final.
¿Qué resultados logró Zero-Mem en benchmarks?
En LoCoMO con GPT-4o-mini alcanzó 59,15 de F1 promedio (+5,40 sobre GAM) y 0,22 s de latencia. En HotpotQA marcó 72,07 de F1 a 56K tokens y 66,43 a 224K, con una mejora promedio de 5,52 puntos sobre el mejor rival, comparado contra 10 sistemas.
¿Se puede usar Zero-Mem en producción hoy?
Al 5 de agosto de 2026, Zero-Mem es un paper de investigación de arXiv sin reproducción independiente pública ni integración oficial confirmada con frameworks populares. Los resultados son prometedores, pero conviene esperar código verificable y mediciones de terceros antes de apoyar un sistema crítico en él.
Conclusión
Lo que cambia con Zero-Mem es dónde ponés el modelo. Durante años la memoria de los agentes fue una excusa para llamar al LLM una y otra vez, sumando costo y latencia sin que nadie lo mirara de cerca. Este paper muestra que se puede sacar al modelo de esa capa entera y mantener el rendimiento: cero tokens de memoria, 0,22 segundos por consulta y F1 competitivo contra 10 baselines.
¿Qué hacer con esto ahora? Si estás armando un agente con memoria de largo plazo, seguí el paper de cerca y esperá el código. Mientras tanto, revisá cuánto te está costando hoy la capa de memoria de tu agente (spoiler: probablemente más de lo que pensás). Ese número es el que Zero-Mem promete llevar a cero.
