Presentado por MongoDB
Llevamos unos 60 años creando bases de datos como industria. Hemos estado creando agentes de IA, en la forma que la mayoría de la gente escucha cuando dice la palabra hoy, durante aproximadamente 18 meses.
Siéntese con esta proporción por un segundo, porque explica casi todo sobre el estado actual del desarrollo de agentes. Seis décadas versus un año y medio. No estamos en medio de esta curva de aprendizaje. Estamos abajo, entrecerrando los ojos.
Aún no existe una pila LAMP para agentes. No existe un conjunto de opciones predeterminadas aburridas y establecidas que permitan a un equipo dejar de cuestionar la arquitectura y simplemente realizar el envío.
Una de las primeras lecciones provino de la breve obsesión de la industria por la maximización de tokens. Durante un tiempo, a principios de 2026, el consumo de tokens se convirtió en una métrica vanidosa. La reacción fue rápida. El volumen de tokens mide la actividad, no los resultados.
Pero la parte interesante de la historia del token-maxxing nunca fue el teatro en el lugar de trabajo. Esta fue la lección arquitectónica escondida debajo.
El pop-up es el recurso escaso
El siguiente es un resumen de lo que aprendí de más de 100 conversaciones con clientes en 15 ciudades de seis países durante la primera mitad de 2026. Veo que las organizaciones comienzan a converger en la misma conclusión: la ventana emergente es el recurso escaso. El desafío no es meter más información en cada mensaje. Se trata de decidir qué debería estar ahí en primer lugar.
Esta pregunta tiene una respuesta. La respuesta es la memoria.
No es un sistema de memoria real, persistente y con capacidad de búsqueda que se sitúa fuera del modelo y lo alimenta deliberadamente.
La respuesta es la memoria, y va más allá del corto y largo plazo
Un buen agente de memoria hace tres cosas que la ventana emergente por sí sola no puede:
-
Registra lo que el modelo generativo produjo en bucles y sesiones anteriores, de modo que el costoso razonamiento por el que ya has pagado no se evapore al final de la sesión.
-
Aplica control de acceso basado en roles a este contenido grabado, de modo que una tienda creada por un equipo pueda compartirse en toda una organización sin revelar cosas que no debería.
-
Permite que nuevas consultas recuperen el contenido anterior correcto, lo que en la práctica significa que está respaldado por búsqueda semántica en lugar de búsqueda de coincidencia exacta, porque los agentes solicitan cosas por significado y no por clave.
Este último punto es el vínculo con los 60 años de observación de bases de datos. Hemos pasado seis décadas volviéndonos extremadamente buenos en el almacenamiento y recuperación de datos estructurados según criterios específicos. La memoria agente necesita algo diferente y más nuevo: la capacidad de almacenar el resultado no estructurado de un proceso generativo y recuperarlo por similitud.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Los equipos que construyen esto bien son aquellos cuya plataforma de datos puede realizar búsquedas semánticas de forma nativa, aplicarle control de acceso y mantener el contenido generado en un solo lugar, en lugar de, con suerte, unir tres sistemas.
El modelo que está surgiendo en las empresas
Una vez que se tiene esa memoria, surge una arquitectura realmente interesante y veo que cada vez más empresas convergen hacia ella.
Se combina el potente sistema de memoria con un modelo más ligero, a menudo de peso reducido, cuyo trabajo no es ser brillante sino ser un buen juez. Llega una nueva solicitud. El agente realiza una búsqueda semántica en la memoria, reclasifica para obtener la mejor respuesta candidata y formula una única pregunta al modelo más simple: ¿basta con regresar tal cual o no?
Si es lo suficientemente bueno, lo devuelves. Nunca pagaste nada por el costoso modelo generativo. Respondiste de memoria.
Si eso no es suficiente, pasa al modelo generativo más caro, obtiene una solución original, la devuelve y luego la guarda en el mismo sistema de memoria para que la siguiente sesión tampoco tenga que pagar por ella.
Piense en lo que esto le hace a la economía agencial con el tiempo. Cada respuesta original producida por el modelo caro se convierte en una respuesta barata la próxima vez que alguien necesite algo similar. El sistema se vuelve más barato y más rápido cuanto más se usa, lo cual es lo opuesto a cómo se escala el ingenuo token-maxxing, donde el costo aumenta linealmente con el uso para siempre. Es la diferencia entre un agente que aprende lo que ya sabe y uno que redirige el universo con cada bucle.
La memoria tiene tipos y el ser humano selecciona los mejores
El elemento final, y el que creo que separa hacia dónde nos dirigimos de dónde estamos ahora, es que la memoria agencial madura no será un cubo plano de corto y largo plazo. Tendrá tipos, como los tiene la memoria humana.
La memoria taxonómica contiene la terminología, el vocabulario controlado y las definiciones con las que opera una organización, por lo que el agente utiliza «contracargo» para referirse a lo que su equipo financiero quiere decir con él y no a lo que significa Internet en su conjunto.
La memoria procedimental contiene listas y secuencias de tareas; el conocimiento de cómo hacemos esto aquí convierte a un modelo competente en un colega útil. Habrá más tipos que estos, y determinar la taxonomía correcta de los tipos de memoria es en sí mismo parte de la curva de aprendizaje que ascendemos.
Y aquí está la parte que debería resultarle familiar a cualquiera que haya manejado un sistema de producción real: los mejores recuerdos a menudo terminan allí porque un ser humano los puso allí. No vale la pena conservar todos los recuerdos generados por un agente, y no vale la pena rehacer todos los recuerdos conservados primero.
Cada vez más, espero ver humanos organizando estos sistemas, reinyectando recuerdos de alto valor para su reutilización frecuente, eliminando el ruido y promoviendo la secuencia de procedimientos que funciona sobre los tres que funcionan en su mayoría. Hicimos esto para las bases de conocimiento. Hicimos esto para la documentación. Haremos esto para la memoria agente, porque la curación es la forma en que un corpus deja de ser un basurero y comienza a ser un activo.
¿Qué viene después?
Llevamos 18 meses, más o menos, en los agentes y 60 años en las bases de datos. La discrepancia entre estas dos cifras no es algo de lo que deba avergonzarse. La verdad es que es temprano y debería hacernos humildes respecto de cada «mejor práctica» que apenas tiene una temporada.
Token-maxxing fue la primera gran idea que surgió y cayó en este nuevo campo, y su caída nos enseñó la lección en este campo tan necesario: la ventana emergente es rara, por lo que la disciplina es elegir lo que hay allí. Esta disciplina es la memoria agente. Una memoria mecanografiada, curada por humanos, basada en búsquedas semánticas y con acceso controlado que registra lo que fue costoso de producir y lo sirve a bajo costo para siempre.
Todavía no existe una pila LAMP para agentes. Pero si tuviera que apostar a qué capa se convierte primero en la opción aburrida, predeterminada y establecida, sobre la que dejamos de discutir para poder empezar a construir de nuevo, apostaría a la memoria. Este es el próximo avance en el desarrollo de agentes. Todo lo demás todavía está cableado a mano en CGI-BIN.
Pete Johnson es director de tecnología de campo e inteligencia artificial en MongoDB.
Los artículos patrocinados son contenidos producidos por una empresa que paga por la publicación o tiene una relación comercial con VentureBeat y siempre están claramente marcados. Para más información, póngase en contacto ventas@venturebeat.com.













































































