Las arquitecturas RAG son buenas en una cosa: mostrar documentos semánticamente relevantes. Ahí es también donde se detienen.
Un marco llamado gráfico de contexto de decisión aborda esa brecha al brindar a los agentes una memoria estructurada, un razonamiento consciente del tiempo y una lógica de decisión explícita. Ondulaciónuna startup del ecosistema Neo4j, ha creado uno. La capacidad clave: agentes no regresivos, capaces de congelar secuencias de acciones validadas y combinarlas con el tiempo.
«El punto clave que se desea es la no regresividad: ¿cómo se puede garantizar que, cuando el agente genere algo nuevo, se puedan complementar los descubrimientos anteriores?» dijo Yann Bilien, cofundador y director científico de Rippletid.
Por qué RAG no llega lo suficientemente lejos
El contexto empresarial se extiende a través de herramientas de ERP, registros, bases de datos, almacenes de vectores y documentos de políticas. Las herramientas de IA generativa pueden recuperarlo todo (mediante búsquedas de palabras clave, consultas SQL o canalizaciones RAG completas), pero la recuperación tiene un límite.
En particular, los datos recuperados pueden no ser relevantes para la decisión en cuestión (provocando así alucinaciones); e incluso si los agentes obtienen los datos correctos, a menudo carecen de orientación para tomar decisiones respaldadas por una justificación sólida.
Es decir, RAG recupera documentos, no contexto de decisión. «Todos comienzan con RAG: extraiga los documentos relevantes, colóquelos en el mensaje y deje que el modelo lo resuelva», dijo Wyatt Mayham de Consultoría de IA del noroeste.
Si bien eso funciona bien para los chatbots, “se rompe inmediatamente” para los agentes que necesitan tomar decisiones y acciones, señaló. «Lo más importante con lo que luchan los constructores es la brecha entre recuperación y aplicabilidad».
Un documento recuperado no le dice al agente si todavía se aplica, si ha sido reemplazado o si hay una regla conflictiva que tiene prioridad, dijo Mayham. «Los agentes necesitan un contexto de decisión, no sólo información».
En la construcción (el mundo humano), eso podría significar saber que una excepción de precios expiró, que una política de seguridad solo se aplica en ciertas jurisdicciones o que un procedimiento operativo estándar se actualizó un mes antes. “Si te pierdes algo de eso, el agente seguramente hará lo incorrecto”, dijo Mayham.
Sin un contexto de decisión estructurado, los agentes combinan reglas incompatibles, inventan restricciones para llenar vacíos y se basan en lo que Bilien llama «conjeturas probabilísticas sobre datos ilimitados». Los errores son difíciles de reproducir porque los constructores no pueden rastrear por qué el agente tomó una decisión determinada.
El problema del error compuesto también es real, afirmó Mayham: una pequeña tasa de errores por paso se vuelve “catastrófica” en un flujo de trabajo de varios pasos. «Esa es la razón principal por la que la mayoría de los agentes empresariales nunca abandonan la fase piloto».
Cómo los gráficos de contexto de decisión llegan a la respuesta relevante
Un gráfico de contexto de decisión resuelve esto codificando un mapa estructurado de lo que es aplicable, cuáles son las reglas y cuándo se aplican.
El marco está optimizado para una pregunta: «Dada esta situación, ¿qué contexto se aplica en este momento?» El tiempo se trata como una dimensión de primera clase; cada regla, decisión y excepción tiene su alcance cuando es válida.
“El objetivo es abordar explícitamente los datos faltantes, incoherentes o contradictorios al construir el gráfico para evitar problemas probabilísticos. [errors] una vez que el agente está en ejecución”, dijo Bilien.
El sistema se basa en tres principios:
-
Aplicabilidad: La lógica está codificada explícitamente para que el agente sepa qué reglas recordar y aplicar en una situación determinada. El contexto se devuelve sólo cuando es relevante para la situación.
-
Memoria consciente del tiempo: Cada regla, decisión y excepción tiene un alcance temporal. Esto permite a los agentes razonar sobre «lo que era cierto entonces versus lo que es cierto ahora» y luego reproducir o explicar sus decisiones.
-
Rutas de decisión: El sistema puede explicar cómo llegó de A a B y el «por qué» detrás de su justificación (por ejemplo, por qué se incluyó una parte del contexto y otra no). Los agentes reciben ejemplos de «ruta de decisión» de cómo se manejaron casos similares antes.
En la configuración, los datos no estructurados se incorporan y estructuran en una ontología: qué entidades existen, qué reglas se aplican, qué se considera una excepción. La IA neurosimbólica maneja el reconocimiento de patrones y codifica la lógica formal legible por máquina. Con el tiempo, el sistema perfecciona su base de conocimientos a medida que se toman nuevas decisiones.
«La neurosimbólica consta de dos partes: una parte neuronal que otorga una gran autonomía a los agentes y una parte simbólica para reducir la cantidad de datos necesarios y brindar control», dijo Bilien.
El agente se prueba en el momento de la compilación (preproducción) para validar su comportamiento o identificar mejoras. Esto reduce los riesgos y las necesidades de cálculo durante la inferencia, señaló.
Los agentes aprenden, en lugar de retroceder
Cuando se trata de no regresión, la pieza clave es la combinación tanto de inteligencia (modelos) como de conocimiento (compartido entre agentes), dijo Bilien. Es importante que los agentes puedan explorar; cuando no saben cómo realizar una tarea, pueden intentar diferentes posibilidades, normalmente en un entorno controlado o en una simulación (como un robot de soporte que prueba múltiples patrones de respuesta).
Luego, “una vez que una solución se evalúa como satisfactoria, el gráfico congela esa secuencia de acciones”, dijo Bilien. Luego, la exploración futura comienza a partir de esta “base estable de conductas validadas” para evitar que las habilidades recién adquiridas sobrescriban las buenas conductas aprendidas anteriormente.
Antes de que un agente actúe o afecte a un cliente, verifica el gráfico: ¿está violando una regla? ¿Alucinando? ¿Mantenerse dentro de las limitaciones? ¿Puede generalizar la solución en casos similares?
A nivel macro, el sistema evalúa los resultados: ¿Mejoró el comportamiento el desempeño a largo plazo? ¿Se generalizó en contextos similares? ¿Conservó capacidades anteriores?
«Este determinismo es clave para que los agentes puedan ejecutar la confiabilidad a escala», dijo Bilien. Conduce a un comportamiento más consistente, predecible, explicable y que permite un mayor control y auditabilidad.
«Lo que quieres es que tus agentes puedan aprender por sí mismos cuando se enfrentan a algo que no saben», dijo. «Quieres que puedan explorar y encontrar nuevas soluciones».
Más allá de la memoria «episódica»
Si bien el equipo inicialmente asumió que implementaría RL en todas partes, «eso en realidad resultó muy difícil en un entorno empresarial», dijo Bilien. «Los datos son escasos para algunos casos de uso específicos y confusos para otros».
Normalmente, utilizar datos sin procesar para predicciones confiables ha sido un desafío manual y que requiere mucho tiempo, pero «ahora con los agentes entramos en una nueva era en la que es posible crear ontologías automáticamente», dijo Bilien.
Los métodos clásicos de ajuste supervisado pueden provocar oscilaciones, cuando los modelos olvidan la última habilidad que aprendieron mientras aprenden el siguiente tono. En general, el aprendizaje no es complejo, la compresión es “dramática” y los modelos mejoran “episódicamente” en lugar de continuamente, lo que los lleva a fallar continuamente en tareas nuevas o invisibles.
Como señaló Bilien: «Nunca tendrás un modelo de autoaprendizaje completo si retrocedes cada vez».
En los casos de uso empresarial, como la banca, donde se procesan millones de transacciones al día, un alto nivel de confiabilidad es fundamental, señaló. «Una pregunta que hago a todos los clientes: ¿Es suficiente el 95 %? En muchos casos de uso, no lo es. Se necesita el 99,999 %. Un descuento del 1 % es demasiado».
Los gráficos de contexto de decisión pueden cerrar esa brecha, sostiene: cuando se hace repetidamente la misma pregunta de atención al cliente, el agente devolverá una respuesta “satisfactoria” de manera predecible y sin regresión, todo ello manteniendo la autonomía.
Codificar la aplicabilidad y la validez temporal en un gráfico estructurado, en lugar de depender de un LLM para inferirlo, es un «enfoque sólido» para una limitación real en los marcos de recuperación existentes, dijo Mayham. La pregunta abierta es si la generación automática de ontologías resiste los datos diversos y desordenados que las empresas realmente tienen. «Esa es siempre la parte difícil», dijo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.















































































