Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen suponer que el modelo no contiene los hechos requeridos. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
Un nuevo estudio de investigadores de Google Research y Technion demuestra que a menudo no faltan conocimientos. El modelo contiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que en muchos casos el recuerdo, más que la codificación, es el principal cuello de botella en la exactitud de los hechos.
Al comprender cómo aprovechar el conocimiento existente mediante el cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen trasladar la evaluación de precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente evaluar si un LLM responde bien o mal a un mensaje aislado, el perfilado a nivel de hechos prueba una única pieza de información subyacente bajo múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y formulaciones, y cuánto esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codificar un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto a través de formulaciones e indicaciones variadas.
«Los fallos de codificación y recuperación son indistinguibles mediante medidas de precisión, pero implican limitaciones y soluciones diferentes», escriben los investigadores. «Las fallas de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Las fallas de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos usan lo que ya codifican».
El periódico lo ilustra con un ejemplo real: Oasis dio su primer concierto en el club Boardwalk. Dependiendo de cómo los modelos procesen esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recordatorio directo: El modelo lo codifica y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una frase estilo Wikipedia sobre los inicios de Oasis, ni responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Error de recuperación (claves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde tocó Oasis en su primer concierto?» incluso si le damos tiempo para pensar.
-
Recuerda mientras reflexionas: El hecho está codificado, pero es inaccesible a la generación directa. Solo se recuerda con éxito cuando el modelo utiliza el cálculo del tiempo de inferencia, como la cadena de pensamiento, para cerrar la brecha. Los investigadores llaman a este mecanismo facilitación del recuerdo. Es posible que el modelo no responda inicialmente a la pregunta directa. Al generar reflexiones intermedias sobre el debut del grupo en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una suposición fundamentada o razonando a partir de otros hechos codificados que conoce. Podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los 90 allí» y «el Boardwalk acogió los primeros conciertos de bandas emergentes».
Ilusiones a gran escala, recuperaciones de cola larga y de punta de lengua
Los investigadores evaluaron 13 LLM de más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos tomados de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opciones múltiples.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no lograron recordar directamente entre el 26% y el 34% de estos hechos codificados sin sentido.
El pensamiento inferencial basado en el tiempo actúa como un mecanismo de recuperación vital. Al proporcionar a los modelos un esfuerzo computacional adicional se recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como rastrear mentalmente el contexto, en última instancia ayuda a recordar información.
Aumentar el tamaño del modelo no resuelve automáticamente esta discrepancia. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros reducía las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más hechos, más conocimientos quedan atrapados en un estado “codificado pero inaccesible”. La mayor parte de los errores del modelo van desde datos faltantes hasta fallas en la recuperación.
«Nuestros resultados sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas se desvían de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos han demostrado que los hechos raros se codifican a velocidades similares a los hechos populares. Sin embargo, encontraron una brecha significativa en la memorabilidad entre los hechos de cola larga y los hechos muy populares, que supera el 25% para los modelos de frontera.
De manera similar, los modelos tienen dificultades para generar respuestas a preguntas invertidas (es decir, preguntar sobre el sujeto en lugar de sobre el objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó su primer show en el club Boardwalk, pero no responder quién tocó su primer show en ese mismo club. Al mismo tiempo, los mismos modelos muestran que conocen la respuesta correcta cuando se les hace la misma pregunta en forma de opción múltiple.
«Si bien estos fallos a menudo se interpretan como limitaciones en la memorización o la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso si no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas de recuerdo en lugar de ‘conocimientos perdidos'».
El ROI de la reflexión y consejos para desarrolladores
Las altas tasas de codificación de los modelos de límites requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada falla factual como un problema de recuperación: La respuesta empresarial predeterminada a las alucinaciones suele ser implementar generación de recuperación aumentada (AGR), escalar bases de datos vectoriales o ingerir más documentos de dominio. Aunque es necesario para actualizaciones en tiempo real o datos faltantes, este estudio muestra que hasta el 95-98% de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40 y el 65 por ciento de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos enrutando dinámicamente condiciones difíciles, como entidades raras o preguntas invertidas, a modelos de reflexión.
Pruebe el acceso semántico, no solo la precisión: Las medidas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes formulaciones, contextos y direcciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y reintento de consultas: Dado que el recuerdo depende en gran medida del contexto, la formulación de las consultas es decisiva para el éxito. Cambiar la estructura de un mensaje, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que los mensajes directos pasan por alto.
Limitaciones y conclusiones
El punto de referencia WikiProfile se basa en hechos enciclopédicos de Wikipedia. Es posible que estos resultados no sean perfectamente generalizables a dominios comerciales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica empresarial interna de nicho puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
La creación de perfiles completos de un modelo de límites en la suite WikiProfile cuesta alrededor de 500 dólares. Los desarrolladores pueden reducir significativamente este costo omitiendo variaciones de opción múltiple o utilizando menos respuestas de muestra por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en Hugging Face para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para repararla.












































































