Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.
Cuando los modelos de lenguaje grande (LLM) tienen alucinaciones, los desarrolladores suelen asumir que el modelo carece de los datos necesarios. Los equipos de ingeniería diagnostican el error como falta de conocimiento. La respuesta estándar es aumentar el tamaño del modelo, ampliar los datos de entrenamiento o crear arquitecturas de recuperación complejas.
A nuevo estudio por investigadores de Google Research y Technion demuestra que el conocimiento a menudo no falta. El modelo tiene la información codificada paramétricamente pero no la muestra durante la generación.
Sus experimentos muestran que los modelos de frontera como GPT-5 y Gemini-3 codifican entre el 95 y el 98% de los hechos probados. Esto indica que, en muchos casos, recordar, más que codificar, es el principal obstáculo para la exactitud de los hechos.
Al comprender cómo desbloquear el conocimiento existente a través del cálculo del tiempo de inferencia, los equipos de ingeniería pueden crear aplicaciones más confiables sin depender necesariamente de modelos más grandes o bases de datos externas.
Perfiles de conocimiento: medir lo que los modelos realmente saben
Para mapear esta brecha entre el almacenamiento y la recuperación, los investigadores proponen cambiar el enfoque de la evaluación de la precisión a nivel de preguntas a la elaboración de perfiles a nivel de hechos. En lugar de simplemente calificar si un LLM responde bien o mal a una pregunta aislada, el perfilado a nivel de hechos prueba una única pieza de información subyacente en múltiples condiciones, evaluando si el hecho está almacenado en los parámetros del modelo, si se puede consultar desde diferentes direcciones y frases, y qué esfuerzo computacional se requiere para recuperarlo.
Este marco distingue entre si un hecho está «codificado» paramétricamente y si es «conocido». un modelo codifica un hecho si puede reproducirlo con precisión cuando se prepara con su contexto de entrenamiento original. un modelo sabe un hecho si puede responder de manera confiable preguntas al respecto en diversas frases e instrucciones.
«Los fallos de codificación y recuperación son indistinguibles según las métricas de precisión, pero implican diferentes limitaciones y soluciones», escriben los investigadores. «Los fallos de codificación requieren intervenciones previas al entrenamiento, como escalar el tamaño del modelo o la cobertura de datos. Los fallos de recuperación sugieren intervenciones posteriores al entrenamiento que a menudo mejoran la forma en que los modelos utilizan lo que ya codifican».
El artículo ilustra esto usando un dato de muestra: Oasis dio su primer concierto en el club Boardwalk. Según cómo los modelos procesan esta información, el estudio clasifica el conocimiento en cinco perfiles distintos:
-
Recuerdo directo: El modelo codifica el hecho y accede fácilmente a él para responder preguntas directas sin cálculos de inferencia adicionales.
-
Fallo de codificación (estanterías vacías): El modelo no codifica ni conoce el hecho. No puede completar una oración al estilo Wikipedia sobre los primeros días de Oasis, ni puede responder preguntas sobre el evento. Esto indica la necesidad de más datos previos al entrenamiento o una mayor capacidad del modelo.
-
Fallo de recuperación (llaves perdidas): El modelo tiene el hecho codificado pero no puede acceder a él. Puede completar sin problemas el texto de capacitación original sobre Oasis, pero no responde «¿Dónde dio Oasis su primer show?» incluso cuando se le da tiempo para pensar.
-
Recuerde pensando: El hecho está codificado, pero es inaccesible a la generación directa. Sólo se recupera con éxito cuando el modelo utiliza cálculos de tiempo de inferencia, como Cadena de Pensamiento, para cerrar la brecha. Los investigadores se refieren a este mecanismo como facilitación del recuerdo. Inicialmente, el modelo podría no responder a la pregunta directa. Al generar pensamientos intermedios sobre la historia temprana de la banda en Manchester, se prepara estructuralmente para localizar y recordar la respuesta bloqueada.
-
Inferencia sin codificación: El modelo nunca codificó explícitamente el hecho de Oasis. En cambio, responde con éxito a la pregunta haciendo una conjetura fundamentada o razonando sobre otros hechos codificados que sí conoce. Se podría deducir la respuesta encadenando puntos de datos separados, como «Oasis se formó en Manchester», «el Boardwalk era un famoso club de música de los años 90 allí» y «el Boardwalk albergó los primeros conciertos de bandas emergentes».
Ilusiones en escala, colas largas y recuperaciones en la punta de la lengua
Los investigadores evaluaron 13 LLM en más de 4 millones de respuestas. Utilizaron WikiProfile, un punto de referencia que contiene 2150 datos extraídos de Wikipedia, probando cada hecho en formatos que van desde la finalización exacta del contexto hasta la verificación de opción múltiple.
Para modelos de vanguardia como GPT-5 y Gemini-3, la codificación está cerca de la saturación. Estos modelos codifican con éxito entre el 95% y el 98% de los hechos probados. Sin embargo, todavía no logran recordar directamente entre el 26% y el 34% de los hechos codificados sin pensar.
El pensamiento en tiempo de inferencia actúa como un mecanismo de recuperación vital. Proporcionar a los modelos un esfuerzo computacional adicional recupera con éxito entre el 40% y el 65% de los hechos codificados que los modelos inicialmente no recuerdan directamente. Los investigadores comparan esto con el estado humano de punta de la lengua, donde el esfuerzo deliberado, como volver sobre el contexto mentalmente, eventualmente ayuda a recordar la información.
Ampliar el tamaño del modelo no resuelve automáticamente esta brecha. Por ejemplo, descubrieron que escalar el modelo Gemma3 de mil millones a 27 mil millones de parámetros redujo las fallas de codificación del 85% al 23%. Pero al mismo tiempo, la proporción de errores de recuperación aumentó, alcanzando un máximo del 40% sin pensar.
Esto sugiere que el escalado resuelve principalmente el problema de almacenamiento más que el problema de acceso. A medida que el modelo memoriza muchos más datos, una mayor cantidad de conocimientos queda atrapado en un estado «codificado pero inaccesible». La mayor parte de los errores del modelo van desde datos faltantes hasta recuperaciones fallidas.
«Nuestros hallazgos sugieren que el recuerdo está estrechamente relacionado con las condiciones bajo las cuales se aprendieron los hechos, degradándose cuando las consultas divergen de los patrones de tiempo de entrenamiento», escriben los investigadores. La forma en que un usuario hace una pregunta determina directamente si el modelo puede desbloquear la respuesta almacenada.
Por ejemplo, los experimentos demostraron que los hechos raros se codifican a velocidades similares a las de los hechos populares. Sin embargo, encontraron una gran brecha de recuerdo entre hechos de cola larga y hechos muy populares que supera el 25% para los modelos fronterizos.
De manera similar, los modelos luchan por generar respuestas a preguntas inversas (es decir, preguntando por el sujeto en lugar del objeto). Por ejemplo, un modelo podría responder fácilmente que Oasis tocó en su primer concierto en el club Boardwalk, pero no responde quién tocó en su primer concierto en ese mismo club. Al mismo tiempo, los mismos modelos demuestran que conocen la respuesta correcta cuando se les presenta la misma pregunta en formato de opción múltiple.
«Mientras que estos fallos a menudo se interpretan como limitaciones de la memorización o de la codificación bidireccional, nuestros resultados sugieren una imagen diferente: los hechos raros a menudo están codificados pero son inaccesibles, y los hechos inversos pueden reconocerse incluso cuando no pueden generarse», escriben los investigadores. «Esto replantea ambos fenómenos como fallas en la recuperación en lugar de ‘conocimientos perdidos'».
El retorno de la inversión del pensamiento y consejos para desarrolladores
Las altas tasas de codificación de los modelos de frontera requieren un cambio en la forma en que los desarrolladores abordan la factualidad y la arquitectura de canalización.
No trate cada error factual como un problema de recuperación: La reacción empresarial predeterminada ante las alucinaciones suele ser implementar la generación de recuperación aumentada (RAG), ampliar las bases de datos vectoriales o ingerir más documentos de dominio. Si bien es necesario para actualizaciones en tiempo real o datos totalmente ausentes, este estudio muestra que entre el 95 y el 98 % de los datos estándar ya están codificados paramétricamente. Muchas fallas se pueden recuperar sin recuperación externa.
Utilice el razonamiento en tiempo de inferencia de forma selectiva: El pensamiento recuperó entre el 40% y el 65% de los hechos codificados que los modelos no pudieron recordar directamente. Sin embargo, pensar es computacionalmente costoso. Una arquitectura práctica implica una llamada rápida al modelo de primer paso, seguida de un reintento con un mayor esfuerzo de razonamiento cuando la confianza es baja. Los equipos pueden optimizar los costos dirigiendo dinámicamente condiciones desafiantes, como entidades raras o preguntas inversas, a modelos de pensamiento.
Pruebe el acceso semántico, no solo la precisión comparativa: Las métricas de precisión estándar enmascaran las capacidades subyacentes del modelo. Los conjuntos de evaluación deben investigar el mismo hecho subyacente en diferentes frases, contextos e instrucciones para comprender verdaderamente lo que sabe un modelo versus lo que puede acceder de manera confiable.
Aproveche la reformulación y los reintentos de consultas: Dado que el recuerdo depende en gran medida del contexto, el encuadre de la consulta determina el éxito. Cambiar la estructura de una indicación, generar un contexto intermedio relevante o hacer que el modelo genere una cadena de razonamiento antes de responder son mecanismos de confiabilidad legítimos que sacan a la luz información que las indicaciones directas pasan por alto.
Limitaciones y conclusiones prácticas
El punto de referencia WikiProfile se basa en datos enciclopédicos de Wikipedia. Es posible que estos hallazgos no se generalicen perfectamente a dominios empresariales propietarios o altamente especializados. La capacidad de un modelo para almacenar y recuperar una métrica interna de la empresa puede comportarse de manera diferente a su manejo de datos enciclopédicos públicos.
Crear un perfil completo de un modelo de frontera en la suite WikiProfile cuesta aproximadamente $500. Los desarrolladores pueden reducir significativamente este costo omitiendo variantes de opción múltiple o utilizando menos muestras de respuestas por pregunta.
Los equipos pueden acceder al punto de referencia WikiProfile en abrazando la cara para evaluar sus propios sistemas y crear perfiles de conocimiento personalizados. Identificar si una aplicación empresarial sufre estantes vacíos o claves perdidas es el primer paso para solucionarlo.












































































