La mayoría de los canales RAG empresariales comienzan de la misma manera: un analizador de texto convierte páginas web y documentos en texto sin formato para que puedan fragmentarse e indexarse para su recuperación. Ese paso de conversión destruye las señales de recuperación y, según una nueva investigación, es responsable de la mayoría de las respuestas incorrectas.
Un equipo de investigación de UC Berkeley, Princeton University, EPFL y Databricks publicó un artículo esta semana que presenta PixelRAG, un sistema que omite esa conversión por completo. En lugar de analizar las páginas en texto, PixelRAG las presenta como capturas de pantalla, indexa esas imágenes y envía los mosaicos recuperados directamente a un lector de modelos de lenguaje visual. Probado en 30 millones de mosaicos de capturas de pantalla que cubren toda Wikipedia, supera al RAG basado en texto en seis puntos de referencia, mejorando la precisión hasta en un 18,1 % con respecto a las líneas de base basadas en texto.
Según el equipo de investigación, los analizadores son el lugar equivocado para buscar soluciones.
«Mejorar los analizadores es un proceso interminable porque cada sitio web requiere un manejo especial», dijo a VentureBeat Yichuan Wang, autor principal y estudiante de doctorado de UC Berkeley. «Nuestro objetivo era explorar si los avances recientes en VLM permiten evitar todo ese problema y construir un sistema de recuperación que funcione en todos los sitios web sin ingeniería específica del sitio».
Los analizadores HTML destruyen las señales de recuperación de las que depende el RAG empresarial
El objetivo de los investigadores era desarrollar una arquitectura limpia de extremo a extremo.
«Los canales RAG web modernos a menudo implican renderizado, análisis, limpieza, fragmentación y muchas otras etapas artesanales», dijo Wang. «Cada etapa introduce posibles errores en cascada y abstracciones que nos alejan más de la página web original. Estábamos interesados en saber si podíamos eliminar la mayor parte de esa complejidad y operar directamente en la página renderizada».
Wang también señaló que al analizar inevitablemente se pierde información. Las imágenes, la jerarquía visual, la tipografía, el énfasis (por ejemplo, texto en negrita), las tablas y el diseño se descartan o se convierten en aproximaciones textuales imperfectas.
«No importa lo bueno que sea un analizador, fundamentalmente parte de la información se pierde durante la conversión», dijo.
La investigación identifica tres formas en que RAG basado en texto pierde la respuesta antes de llegar al lector. Los tres se midieron en SimpleQA, un punto de referencia estándar de 1000 preguntas objetivas de Wikipedia:
-
Pérdida del analizador (36,6% de las fallas). La conversión de HTML a texto destruye el contenido estructurado de manera tan completa que ningún fragmento de texto del corpus contiene la respuesta.
-
Pérdida de rango (55,2% de los fallos). La respuesta existe en el corpus, pero es superada por cuadros de información llenos de palabras clave que llegan al puesto 1 para el 75,9% de las consultas, lo que lleva a los párrafos que contienen respuestas al puesto 20 o menos.
-
Pérdida de lectores (8,2% de los fallos). El contenido correcto llega al lector, pero la estructura aplanada provoca una atribución errónea.
Cómo funciona PixelRAG
A diferencia de un LLM estándar que solo lee texto, un modelo de lenguaje visual toma imágenes como entrada junto con el texto, lo que significa que puede leer una página web renderizada como lo hace un humano, con el diseño y la estructura intactos. «Para muchas tareas de extracción de información estructurada, creemos que los VLM modernos tienen una ventaja inherente porque pueden razonar conjuntamente sobre el contenido y el diseño en lugar de depender de una representación de texto aplanado», dijo Wang.
PixelRAG se basa en ese principio, reemplazando el proceso de análisis de texto con un sistema de cuatro etapas que opera completamente en capturas de pantalla renderizadas.
-
Representación. Las páginas se procesan utilizando Playwright, una biblioteca de automatización del navegador, en una ventana gráfica fija de 875 píxeles y se dividen en mosaicos de 1024 píxeles de alto. Los 7 millones de artículos de Wikipedia producen aproximadamente 30 millones de mosaicos. Los activos se almacenan en caché localmente y se muestran completamente fuera de línea.
-
Indexación. Cada mosaico se codifica como un único vector de 2048 dimensiones utilizando Qwen3-VL-Embedding-2B y se almacena en un índice de vecino más cercano aproximado de FAISS. El índice completo ocupa aproximadamente 120 GB en fp16 y admite actualizaciones incrementales sin necesidad de volver a indexar por completo.
-
Capacitación. El modelo de recuperación se ajusta a partir de datos sintéticos contrastantes generados a partir del almacén de datos, utilizando minería dinámica de negativos duros para filtrar falsos negativos. LoRA, un método ligero de ajuste fino que actualiza una pequeña fracción de los pesos del modelo, se aplica tanto a la columna vertebral del modelo de lenguaje como al codificador visual. El entrenamiento con aproximadamente 40.000 pares se completa en menos de tres horas con un solo H100.
-
Almacenamiento. Los mosaicos de capturas de pantalla sin procesar para Wikipedia requieren 5,6 TB, pero un enfoque de renderizado bajo demanda elimina el almacenamiento persistente: incruste todos los mosaicos, elimine las capturas de pantalla y vuelva a renderizar las páginas bajo demanda en el momento de la consulta. El índice vectorial requiere aproximadamente 120 GB.
Seis puntos de referencia, ahorros de tokens de agente 10 veces mayores y un problema sin resolver
Los investigadores probaron PixelRAG en seis puntos de referencia que abarcan el control de calidad de Wikipedia, consultas basadas en tablas, control de calidad multimodal y recuperación de noticias en vivo. Dijeron que superó a RAG basado en texto en los seis, incluso en tareas en las que las preguntas se pueden responder únicamente con texto. En SimpleQA alcanza una precisión del 78,8 % frente al 71,6 % del analizador de texto más potente, ampliándose al 48,8 % frente al 42,5 % en consultas de tablas estructuradas. Los equipos necesitan modelos de clase Qwen3-VL-4B o superior para ver el beneficio. Los modelos más pequeños están a la zaga de la recuperación de texto en más de 12,5 puntos porcentuales.
La ventaja del costo del agente es el argumento más sólido a corto plazo para PixelRAG. En las pruebas comparativas, un agente de IA que utilizaba PixelRAG como motor de búsqueda ejecutó 3,6 millones de tokens de aviso frente a 37,5 millones para la recuperación de texto, a un costo de 2 a 4 veces menor que las alternativas, incluido Google, y al mismo tiempo logró una mayor precisión. La compresión de imágenes puede reducir ese presupuesto simbólico en un tercio más.
La fragmentación visual es el principal problema sin resolver. Los sistemas RAG basados en texto han pasado años perfeccionando la forma de dividir documentos en unidades de recuperación significativas según el tema, la sección o el contenido semántico. PixelRAG actualmente no tiene equivalente: divide las páginas según una altura de píxel fija, lo que significa que una tabla o un párrafo se puede cortar por la mitad sin tener en cuenta los límites del contenido.
«La comunidad de recuperación de textos ha pasado años estudiando estrategias de fragmentación, mientras que la recuperación visual ha recibido mucha menos atención», dijo Wang. «Creemos que esta es un área importante para futuras investigaciones».
Transformación VB · 14 y 15 de julio · Menlo Park · Capas de contexto agentes
Sus agentes son tan buenos como los datos a los que pueden acceder.
Las sesiones en Transform cubren las arquitecturas RAG que impulsan los sistemas de agentes a escala, incluida cómo las empresas conectan agentes con datos genómicos, clínicos y empresariales en vivo.
Qué significa esto para las empresas
El problema de calidad de recuperación que aborda PixelRAG refleja un cambio más amplio del mercado que ya está en marcha. VB Pulse Q1 2026 Los datos de encuestados empresariales calificados encontraron que la intención de adoptar la recuperación híbrida se triplicó del 10,3% en enero al 33,3% en marzo, la posición estratégica de más rápido crecimiento en el conjunto de datos. Los propios autores de PixelRAG señalan la implementación híbrida como el camino más práctico a corto plazo: superponer la recuperación visual a los sistemas de texto existentes en lugar de reemplazarlos.
Para los equipos que ya ejecutan oleoductos RAG, el camino hacia esos ahorros es más sencillo que una reconstrucción desde cero.
«Un camino práctico es utilizar PixelRAG como una capa de mejora junto con los sistemas de recuperación de texto existentes», afirmó Wang. «La recuperación híbrida que combina búsqueda de texto y visual es sencilla y es probable que evolucionen en muchas implementaciones de producción».
Suscríbete y recibe las historias más importantes del día.
Al suscribirte aceptas nuestros términos y condiciones y política de privacidad.










































































