El web scraping ya no será lo mismo: Presentando PixelRAG
El web scraping ya no será lo mismo: Presentando PixelRAG
PixelRAG es un marco de recuperación de código abierto que utiliza imágenes de páginas en lugar de análisis HTML tradicionales.
PixelRAG es un marco de recuperación de código abierto que utiliza imágenes de páginas en lugar de análisis HTML tradicionales.
Según los desarrolladores, los pipelines tradicionales de HTML a texto pueden perder más del 40% del contenido de la página, incluyendo tablas, gráficos y elementos de marcado. PixelRAG opera sobre el documento tal como se renderiza para el usuario.
Cómo Funciona el Pipeline:
- Renderiza cada documento (páginas web, PDFs, imágenes) en un conjunto de mosaicos.
- Crea embeddings utilizando Qwen3-VL-Embedding, ajustado finamente a través de LoRA en capturas de pantalla.
- Construye un índice FAISS y proporciona una API para la búsqueda.
Al reemplazar el modelo lector por uno más potente, la precisión puede aumentar sin necesidad de reindexar, ya que el índice solo retiene píxeles.
Para experimentos, el equipo del proyecto creó un índice visual de toda Wikipedia: más de 30 millones de capturas de pantalla. Como resultado, incluso en este formato, el sistema supera la mejor línea base RAG basada en texto en un 18.1% en tareas de preguntas y respuestas solo con texto.
También se ha presentado un complemento para Claude Code, que permite analizar páginas renderizadas a través de capturas de pantalla sin trabajar con el DOM.
Todo el proyecto se publica como acceso abierto bajo la licencia Apache-2.0, y el artículo incluye análisis detallados de errores, estudios de ablación y comparaciones con más de 25 modelos VLM.
Por qué es importante
АналітикаEste nuevo enfoque del web scraping podría mejorar significativamente la precisión en la recolección de datos, reduciendo la pérdida de información, lo cual es crucial para desarrolladores e investigadores.
Debatir en la comunidad
Діліться своїм досвідом та думками з ШІ-розробниками