Веб-скрейпинг уже не будет таким, как раньше: новый подход с PixelRAG
Веб-скрейпинг уже не будет таким, как раньше: новый подход с PixelRAG
PixelRAG - это опенсорсный ретривер-фреймворк, который использует изображения страниц вместо традиционного HTML-парсинга, что позволяет избежать потерь в содержании и повысить точность.
Вышел PixelRAG - опенсорсный ретривер-фреймворк, который использует изображения страниц вместо традиционного HTML-парсинга.
За словами разработчиков, традиционные HTML-to-text пайплайны могут терять более 40% содержания страницы, включая таблицы, графики и элементы разметки. PixelRAG работает с документом в том виде, в каком его видит пользователь после рендеринга.
Как работает пайплайн:
- Рендерит каждый документ (веб-страницы, PDF, изображения) в набор тайлов.
- Создает эмбеддинги с помощью Qwen3-VL-Embedding, дообученной через LoRA на скриншотах.
- Создает индекс FAISS и предоставляет API для поиска.
Если заменить модель-читатель на более мощную, точность вырастет без переиндексации, поскольку индекс хранит только пиксели.
Для экспериментов команда проекта создала визуальный индекс всей Википедии - более 30 миллионов скриншотов. В результате, даже в таком формате система превосходит лучший текстовый RAG-бейзлайн на 18,1% в задачах вопрос-ответ только по тексту.
Также представлен плагин для Claude Code, который позволяет анализировать отрендеренные страницы через скриншоты без работы с DOM.
Весь проект опубликован в открытом доступе под лицензией Apache-2.0, а в статье есть детальные разборы ошибок, абляционные исследования и сравнения с более чем 25 VLM-моделями.
Почему это важно
АналітикаPixelRAG представляет собой значительный шаг вперед в веб-скрейпинге, позволяя избежать потерь информации и улучшить качество извлечения данных, что особенно важно для работы с сложными документами и визуальным контентом.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками