Веб-скрейпінг уже не буде таким, як раніше: новий підхід з PixelRAG
Веб-скрейпінг уже не буде таким, як раніше: новий підхід з PixelRAG
Вийшов PixelRAG - опенсорсний ретривер-фреймворк, який використовує зображення сторінок замість традиційного HTML-парсингу.
Вийшов PixelRAG - опенсорсний ретривер-фреймворк, який використовує зображення сторінок замість традиційного HTML-парсингу.
За словами розробників, традиційні HTML-to-text пайплайни можуть втрачати більше 40% вмісту сторінки, включаючи таблиці, графіки та елементи розмітки. PixelRAG працює з документом у тому вигляді, в якому його бачить користувач після рендерингу.
Як працює пайплайн:
- Рендерить кожен документ (веб-сторінки, PDF, зображення) у набір тайлів.
- Створює ембедінги за допомогою Qwen3-VL-Embedding, дообученої через LoRA на скріншотах.
- Створює індекс FAISS і надає API для пошуку.
Якщо замінити модель-чтець на більш потужну, точність зросте без переіндексації, оскільки індекс зберігає лише пікселі.
Для експериментів команда проекту створила візуальний індекс усієї Вікіпедії - більше 30 мільйонів скріншотів. В результаті, навіть у такому форматі система перевершує найкращий текстовий RAG-бейзлайн на 18,1% у задачах питання-відповідь лише за текстом.
Також представлений плагін для Claude Code, що дозволяє аналізувати відрендерені сторінки через скріншоти без роботи з DOM.
Весь проект опублікований у відкритому доступі під ліцензією Apache-2.0, а в статті є детальні розбори помилок, абляційні дослідження та порівняння з більш ніж 25 VLM-моделями.
Чому це важливо
АналітикаЦей новий підхід до веб-скрейпінгу може значно підвищити точність збору даних, зменшуючи втрати інформації, що є критично важливим для розробників та дослідників.
Обговорити новину у спільноті
Діліться своїм досвідом та думками з ШІ-розробниками