Веб-скрейпинг вже не буде таким, як раніше: новий підхід з PixelRAG
Веб-скрейпинг вже не буде таким, як раніше: новий підхід з PixelRAG
Вийшов PixelRAG - опенсорсний ретривер-фреймворк, який використовує зображення сторінок замість традиційного HTML-парсингу.
За словами розробників, традиційні пайплайни HTML-to-text можуть втрачати понад 40% вмісту сторінки, включаючи таблиці, графіки та елементи розмітки. PixelRAG працює з документом у тому вигляді, в якому його бачить користувач після рендерингу.
Як працює пайплайн:
- Рендерить кожен документ (веб-сторінки, PDF, зображення) в набір тайлів.
- Створює ембеддинги за допомогою Qwen3-VL-Embedding.
- Створює індекс FAISS і надає API для пошуку.
Проект опублікований в відкритому доступі під ліцензією Apache-2.0, а в статті є детальні розбори помилок та порівняння з більш ніж 25 VLM-моделями.
Чому це важливо
АналітикаЦей новий підхід до веб-скрейпінгу може значно підвищити точність збору даних, зменшуючи втрати інформації, що є критично важливим для аналітики та досліджень.
Обговорити новину у спільноті
Діліться своїм досвідом та думками з ШІ-розробниками