Веб-скрейпинг уже не будет таким, как раньше: новый подход с PixelRAG
Веб-скрейпинг уже не будет таким, как раньше: новый подход с PixelRAG
PixelRAG - это опенсорсный ретривер-фреймворк, который использует изображения страниц вместо традиционного HTML-парсинга.
Вышел PixelRAG - опенсорсный ретривер-фреймворк, который использует изображения страниц вместо традиционного HTML-парсинга.
По словам разработчиков, традиционные пайплайны HTML-to-text могут терять более 40% содержимого страницы, включая таблицы, графики и элементы разметки. PixelRAG работает с документом в том виде, в каком его видит пользователь после рендеринга.
Как работает пайплайн:
- Рендерит каждый документ (веб-страницы, PDF, изображения) в набор тайлов.
- Создает эмбеддинги с помощью Qwen3-VL-Embedding.
- Создает индекс FAISS и предоставляет API для поиска.
Проект опубликован в открытом доступе под лицензией Apache-2.0, а в статье есть детальные разборы ошибок и сравнения с более чем 25 VLM-моделями.
Почему это важно
АналітикаЭтот новый подход к веб-скрейпингу может значительно повысить точность сбора данных, уменьшая потери информации, что критически важно для аналитики и исследований.
Обсудить в сообществе
Діліться своїм досвідом та думками з ШІ-розробниками