Волна ИИПодписаться
← Назад
Исследования

Пиксельный RAG: как искать в документах без парсинга текста — гайд с кодом

04.08.2026 · marktechpost.com ↗

Авторы представили полный пайплайн пиксельного RAG: веб-страницы и PDF рендерятся в картинки, разбиваются на перекрывающиеся тайлы, для каждого генерируются мультимодальные эмбеддинги (SigLIP, CLIP или Qwen3-VL), а векторы складываются в FAISS-индекс. Поиск усиливается OCR-токенами через BM25 и реранкингом Reciprocal Rank Fusion.

Система агрегирует результаты с тайлов до уровня документа, выдаёт ответ через FastAPI, а качество оценивается по Recall@k и MRR. Опционально лучшие тайлы передаются VLM для генерации ответа с обоснованием. Всё — с открытым кодом и конфигом на пять страниц Википедии.

Подход решает проблему потери контекста при чанковании и парсинге, но требует больше ресурсов на обработку изображений. Гайд включает обучение адаптера контрастивным методом и визуализацию найденных скриншотов.

Источник: marktechpost.com
← Все новости AI Wave