Пиксельный RAG: как искать в документах без парсинга текста — гайд с кодом
Авторы представили полный пайплайн пиксельного RAG: веб-страницы и PDF рендерятся в картинки, разбиваются на перекрывающиеся тайлы, для каждого генерируются мультимодальные эмбеддинги (SigLIP, CLIP или Qwen3-VL), а векторы складываются в FAISS-индекс. Поиск усиливается OCR-токенами через BM25 и реранкингом Reciprocal Rank Fusion.
Система агрегирует результаты с тайлов до уровня документа, выдаёт ответ через FastAPI, а качество оценивается по Recall@k и MRR. Опционально лучшие тайлы передаются VLM для генерации ответа с обоснованием. Всё — с открытым кодом и конфигом на пять страниц Википедии.
Подход решает проблему потери контекста при чанковании и парсинге, но требует больше ресурсов на обработку изображений. Гайд включает обучение адаптера контрастивным методом и визуализацию найденных скриншотов.