Собираем пайплайн документ-интеллидженс на deepDoctection: разметка, OCR, таблицы и RAG за один проход
deepDoctection 1.2.x позволяет собрать полный конвейер анализа документов в одном workflow: детекция layout (DocLayNet), распознавание таблиц (Table Transformer), OCR (DocTR), восстановление порядка чтения, привязка аннотаций и структурированный экспорт. В туториале показано, как сконфигурировать анализатор, извлечь текст, фигуры, таблицы и связи между ними, а также зарегистрировать собственные типы объектов и написать PipelineComponent для извлечения денежных сумм и дат с классификацией документов по табличным признакам.
Сборка кастомного пайплайна делается через ServiceFactory: можно фильтровать результаты, откатывать сервисы, сериализовать страницы и трансформировать аннотации в упорядоченные JSONL-чанки — готовые для подачи в RAG или поисковые системы. В гайде также разобраны нюансы: как обрабатывать одиночные изображения (нужно передавать bytes), патч для совместимости Transformers и PEFT, и настройка переменных окружения для torch и DPI.