Волна ИИПодписаться
← Назад
Инструменты

Собираем OCR-пайплайн на Baidu Unlimited-OCR: разбираем картинки и PDF за один проход

24.07.2026 · marktechpost.com ↗

Baidu выпустила Unlimited-OCR — open-source vision-language модель на 3 миллиарда параметров, способную за один проход извлекать текст из плотных макетов, таблиц и многостраничных PDF. В отличие от классических OCR-пайплайнов, ей не нужен отдельный этап анализа разметки страницы.

В туториале разбирается полный пайплайн: от установки зависимостей (transformers, PyMuPDF, accelerate) и автоматического выбора bfloat16/float16 под GPU до загрузки модели с Hugging Face. Предусмотрены два режима — tiled Gundam для детального разбора и быстрый Base для обычных страниц. Для многостраничных документов используется infer_multi() с PyMuPDF.

Код генерирует тестовые PDF с таблицами и текстом, затем запускает распознавание с контролем повторений и структурированным выводом. Всё воспроизводимо в Colab или на локальной машине с CUDA.

Источник: marktechpost.com
← Все новости AI Wave