Jina AI выпустила jina-ocr-v1: 3,4B MoE-модель для парсинга документов с автодекодированием на дешёвых GPU
Jina AI, входящая в Elastic, выпустила jina-ocr-v1 — end-to-end визуальную модель для разбора документов. Она принимает PDF, сканы, таблицы, графики и инвойсы, а выдаёт чистый Markdown за один проход. Суммарный размер — 3,4 млрд параметров (6,8 ГБ в BF16), при этом на каждом токене активируется лишь ≈570 млн через MoE-архитектуру с 64 экспертами и top-6 routing. Позиционный лимит — 32 768 токенов, выход включает HTML-таблицы и LaTeX-формулы.
В основе модели лежит дообученный DeepSeek-OCR. Энкодер (DeepEncoder, ≈380 млн параметров) объединяет SAM, 16-кратный свёрточный компрессор и CLIP-L, сжимая страницу 1024×1024 с 4096 патчей до 256 визуальных токенов. Режим динамического разрешения добавляет до 9 локальных тайлов по 100 токенов каждый — максимум 1156 визуальных токенов на страницу. Декодер — DeepSeek-3B-MoE: 12 слоёв, 64 маршрутизируемых эксперта + 2 общих.
Jina AI внедрила в checkpoint встроенный головой спекулятивного декодирования FastMTP. Идея: вывод OCR почти детерминирован, поэтому один плотный draft-блок рекурсивно применяется K=3 шага с постоянными параметрами. Декодер проверяет черновики жадно, принимает самый длинный префикс, совпадающий с его собственным выбором, и дополнительно выдаёт один токен. При K=3 модель фиксирует в среднем 2,73 токена за шаг — ускорение lossless, так как итоговый вывод идентичен чистому жадному декодированию.
На бенчмарках модель показала 91,14 на OmniDocBench v1.6 и 83,4 на olmOCR-Bench. Веса открыты под лицензией CC BY-NC 4.0 (при коммерческом использовании нужно обращаться в Jina AI), работают в Transformers и vLLM. Исследовательское и некоммерческое использование — бесплатно и разрешено.