Marker 2 от Datalab: конвертация документов в 5 раз быстрее MinerU с точностью 76% на olmOCR-bench
Marker 2 — это полная переработка оригинального пайплайна Datalab. В основе лежат три компонента, выпущенные за последние месяцы: Surya OCR 2, быстрая модель разметки на 20 млн параметров и переписанный pdftext, работающий в 3 раза быстрее предыдущей версии. Инструмент поддерживает конвертацию PDF, изображений, PPTX, DOCX, XLSX, HTML и EPUB в markdown, JSON, HTML или чанки.
Главный результат — на стороннем бенчмарке olmOCR-bench от Allen AI (1403 PDF, ~8400 тестов). Сбалансированный режим Marker 2 показал 76.0% общей точности и 83.5% на цифровых PDF. Пропускная способность — 2.9 страниц/с на одном B200 GPU. Для сравнения: MinerU — 72.7% при 0.54 стр/с, Docling — 50.3% при 2.1 стр/с. Таким образом, Marker 2 превосходит MinerU по точности и в 5 раз по скорости.
Новая версия предлагает три режима: balanced (максимальное качество с VLM, 76.0%), fast (лёгкий layout-детектор без тяжёлого OCR, 66.6%) и --disable_ocr (только текст из PDF, 43.6%, до 23.7 стр/с на CPU). Режим выбирается автоматически в зависимости от устройства: balanced на GPU, fast на CPU/MPS. Архитектура с тонкими CPU-воркерами, разделяющими один Surya-сервер, позволяет масштабировать пропускную способность.
Важные изменения: требуется Python 3.10+, сборка переведена с Poetry на uv. Удалены конвертер структурированного извлечения и экстракторы — вместо них Datalab рекомендует hosted API или --use_llm. Все цифры получены на одном B200 и воспроизводимы через открытый харнес в репозитории Marker.