Инструменты
Тест девяти OCR-моделей на рукописном русском: Tesseract, PaddleOCR, DeepSeek и другие — кто победил?
Выбор OCR-модели сегодня превратился в квест: в техобзорах хвалят Tesseract, на Хабре пишут про VLM, а на Hugging Face десятки моделей вроде PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL — и каждая называет себя SOTA. Добавьте сюда движки инференса (vLLM, SGLang, TGI, Native HF Transformers) — и получается сотня комбинаций, в которых легко потеряться.
Авторы провели собственное тестирование: девять моделей на трёх движках на рукописном русском тексте. Результаты свели в таблицу, где показали, какая модель лучше справляется с разными подзадачами. Под катом — сама таблица и история её создания.
Источник: habr.com