Девять OCR-моделей против рукописного русского: кто победил и на чём считать
Выбор OCR-модели в 2026 году превратился в головоломку: техобзоры советуют Tesseract, на Хабре хвалят VLM, а на Hugging Face десятки моделей вроде PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL — и каждая называет себя SOTA. К этому добавляются движки инференса: vLLM, SGLang, TGI и нативный HF Transformers.
Авторы провели систематическое тестирование девяти моделей на трёх движках, сфокусировавшись на рукописном русском тексте — одной из самых сложных задач для OCR. В результатах — таблица с точностью и производительностью, а также рекомендации: какая модель лучше подходит для конкретного сценария (скорость, качество, ресурсы).
Материал будет полезен инженерам, которые выбирают OCR для production: он даёт не абстрактные бенчмарки, а практические данные по совместимости моделей и движков.