Baidu представила Unlimited-OCR: читает всю страницу как одну картинку без поиска букв
Baidu выпустила Unlimited-OCR — принципиально новый подход к распознаванию текста. В отличие от классических OCR-систем вроде Tesseract, которые пошагово ищут области с буквами и распознают их, Unlimited-OCR работает иначе: берёт всю страницу как картинку, сжимает её в набор визуальных токенов и скармливает языковой модели. Модель разворачивает токены обратно в структурированный текст.
Проект — прямой наследник идеи DeepSeek-OCR, но с собственными улучшениями от Baidu. Unlimited-OCR способен обрабатывать многостраничные документы за один проход, что упрощает интеграцию в пайплайны обработки документов. Исходный код и инструкции по запуску доступны на GitHub.
Инструмент будет полезен разработчикам, которые хотят распознавать тексты без традиционной предобработки, а также всем, кто встраивает OCR-функции в свои проекты — от дата-инжиниринга до RAG-систем.