Волна ИИПодписаться
← Назад
Исследования

Старые OCR-тексты портят обучение языковых моделей: FineBooks нашёл масштабное решение

10.08.2026 · the-decoder.com ↗

Качество обучающих данных критически важно для современных LLM, но старые OCR-распознанные тексты часто содержат ошибки, которые «заражают» модели. Проект FineBooks от Hugging Face и EleutherAI решил проверить, насколько современные открытые OCR-модели способны исправить эту проблему в масштабе. Исследователи протестировали 14 моделей на более чем 2000 страницах исторических книг.

Лучший результат показала модель dots.mocr — 97,6% точности по символам при стоимости менее $2 за тысячу страниц. По словам команды, такого качества уже достаточно для подготовки данных для обучения ИИ-моделей, но пока недостаточно для академических транскрипций, где требуется практически идеальная точность.

Проект FineBooks ставит целью масштабное исправление старых OCR-ошибок, чтобы улучшить качество текстов для тренировки языковых моделей. Это особенно актуально для исторических и научных публикаций в открытом доступе, где ошибки распознавания накапливались десятилетиями.

Источник: the-decoder.com
← Все новости AI Wave