Старые OCR-тексты портят обучение языковых моделей: FineBooks нашёл масштабное решение
Качество обучающих данных критически важно для современных LLM, но старые OCR-распознанные тексты часто содержат ошибки, которые «заражают» модели. Проект FineBooks от Hugging Face и EleutherAI решил проверить, насколько современные открытые OCR-модели способны исправить эту проблему в масштабе. Исследователи протестировали 14 моделей на более чем 2000 страницах исторических книг.
Лучший результат показала модель dots.mocr — 97,6% точности по символам при стоимости менее $2 за тысячу страниц. По словам команды, такого качества уже достаточно для подготовки данных для обучения ИИ-моделей, но пока недостаточно для академических транскрипций, где требуется практически идеальная точность.
Проект FineBooks ставит целью масштабное исправление старых OCR-ошибок, чтобы улучшить качество текстов для тренировки языковых моделей. Это особенно актуально для исторических и научных публикаций в открытом доступе, где ошибки распознавания накапливались десятилетиями.