Весь архив Циолковского прочитан ИИ: 51 008 листов без единого эталона
Исследователи завершили полную машинную обработку фонда 555 Архива РАН — 51 008 листов рукописей Константина Циолковского. Это не просто OCR: нейросеть читала сложный рукописный текст, где нет чётких правил правописания и единого почерка.
Ключевая методическая сложность — отсутствие эталона. Обычно точность распознавания меряют сравнением с «золотым стандартом» (вручную размеченным текстом), но здесь его нет. Авторам пришлось разрабатывать альтернативные метрики, и часть результатов они признали отрицательными — то есть модель в некоторых случаях давала заведомо неверное чтение, которое невозможно было отсеять без эталона.
Тем не менее, сам факт полной оцифровки архива — значимый шаг для исторической науки. Теперь рукописи доступны для поиска и анализа, а метод измерения точности без эталона может пригодиться в других проектах по распознаванию исторических документов.