Исследования
2000 таблиц в секунду: Smart Engines находит нужную таблицу на документе без нейросетей
Системы распознавания документов часто находят на изображении несколько областей, похожих на таблицы. Чтобы не запускать дорогое распознавание ячеек на каждом кандидате, нужно сначала понять, какой из регионов — целевая таблица. В Smart Engines решили эту задачу без нейросетей: каждый табличный регион превращается в строку, которая одновременно описывает его геометрию и текстовое содержимое.
Затем нужная таблица идентифицируется с помощью регулярных выражений. Такой подход оказался быстрым и детерминированным — около 2000 идентификаций в секунду даже на обычном мобильном процессоре. Он позволяет отказаться от набора хрупких эвристик и повышает итоговое качество распознавания документа.
Источник: habr.com