Datalab выпустила OmniExtractBench — открытый бенчмарк для извлечения данных из PDF без предвзятости
Datalab выпустила OmniExtractBench — открытый бенчмарк, который призван исправить четыре хронические проблемы существующих тестов извлечения данных из PDF: предвзятость в пользу создателя бенчмарка, непрозрачные обвязки (harness), неясную оценку и узкий набор документов. Вместо разрозненных вендорских лидербордов OmniExtractBench предлагает общий измерительный инструмент.
Бенчмарк включает 620 документов из четырёх источников: ExtractBench (329 документов от LlamaIndex), синтетический набор Datalab (202), LongExtractBench (47) и LongArray-Extract (42). Самый крупный сегмент — регуляторные формы (88 документов). Скоррер устанавливается одной командой pip install omni-extract-bench (v0.1.7, Python 3.11+, только SciPy) под лицензией Apache 2.0.
Скоррер сравнивает предсказанный JSON с эталонным не по позиции, а по содержимому. Для таблиц используется венгерский алгоритм, который правильно сопоставляет строки даже при пропуске первой строки (99% вместо 0% при позиционном сравнении). Каждое значение получает один из шести вердиктов: matched, misread, unfound, fabricated, invented_item, invented_field. Итоговая точность — доля совпавших значений.
Важное правило: пустые строки, None и пробелы считаются пропусками и не учитываются. А вот «NA» или «-» считаются реальными ответами — это блокирует тривиальный эксплойт с добавлением пустых опциональных полей для искусственного повышения метрик. По заявлению Datalab, в тесте такие поля не добавили ни одного вердикта.