Cohere выпустила Parse 5: 2,3B-параметрическая модель превращает PDF и PPT в Markdown без OCR
Cohere выпустила Parse 5 (parse-v5.0) — модель для парсинга документов, ориентированную на корпоративные сценарии с большими объёмами. Это 2,3B-параметрическая vision language модель с контекстным окном 8192 токена и размером около 4,6 ГБ. Она построена на архитектуре North-Micro-Vision-Instruct от Cohere Labs и не требует отдельного OCR-этапа — модель сразу извлекает текст, таблицы, списки, формы и изображения.
Parse 5 принимает страницы PDF, PPT или JPEG в виде base64-кодированного data URI и возвращает Markdown с текстом в порядке чтения, таблицами в HTML, списками, парами ключ-значение, описаниями изображений и координатами bounding box. Поддерживаются два режима вывода: по умолчанию — Markdown на страницу, а при параметре output_format="blocks" — типизированные блоки с HTML, bounding box и описанием, что позволяет отслеживать цитирование.
Модель стабильно работает на девяти языках: арабском, английском, французском, немецком, итальянском, японском, корейском, португальском и испанском. Другие языки поддерживаются в zero-shot режиме с меньшей точностью. Cohere оценивает качество модели по собственному бенчмарку ParseBench — 79,2 балла (измеряет три из пяти измерений).
Parse 5 доступен через Cohere Parse API, Microsoft Foundry, AWS SageMaker и приватное развёртывание Model Vault. Цена — $1,50 за 1000 страниц. Компания нацеливает продукт на финансовый сектор, страхование, здравоохранение, госсектор, телеком, энергетику и производство — отрасли с большим объёмом сканированных форм и плотных таблиц. Применения: RAG-индексация, интеллектуальная обработка документов, пайплайны счетов и инвойсов, поиск по контрактам и передача контекста агентам.