Cohere объявила о доступности Parse 5 для обработки PDF-файлов, презентаций и отсканированных изображений и их преобразования в структурированный Markdown, ориентируясь на организации, которым необходимо загружать большие объёмы документов в приложения на основе ИИ и программных агентов. Модель доступна через Cohere API, Model Vault, Microsoft Foundry и AWS SageMaker.
Компания позиционирует Parse 5 иначе, чем более крупные универсальные модели ИИ: не как наиболее точную, а как попытку добиться баланса между точностью и стоимостью при обработке миллионов страниц. Cohere установила цену использования через API на уровне 1,50 доллара за 1 000 страниц, тогда как Model Vault позволяет выполнять управляемое развёртывание на защищённой платформе с одним арендатором для более крупных объёмов.
Одна модель вместо отдельной цепочки обработки
Parse 5 основана на модели зрения и языка с 2,3 миллиарда параметров и построена на архитектуре North-Micro-Vision-Instruct от Cohere Labs. Длина контекстного окна составляет 8 192 токена, а размер модели оценивается примерно в 4,6 гигабайта. Модель получает страницу PDF, PowerPoint или JPEG в виде изображения, закодированного в base64, а затем возвращает её содержимое в порядке чтения в формате Markdown.
Таблицы преобразуются в HTML, а модель также добавляет описания изображений и координаты ограничивающих рамок для таблиц и изображений. В режиме по умолчанию для каждой страницы возвращается строка Markdown, тогда как режим blocks предоставляет типизированные элементы: каждая таблица содержит собственный HTML, описание и координаты. Cohere считает, что такой формат помогает отслеживать источник информации на уровне цитат в приложениях с агентами.
Согласно источнику, для арабского, английского, французского, немецкого, итальянского, японского, корейского, португальского и испанского языков достигается стабильная точность, а для остальных языков поддерживается zero-shot с более низкой точностью.
Более низкая точность по сравнению с крупными моделями и иная стоимость
Согласно опубликованному Cohere сравнению ParseBench, Parse 5 набрала 79,2 балла по трём направлениям: таблицы, точность содержания и семантическое форматирование. Её превзошли модели GPT-5.5 с результатом 84,4, Opus 4.8 с результатом 84,3 и Gemini 3.5 Flash с результатом 81,8. При этом Parse 5 опередила категорию Cost Effective от LlamaParse, набравшую 78,3, Mistral OCR 4 с результатом 74,5, Databricks AI Parse с результатом 72,4 и Azure Document Intelligence с результатом 69,3.
Сравнение не включает два направления — планировку Layout и диаграммы Chart, — и Cohere объясняет это сферой применения продукта. Модель возвращает текст в порядке чтения, а не предоставляет координаты для каждого текстового элемента, а также описывает диаграммы вместо извлечения их исходных данных. Компания заявляет, что извлечение данных из диаграмм запланировано в будущей версии.
Что на практике меняется для организаций?
Основная ценность Parse 5 заключается в снижении зависимости от крупной универсальной модели для каждой страницы, а не в абсолютном превосходстве над инструментами обработки. Cohere подсчитала, что в типичном рабочем процессе финансовой сервисной компании, обрабатывающей 750 миллионов документов в год, использование Parse 5 вместо GPT-5.5 может сократить расходы более чем на 98%. Однако этот показатель является оценкой компании для смоделированного рабочего процесса, а не результатом проверенного внедрения или независимого исследования.
Это сравнение подтверждает, что выбор инструмента анализа документов не должен основываться на одном эталонном показателе. Если таблицы, заголовки или порядок чтения будут потеряны на этапе загрузки, модели эмбеддингов или более крупные модели на последующих этапах не смогут восстановить утраченную структуру. Поэтому организациям потребуется протестировать Parse 5 на наиболее сложных документах и измерить точность поиска и выполнения конечных задач, а не ограничиваться оценкой внешнего вида извлечённого текста.
Приведённые в источнике мнения экспертов поддерживают такой осторожный подход: по их мнению, Parse 5 находится между традиционным OCR и запуском дорогостоящей универсальной модели для каждой страницы. Открытым остаётся вопрос о том, приведёт ли сохранение структуры и координат элементов, а также низкая цена действительно к лучшим результатам в конечных приложениях, особенно при работе с документами, содержащими большое количество диаграмм или сложные макеты.