A Cohere anunciou a disponibilidade do Parse 5 para processar arquivos PDF, apresentações e imagens digitalizadas e convertê-los em Markdown estruturado, tendo como alvo organizações que precisam inserir grandes volumes de documentos em aplicações de inteligência artificial e agentes de software. O modelo está disponível por meio da Cohere API, do Model Vault, do Microsoft Foundry e do AWS SageMaker.
A empresa posiciona o Parse 5 de forma diferente dos modelos de IA gerais maiores: não como o mais preciso, mas como uma tentativa de equilibrar precisão e custo ao processar milhões de páginas. A Cohere definiu o preço de uso pela interface de programação em US$ 1,50 por 1.000 páginas, enquanto o Model Vault permite a implantação gerenciada em uma plataforma segura de locatário único para volumes maiores.
Um modelo em vez de uma cadeia de processamento separada
O Parse 5 é baseado em um modelo de visão e linguagem com 2,3 bilhões de parâmetros, construído sobre a arquitetura North-Micro-Vision-Instruct da Cohere Labs. O tamanho da janela de contexto é de 8.192 tokens, enquanto o tamanho do modelo é estimado em cerca de 4,6 gigabytes. O modelo recebe uma página de PDF, PowerPoint ou JPEG como uma imagem codificada em base64 e retorna seu conteúdo na ordem de leitura em Markdown.
As tabelas são convertidas em HTML, e o modelo também adiciona descrições de imagens e coordenadas de caixas delimitadoras para tabelas e imagens. O modo padrão retorna uma string de Markdown para cada página, enquanto o modo blocks fornece elementos tipados, de modo que cada tabela contenha seu próprio HTML, sua descrição e suas coordenadas. A Cohere considera que esse formato ajuda a rastrear a origem das informações no nível da citação dentro de aplicações de agentes.
Árabe, inglês, francês, alemão, italiano, japonês, coreano, português e espanhol alcançam precisão estável, segundo a fonte, com suporte zero-shot de menor precisão para os demais idiomas.
Precisão inferior à dos modelos maiores e uma estrutura de preços diferente
De acordo com a comparação ParseBench publicada pela Cohere, o Parse 5 obteve 79,2 em três dimensões: tabelas, fidelidade do conteúdo e formatação semântica. Os modelos GPT-5.5, com 84,4, Opus 4.8, com 84,3, e Gemini 3.5 Flash, com 81,8, ficaram à frente. Por outro lado, o Parse 5 superou a categoria Cost Effective do LlamaParse, que obteve 78,3, o Mistral OCR 4, com 74,5, o Databricks AI Parse, com 72,4, e o Azure Document Intelligence, com 69,3.
A comparação exclui as dimensões de layout e gráficos, e a Cohere afirma que isso se deve ao escopo do produto. O modelo retorna o texto na ordem de leitura, em vez de fornecer coordenadas para cada elemento textual, e descreve os gráficos em vez de extrair seus dados subjacentes. A empresa afirma que a extração de dados de gráficos está planejada para uma versão futura.
O que muda, na prática, para as organizações?
O principal valor do Parse 5 está na redução da dependência de um modelo geral grande para cada página, e não em uma superioridade absoluta sobre as ferramentas de processamento. A Cohere estimou, em um fluxo de trabalho típico de uma empresa de serviços financeiros que processa 750 milhões de documentos por ano, que usar o Parse 5 em vez do GPT-5.5 poderia reduzir o custo em mais de 98%. No entanto, esse percentual é uma estimativa da empresa para um fluxo de trabalho modelado, não o resultado de uma implantação auditada ou de um estudo independente.
Essa comparação confirma que a escolha de uma ferramenta de análise de documentos não deve depender de um único resultado de benchmark. Se tabelas, títulos ou a ordem de leitura forem perdidos durante a ingestão, os modelos de incorporação ou modelos maiores usados posteriormente não conseguirão recuperar a estrutura perdida. Por isso, as organizações precisarão testar o Parse 5 em seus documentos mais difíceis e medir a precisão da recuperação e das tarefas finais, em vez de se limitar a avaliar a aparência do texto extraído.
As opiniões de especialistas apresentadas na fonte apoiam esse uso cauteloso; eles consideram que o Parse 5 se situa entre o OCR tradicional e a execução de um modelo geral de alto custo em cada página. A questão em aberto é se a preservação da estrutura, as coordenadas dos elementos e o preço baixo levarão efetivamente a resultados melhores nas aplicações finais, especialmente em documentos ricos em gráficos ou com layouts complexos.