Cohere宣布推出Parse 5,用于处理PDF文件、演示文稿和扫描图像,并将其转换为结构化Markdown,目标客户是需要将大量文档输入人工智能应用和软件代理的企业。该模型可通过Cohere API、Model Vault、Microsoft Foundry和AWS SageMaker使用。
该公司将Parse 5定位为不同于更大型通用人工智能模型的产品:它并非以最高准确率为目标,而是试图在处理数百万页时实现准确率与成本之间的平衡。Cohere将其API使用价格定为每1,000页1.50美元,而Model Vault则支持在安全的单租户平台上进行托管部署,以满足更大规模的需求。
用一个模型取代独立的处理链
Parse 5采用拥有23亿参数的视觉语言模型,基于Cohere Labs的North-Micro-Vision-Instruct架构构建。其上下文窗口长度为8,192个令牌,模型大小约为4.6 GB。该模型接收以base64编码图像格式提供的PDF、PowerPoint或JPEG页面,然后按照阅读顺序以Markdown形式返回其内容。
表格会被转换为HTML,模型还会为图像添加描述,并提供表格和图像的边界框坐标。默认模式会为每个页面返回一个Markdown字符串,而blocks模式则提供带有类型标记的元素,使每个表格都包含自身的HTML、描述和坐标。Cohere认为,这种格式有助于在代理应用中按照引用级别追踪信息来源。
根据来源,阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语均可获得稳定的准确率,同时也支持其他语言的zero-shot处理,但准确率较低。
准确率低于更大型模型,但价格模式不同
根据Cohere发布的ParseBench比较,Parse 5在表格、内容保真度和语义格式三个维度上的总分为79.2。GPT-5.5以84.4分、Opus 4.8以84.3分、Gemini 3.5 Flash以81.8分超过了它。另一方面,Parse 5超过了LlamaParse的Cost Effective类别,该类别得分为78.3;也超过了得分为74.5的Mistral OCR 4、得分为72.4的Databricks AI Parse以及得分为69.3的Azure Document Intelligence。
该比较不包括布局Layout和图表Chart两个维度。Cohere表示,这是由于产品范围所致。该模型按照阅读顺序返回文本,而不是为每个文本元素提供坐标;同时,它会描述图表,而不是提取其中的基础数据。该公司表示,图表数据提取计划在未来版本中推出。
这对企业的实际改变是什么?
Parse 5的核心价值在于减少每页对大型通用模型的依赖,而不在于绝对优于文档处理工具。Cohere估计,在一个每年处理7.5亿份文档的金融服务公司典型工作流程中,相较于使用GPT-5.5,使用Parse 5可将成本降低超过98%。不过,这一比例是公司针对建模工作流程作出的估算,并非经审计的部署结果或独立研究结论。
这一比较表明,文档解析工具的选择不应仅依据单一基准测试结果。如果在输入阶段丢失表格、标题或阅读顺序,后续的嵌入模型或更大型模型将无法恢复丢失的结构。因此,企业需要在自身最复杂的文档上测试Parse 5,并衡量检索准确率和最终任务表现,而不能只评估提取文本的外观。
来源中引用的专家意见支持这种谨慎的使用方式;他们认为,Parse 5处于传统OCR与对每一页运行高成本通用模型之间。尚待明确的问题是,提供结构和元素坐标以及较低价格,是否确实会在最终应用中带来更好的结果,尤其是在包含大量图表或复杂布局的文档中。