人工智能

Cohere推出Parse 5,用于人工智能文档处理,每千页费用1.50美元

Cohere推出Parse 5,这是一款拥有23亿参数的视觉语言模型,可将PDF文件、演示文稿和图像转换为结构化Markdown,并支持表格、图像描述和元素定位。该模型在公司发布的准确率比较中并未位居榜首,但其目标是降低大规模处理成本,价格为每千页1.50美元。

2026-08-28
1 分钟阅读
6 浏览量
فريق تحرير certi.news
Cohere推出Parse 5,用于人工智能文档处理,每千页费用1.50美元

Cohere宣布推出Parse 5,用于处理PDF文件、演示文稿和扫描图像,并将其转换为结构化Markdown,目标客户是需要将大量文档输入人工智能应用和软件代理的企业。该模型可通过Cohere API、Model Vault、Microsoft Foundry和AWS SageMaker使用。

该公司将Parse 5定位为不同于更大型通用人工智能模型的产品:它并非以最高准确率为目标,而是试图在处理数百万页时实现准确率与成本之间的平衡。Cohere将其API使用价格定为每1,000页1.50美元,而Model Vault则支持在安全的单租户平台上进行托管部署,以满足更大规模的需求。

用一个模型取代独立的处理链

Parse 5采用拥有23亿参数的视觉语言模型,基于Cohere Labs的North-Micro-Vision-Instruct架构构建。其上下文窗口长度为8,192个令牌,模型大小约为4.6 GB。该模型接收以base64编码图像格式提供的PDF、PowerPoint或JPEG页面,然后按照阅读顺序以Markdown形式返回其内容。

表格会被转换为HTML,模型还会为图像添加描述,并提供表格和图像的边界框坐标。默认模式会为每个页面返回一个Markdown字符串,而blocks模式则提供带有类型标记的元素,使每个表格都包含自身的HTML、描述和坐标。Cohere认为,这种格式有助于在代理应用中按照引用级别追踪信息来源。

根据来源,阿拉伯语、英语、法语、德语、意大利语、日语、韩语、葡萄牙语和西班牙语均可获得稳定的准确率,同时也支持其他语言的zero-shot处理,但准确率较低。

准确率低于更大型模型,但价格模式不同

根据Cohere发布的ParseBench比较,Parse 5在表格、内容保真度和语义格式三个维度上的总分为79.2。GPT-5.5以84.4分、Opus 4.8以84.3分、Gemini 3.5 Flash以81.8分超过了它。另一方面,Parse 5超过了LlamaParse的Cost Effective类别,该类别得分为78.3;也超过了得分为74.5的Mistral OCR 4、得分为72.4的Databricks AI Parse以及得分为69.3的Azure Document Intelligence。

该比较不包括布局Layout和图表Chart两个维度。Cohere表示,这是由于产品范围所致。该模型按照阅读顺序返回文本,而不是为每个文本元素提供坐标;同时,它会描述图表,而不是提取其中的基础数据。该公司表示,图表数据提取计划在未来版本中推出。

这对企业的实际改变是什么?

Parse 5的核心价值在于减少每页对大型通用模型的依赖,而不在于绝对优于文档处理工具。Cohere估计,在一个每年处理7.5亿份文档的金融服务公司典型工作流程中,相较于使用GPT-5.5,使用Parse 5可将成本降低超过98%。不过,这一比例是公司针对建模工作流程作出的估算,并非经审计的部署结果或独立研究结论。

这一比较表明,文档解析工具的选择不应仅依据单一基准测试结果。如果在输入阶段丢失表格、标题或阅读顺序,后续的嵌入模型或更大型模型将无法恢复丢失的结构。因此,企业需要在自身最复杂的文档上测试Parse 5,并衡量检索准确率和最终任务表现,而不能只评估提取文本的外观。

来源中引用的专家意见支持这种谨慎的使用方式;他们认为,Parse 5处于传统OCR与对每一页运行高成本通用模型之间。尚待明确的问题是,提供结构和元素坐标以及较低价格,是否确实会在最终应用中带来更好的结果,尤其是在包含大量图表或复杂布局的文档中。

新闻来源
VentureBeat Startups & Funding
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻