人工知能

Cohere、1,000ページあたり1.50ドルでAI文書処理を行うParse 5を発表

Cohereは、PDF、プレゼンテーション、画像を構造化されたMarkdownに変換する、23億パラメーター規模の視覚言語モデルParse 5を発表した。表、画像の説明、要素の位置特定に対応する。同社が公表した精度比較では首位に立っていないが、大規模処理のコスト削減を狙っており、価格は1,000ページあたり1.50ドルとなっている。

2026-08-28
1 分で読めます
6 閲覧数
فريق تحرير certi.news
Cohere、1,000ページあたり1.50ドルでAI文書処理を行うParse 5を発表

Cohereは、PDFファイル、プレゼンテーション、スキャン画像を処理し、構造化されたMarkdownに変換するParse 5の提供を開始した。大量の文書をAIアプリケーションやソフトウェアエージェントに取り込む必要がある企業を対象としている。モデルはCohere API、Model Vault、Microsoft Foundry、AWS SageMakerを通じて利用できる。

同社はParse 5を、より大規模な汎用AIモデルとは異なる位置付けにしている。最も高精度なモデルとしてではなく、数百万ページを処理する際の精度とコストのバランスを実現する試みとしている。CohereはAPI経由の利用料金を1,000ページあたり1.50ドルに設定している。一方、Model Vaultでは、より大規模な処理向けに、単一テナントの安全なプラットフォーム上で管理されたデプロイが可能になる。

個別の処理チェーンではなく単一モデル

Parse 5は23億パラメーターの視覚言語モデルで、Cohere LabsのNorth-Micro-Vision-Instructアーキテクチャーを基盤としている。コンテキストウィンドウの長さは8,192トークンで、モデルのサイズは約4.6ギガバイトとされる。モデルは、PDFまたはPowerPointのページ、あるいはbase64でエンコードされた画像形式のJPEGを受け取り、その内容を読み取り順にMarkdownとして返す。

表はHTMLに変換され、モデルは画像の説明と、表および画像のバウンディングボックスの座標も追加する。デフォルトモードではページごとにMarkdown文字列を返す。一方、blocksモードでは型付き要素を返し、各表に対応するHTML、説明、座標が含まれる。Cohereは、この形式によってエージェントアプリケーション内で引用単位の情報源を追跡しやすくなるとしている。

情報源によると、アラビア語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、スペイン語では安定した精度が得られ、その他の言語については、精度は低いもののzero-shotに対応する。

より大規模なモデルより低い精度と異なる料金体系

Cohereが公表したParseBenchの比較によると、Parse 5は、表、内容の忠実性、セマンティックな書式という3つの評価軸で79.2点を記録した。GPT-5.5は84.4点、Opus 4.8は84.3点、Gemini 3.5 Flashは81.8点で、Parse 5を上回った。一方、Parse 5は、78.3点だったLlamaParseのCost Effectiveカテゴリ、74.5点のMistral OCR 4、72.4点のDatabricks AI Parse、69.3点のAzure Document Intelligenceを上回った。

この比較では、レイアウト(Layout)と図表(Chart)の2つの評価軸が除外されている。Cohereは、その理由を製品の範囲にあると説明している。モデルは各テキスト要素の座標を提供するのではなく、読み取り順にテキストを返し、図表についても基礎データを抽出するのではなく説明を生成する。同社によると、図表データの抽出は今後のリリースで予定されている。

企業にとって実際に何が変わるのか

Parse 5の主な価値は、各ページで大規模な汎用モデルに依存する必要性を減らすことにあり、処理ツールを絶対的に上回ることではない。Cohereは、年間7億5,000万件の文書を処理する金融サービス企業の典型的なワークフローにおいて、GPT-5.5の代わりにParse 5を使用すれば、コストを98%以上削減できると試算した。ただし、この割合はモデル化されたワークフローについて同社が示した推定値であり、監査済みの導入結果や独立した調査の結果ではない。

この比較は、文書解析ツールの選択を単一のベンチマーク結果だけに基づいて行うべきではないことを示している。取り込み時に表、見出し、読み取り順が失われれば、その後の埋め込みモデルやより大規模なモデルでも、失われた構造を復元することはできない。そのため企業は、抽出されたテキストの見た目を評価するだけでなく、Parse 5を自社の最も難しい文書でテストし、検索精度と最終タスクの精度を測定する必要がある。

情報源に掲載された専門家の見解も、この慎重な利用を支持している。専門家は、Parse 5が従来型OCRと、各ページで高コストの汎用モデルを実行する方法の中間に位置すると見ている。構造、要素の座標、低価格の提供によって、特に図表が多い文書や複雑なレイアウトの文書において、最終的なアプリケーションで実際により良い結果が得られるかどうかは、依然として未解決の問題である。

ニュースの出典
VentureBeat Startups & Funding
原文を開く ↗
ف
著者

فريق تحرير certi.news

同じカテゴリー

おすすめ記事

すべてのニュースを見る