Künstliche Intelligenz

Cohere bringt Parse 5 zur KI-gestützten Dokumentenverarbeitung für 1,50 US-Dollar pro 1.000 Seiten auf den Markt

Cohere hat Parse 5 vorgestellt, ein Vision-Language-Modell mit 2,3 Milliarden Parametern, das PDFs, Präsentationen und Bilder in strukturiertes Markdown umwandelt und dabei Tabellen, Bildbeschreibungen sowie die Lokalisierung von Elementen unterstützt. Das Modell führt den von dem Unternehmen veröffentlichten Genauigkeitsvergleich nicht an, setzt jedoch auf eine Senkung der Kosten für die Verarbeitung großer Mengen: Der Preis beträgt 1,50 US-Dollar pro 1.000 Seiten.

2026-08-28
4 Min. Lesezeit
6 Aufrufe
فريق تحرير certi.news
Cohere bringt Parse 5 zur KI-gestützten Dokumentenverarbeitung für 1,50 US-Dollar pro 1.000 Seiten auf den Markt

Cohere hat Parse 5 zur Verarbeitung von PDF-Dateien, Präsentationen und gescannten Bildern und deren Umwandlung in strukturiertes Markdown verfügbar gemacht. Das Unternehmen richtet sich damit an Organisationen, die große Mengen an Dokumenten in KI-Anwendungen und Software-Agenten einspeisen müssen. Das Modell ist über die Cohere API, Model Vault, Microsoft Foundry und AWS SageMaker verfügbar.

Das Unternehmen positioniert Parse 5 anders als größere allgemeine KI-Modelle: nicht als das genaueste Modell, sondern als einen Versuch, bei der Verarbeitung von Millionen von Seiten ein Gleichgewicht zwischen Genauigkeit und Kosten zu erreichen. Cohere hat den Preis für die Nutzung über die Programmierschnittstelle auf 1,50 US-Dollar pro 1.000 Seiten festgelegt, während Model Vault eine verwaltete Bereitstellung auf einer sicheren Single-Tenant-Plattform für größere Volumina ermöglicht.

Ein Modell statt einer separaten Verarbeitungskette

Parse 5 basiert auf einem Vision-Language-Modell mit 2,3 Milliarden Parametern und verwendet die Architektur North-Micro-Vision-Instruct von Cohere Labs. Das Kontextfenster umfasst 8.192 Token, während die Größe des Modells auf etwa 4,6 Gigabyte geschätzt wird. Das Modell nimmt eine Seite aus einer PDF- oder PowerPoint-Datei oder ein JPEG-Bild im Base64-kodierten Bildformat entgegen und gibt deren Inhalt in Lesereihenfolge als Markdown zurück.

Tabellen werden in HTML umgewandelt. Außerdem fügt das Modell Bildbeschreibungen sowie die Koordinaten von Begrenzungsrahmen für Tabellen und Bilder hinzu. Im Standardmodus gibt es für jede Seite eine Markdown-Zeichenfolge zurück, während der blocks-Modus typisierte Elemente bereitstellt, sodass jede Tabelle ihr eigenes HTML, ihre Beschreibung und ihre Koordinaten enthält. Cohere zufolge unterstützt dieses Format die Nachverfolgung der Informationsquelle auf Zitatebene innerhalb von Agentenanwendungen.

Arabisch, Englisch, Französisch, Deutsch, Italienisch, Japanisch, Koreanisch, Portugiesisch und Spanisch erreichen laut Quelle jeweils eine stabile Genauigkeit; für andere Sprachen wird Zero-Shot-Unterstützung mit geringerer Genauigkeit angeboten.

Geringere Genauigkeit als größere Modelle und ein anderes Preismodell

Im von Cohere veröffentlichten Vergleich ParseBench erzielte Parse 5 über drei Dimensionen hinweg – Tabellen, Inhaltstreue und semantische Formatierung – eine Punktzahl von 79,2. Übertroffen wurde es von GPT-5.5-Modellen mit 84,4 Punkten, Opus 4.8 mit 84,3 Punkten und Gemini 3.5 Flash mit 81,8 Punkten. Gleichzeitig lag Parse 5 vor der Cost-Effective-Klasse von LlamaParse mit 78,3 Punkten, vor Mistral OCR 4 mit 74,5 Punkten, Databricks AI Parse mit 72,4 Punkten und Azure Document Intelligence mit 69,3 Punkten.

Der Vergleich schließt die Dimensionen Layout und Diagramme aus, was Cohere mit dem Produktumfang begründet. Das Modell gibt Text in Lesereihenfolge zurück, statt Koordinaten für jedes Textelement bereitzustellen, und beschreibt Diagramme, anstatt ihre zugrunde liegenden Daten zu extrahieren. Das Unternehmen erklärt, dass die Extraktion von Diagrammdaten für eine zukünftige Version geplant ist.

Was ändert sich dadurch praktisch für Organisationen?

Der wesentliche Wert von Parse 5 liegt in der Verringerung der Abhängigkeit von einem großen allgemeinen Modell für jede Seite, nicht in einer absoluten Überlegenheit gegenüber Verarbeitungstools. Cohere schätzte in einem typischen Workflow eines Finanzdienstleistungsunternehmens, das jährlich 750 Millionen Dokumente verarbeitet, dass die Nutzung von Parse 5 anstelle von GPT-5.5 die Kosten um mehr als 98 % senken könnte. Dieser Prozentsatz ist jedoch eine unternehmensseitige Schätzung für einen modellierten Workflow und kein Ergebnis einer geprüften Veröffentlichung oder einer unabhängigen Studie.

Dieser Vergleich bestätigt, dass die Auswahl eines Tools zur Dokumentenanalyse nicht auf einem einzigen Benchmark-Ergebnis beruhen sollte. Wenn Tabellen, Überschriften oder die Lesereihenfolge bei der Eingabe verloren gehen, können nachgelagerte Embedding-Modelle oder größere Modelle die fehlende Struktur nicht wiederherstellen. Organisationen müssen Parse 5 daher an ihren schwierigsten Dokumenten testen und die Genauigkeit des Abrufs sowie der Endaufgaben messen, statt sich mit einer Bewertung der Form des extrahierten Textes zu begnügen.

Die in der Quelle enthaltenen Expertenmeinungen unterstützen diese vorsichtige Nutzung. Sie sehen Parse 5 zwischen herkömmlicher OCR und dem Betrieb eines kostenintensiven allgemeinen Modells auf jeder Seite. Offen bleibt, ob die Bereitstellung von Struktur und Elementkoordinaten sowie der niedrige Preis tatsächlich zu besseren Ergebnissen in den Endanwendungen führen werden, insbesondere bei Dokumenten mit vielen Diagrammen oder komplexen Layouts.

Nachrichtenquelle
VentureBeat Startups & Funding
Originalquelle öffnen ↗
ف
Autor

فريق تحرير certi.news

Aus derselben Kategorie

Das könnte Sie interessieren

Alle Nachrichten anzeigen