Intelligence artificielle

Cohere lance Parse 5 pour le traitement des documents par IA à 1,50 dollar pour mille pages

Cohere a lancé Parse 5, un modèle de vision et de langage de 2,3 milliards de paramètres qui convertit les PDF, les présentations et les images en Markdown structuré, avec prise en charge des tableaux, description des images et localisation des éléments. Le modèle n’arrive pas en tête du comparatif de précision publié par l’entreprise, mais mise sur la réduction du coût du traitement à grande échelle, avec un tarif de 1,50 dollar pour mille pages.

2026-08-28
5 min de lecture
6 vues
فريق تحرير certi.news
Cohere lance Parse 5 pour le traitement des documents par IA à 1,50 dollar pour mille pages

Cohere a annoncé la disponibilité de Parse 5 pour traiter les fichiers PDF, les présentations et les images numérisées, et les convertir en Markdown structuré. Le modèle cible les entreprises qui doivent intégrer de grandes quantités de documents dans des applications d’intelligence artificielle et des agents logiciels. Le modèle est disponible via Cohere API, Model Vault, Microsoft Foundry et AWS SageMaker.

L’entreprise positionne Parse 5 différemment des modèles d’IA généralistes plus grands : non pas comme le modèle le plus précis, mais comme une tentative de trouver un équilibre entre précision et coût lors du traitement de millions de pages. Cohere a fixé le tarif d’utilisation via l’interface de programmation à 1,50 dollar pour 1 000 pages, tandis que Model Vault permet un déploiement géré sur une plateforme sécurisée à locataire unique pour les volumes plus importants.

Un seul modèle au lieu d’une chaîne de traitement distincte

Parse 5 repose sur un modèle de vision et de langage de 2,3 milliards de paramètres, fondé sur l’architecture North-Micro-Vision-Instruct de Cohere Labs. Sa fenêtre de contexte compte 8 192 tokens, tandis que la taille du modèle est estimée à environ 4,6 gigaoctets. Le modèle reçoit une page PDF ou PowerPoint, ou une image JPEG encodée en base64, puis restitue son contenu dans l’ordre de lecture sous forme de Markdown.

Les tableaux sont convertis en HTML, et le modèle ajoute des descriptions des images ainsi que les coordonnées des boîtes englobantes des tableaux et des images. Le mode par défaut renvoie une chaîne Markdown pour chaque page, tandis que le mode blocks fournit des éléments typés, chaque tableau contenant son propre HTML, sa description et ses coordonnées. Cohere estime que ce format facilite le suivi de la source des informations au niveau des citations dans les applications d’agents.

Selon la source, l’arabe, l’anglais, le français, l’allemand, l’italien, le japonais, le coréen, le portugais et l’espagnol bénéficient tous d’une précision stable, avec une prise en charge zero-shot moins précise pour les autres langues.

Une précision inférieure à celle des modèles plus grands, pour un coût différent

Selon le comparatif ParseBench publié par Cohere, Parse 5 a obtenu un score de 79,2 sur trois dimensions : les tableaux, la fidélité du contenu et le formatage sémantique. Il a été devancé par les modèles GPT-5.5, avec un score de 84,4, Opus 4.8, avec 84,3, et Gemini 3.5 Flash, avec 81,8. En revanche, Parse 5 a dépassé la catégorie Cost Effective de LlamaParse, qui a obtenu 78,3, ainsi que Mistral OCR 4, avec 74,5, Databricks AI Parse, avec 72,4, et Azure Document Intelligence, avec 69,3.

Le comparatif exclut les dimensions de la mise en page Layout et des graphiques Chart, ce que Cohere attribue au périmètre du produit. Le modèle restitue le texte dans l’ordre de lecture au lieu de fournir les coordonnées de chaque élément textuel, et décrit les graphiques au lieu d’en extraire les données sous-jacentes. L’entreprise indique que l’extraction des données des graphiques est prévue dans une version future.

Qu’est-ce qui change concrètement pour les entreprises ?

La principale valeur de Parse 5 réside dans la réduction de la dépendance à un grand modèle généraliste pour chaque page, et non dans une supériorité absolue sur les outils de traitement. Dans un flux de travail type d’une société de services financiers traitant 750 millions de documents par an, Cohere a estimé que l’utilisation de Parse 5 à la place de GPT-5.5 pourrait réduire les coûts de plus de 98 %. Toutefois, ce pourcentage est une estimation de l’entreprise pour un flux de travail modélisé, et non le résultat d’un déploiement audité ou d’une étude indépendante.

Ce comparatif confirme que le choix d’un outil d’analyse documentaire ne devrait pas reposer sur un seul résultat de référence. Si les tableaux, les titres ou l’ordre de lecture sont perdus lors de l’ingestion, les modèles d’embeddings ou les modèles plus grands ne pourront pas ensuite rétablir la structure manquante. Les entreprises devront donc tester Parse 5 sur leurs documents les plus difficiles et mesurer la précision de la recherche d’information ainsi que celle des tâches finales, plutôt que de se contenter d’évaluer l’apparence du texte extrait.

Les avis d’experts cités dans la source appuient cette utilisation prudente : selon eux, Parse 5 se situe entre l’OCR traditionnel et l’exécution d’un modèle généraliste coûteux sur chaque page. La question reste ouverte de savoir si la préservation de la structure et des coordonnées des éléments, ainsi que le faible prix, produiront effectivement de meilleurs résultats dans les applications finales, notamment pour les documents riches en graphiques ou dotés de mises en page complexes.

Source de l’actualité
VentureBeat Startups & Funding
Ouvrir la source originale ↗
ف
Auteur

فريق تحرير certi.news

Dans la même catégorie

À lire également

Voir toutes les actualités