Cohere anunció la disponibilidad de Parse 5 para procesar archivos PDF, presentaciones e imágenes escaneadas y convertirlos en Markdown estructurado, con el objetivo de atender a organizaciones que necesitan introducir grandes cantidades de documentos en aplicaciones de inteligencia artificial y agentes de software. El modelo está disponible a través de Cohere API, Model Vault, Microsoft Foundry y AWS SageMaker.
La empresa posiciona Parse 5 de forma diferente a los modelos de IA generales más grandes: no como el más preciso, sino como un intento de equilibrar precisión y costo al procesar millones de páginas. Cohere fijó el precio de uso mediante la interfaz de programación en 1,50 dólares por cada 1.000 páginas, mientras que Model Vault permite el despliegue gestionado en una plataforma segura de un solo inquilino para volúmenes mayores.
Un solo modelo en lugar de una cadena de procesamiento independiente
Parse 5 se basa en un modelo de visión y lenguaje con 2.300 millones de parámetros, construido sobre la arquitectura North-Micro-Vision-Instruct de Cohere Labs. La ventana de contexto tiene una longitud de 8.192 tokens, mientras que el tamaño del modelo se estima en aproximadamente 4,6 gigabytes. El modelo recibe una página de PDF o PowerPoint, o una imagen JPEG codificada en base64, y devuelve su contenido en orden de lectura en formato Markdown.
Las tablas se convierten a HTML, y el modelo también añade descripciones de imágenes y las coordenadas de los cuadros delimitadores de tablas e imágenes. El modo predeterminado devuelve una cadena de Markdown por página, mientras que el modo blocks proporciona elementos tipados, de modo que cada tabla contiene su propio HTML, su descripción y sus coordenadas. Cohere considera que este formato ayuda a rastrear el origen de la información a nivel de cita dentro de las aplicaciones de agentes.
Según la fuente, el árabe, el inglés, el francés, el alemán, el italiano, el japonés, el coreano, el portugués y el español alcanzan una precisión estable, mientras que admite zero-shot con menor precisión para otros idiomas.
Menor precisión que los modelos más grandes y un costo diferente
Según la comparación ParseBench publicada por Cohere, Parse 5 obtuvo una puntuación de 79,2 en tres dimensiones: tablas, fidelidad del contenido y formato semántico. Lo superaron los modelos GPT-5.5, con 84,4 puntos; Opus 4.8, con 84,3; y Gemini 3.5 Flash, con 81,8. En cambio, Parse 5 superó a la categoría Cost Effective de LlamaParse, que obtuvo 78,3; a Mistral OCR 4, con 74,5; a Databricks AI Parse, con 72,4; y a Azure Document Intelligence, con 69,3.
La comparación excluye las dimensiones de diseño Layout y gráficos Chart, y Cohere afirma que esto se debe al alcance del producto. El modelo devuelve el texto en orden de lectura en lugar de proporcionar coordenadas para cada elemento textual, y describe los gráficos en lugar de extraer sus datos subyacentes. La empresa afirma que la extracción de datos de gráficos está prevista para una versión futura.
¿Qué cambia en la práctica para las organizaciones?
El valor principal de Parse 5 reside en reducir la dependencia de un modelo general grande para cada página, no en superar absolutamente a las herramientas de procesamiento. Cohere estimó, en un flujo de trabajo típico de una empresa de servicios financieros que procesa 750 millones de documentos al año, que utilizar Parse 5 en lugar de GPT-5.5 podría reducir el costo en más de un 98 %. Sin embargo, este porcentaje es una estimación de la empresa para un flujo de trabajo modelado, no el resultado de un despliegue auditado ni de un estudio independiente.
Esta comparación confirma que la elección de una herramienta de análisis de documentos no debería depender de un único resultado de referencia. Si durante la introducción se pierden las tablas, los encabezados o el orden de lectura, los modelos de embeddings o los modelos más grandes posteriores no podrán recuperar la estructura perdida. Por ello, las organizaciones tendrán que probar Parse 5 con sus documentos más difíciles y medir la precisión de la recuperación y de las tareas finales, en lugar de limitarse a evaluar el aspecto del texto extraído.
Las opiniones de los expertos incluidas en la fuente respaldan este uso prudente; consideran que Parse 5 se sitúa entre el OCR tradicional y la ejecución de un modelo general de alto costo en cada página. La pregunta abierta sigue siendo si proporcionar estructura, coordenadas de los elementos y un precio bajo conducirá realmente a mejores resultados en las aplicaciones finales, especialmente en documentos con abundantes gráficos o diseños complejos.