Inteligencia artificial

Cohere lanza Parse 5 para el procesamiento de documentos con IA a un costo de 1,50 dólares por cada mil páginas

Cohere lanzó Parse 5, un modelo de visión y lenguaje de 2.300 millones de parámetros que convierte archivos PDF, presentaciones e imágenes en Markdown estructurado, con compatibilidad para tablas, descripción de imágenes y localización de elementos. El modelo no encabeza la comparación de precisión publicada por la empresa, pero apuesta por reducir el costo del procesamiento a gran escala, con un precio de 1,50 dólares por cada mil páginas.

2026-08-28
5 min de lectura
6 visitas
فريق تحرير certi.news
Cohere lanza Parse 5 para el procesamiento de documentos con IA a un costo de 1,50 dólares por cada mil páginas

Cohere anunció la disponibilidad de Parse 5 para procesar archivos PDF, presentaciones e imágenes escaneadas y convertirlos en Markdown estructurado, con el objetivo de atender a organizaciones que necesitan introducir grandes cantidades de documentos en aplicaciones de inteligencia artificial y agentes de software. El modelo está disponible a través de Cohere API, Model Vault, Microsoft Foundry y AWS SageMaker.

La empresa posiciona Parse 5 de forma diferente a los modelos de IA generales más grandes: no como el más preciso, sino como un intento de equilibrar precisión y costo al procesar millones de páginas. Cohere fijó el precio de uso mediante la interfaz de programación en 1,50 dólares por cada 1.000 páginas, mientras que Model Vault permite el despliegue gestionado en una plataforma segura de un solo inquilino para volúmenes mayores.

Un solo modelo en lugar de una cadena de procesamiento independiente

Parse 5 se basa en un modelo de visión y lenguaje con 2.300 millones de parámetros, construido sobre la arquitectura North-Micro-Vision-Instruct de Cohere Labs. La ventana de contexto tiene una longitud de 8.192 tokens, mientras que el tamaño del modelo se estima en aproximadamente 4,6 gigabytes. El modelo recibe una página de PDF o PowerPoint, o una imagen JPEG codificada en base64, y devuelve su contenido en orden de lectura en formato Markdown.

Las tablas se convierten a HTML, y el modelo también añade descripciones de imágenes y las coordenadas de los cuadros delimitadores de tablas e imágenes. El modo predeterminado devuelve una cadena de Markdown por página, mientras que el modo blocks proporciona elementos tipados, de modo que cada tabla contiene su propio HTML, su descripción y sus coordenadas. Cohere considera que este formato ayuda a rastrear el origen de la información a nivel de cita dentro de las aplicaciones de agentes.

Según la fuente, el árabe, el inglés, el francés, el alemán, el italiano, el japonés, el coreano, el portugués y el español alcanzan una precisión estable, mientras que admite zero-shot con menor precisión para otros idiomas.

Menor precisión que los modelos más grandes y un costo diferente

Según la comparación ParseBench publicada por Cohere, Parse 5 obtuvo una puntuación de 79,2 en tres dimensiones: tablas, fidelidad del contenido y formato semántico. Lo superaron los modelos GPT-5.5, con 84,4 puntos; Opus 4.8, con 84,3; y Gemini 3.5 Flash, con 81,8. En cambio, Parse 5 superó a la categoría Cost Effective de LlamaParse, que obtuvo 78,3; a Mistral OCR 4, con 74,5; a Databricks AI Parse, con 72,4; y a Azure Document Intelligence, con 69,3.

La comparación excluye las dimensiones de diseño Layout y gráficos Chart, y Cohere afirma que esto se debe al alcance del producto. El modelo devuelve el texto en orden de lectura en lugar de proporcionar coordenadas para cada elemento textual, y describe los gráficos en lugar de extraer sus datos subyacentes. La empresa afirma que la extracción de datos de gráficos está prevista para una versión futura.

¿Qué cambia en la práctica para las organizaciones?

El valor principal de Parse 5 reside en reducir la dependencia de un modelo general grande para cada página, no en superar absolutamente a las herramientas de procesamiento. Cohere estimó, en un flujo de trabajo típico de una empresa de servicios financieros que procesa 750 millones de documentos al año, que utilizar Parse 5 en lugar de GPT-5.5 podría reducir el costo en más de un 98 %. Sin embargo, este porcentaje es una estimación de la empresa para un flujo de trabajo modelado, no el resultado de un despliegue auditado ni de un estudio independiente.

Esta comparación confirma que la elección de una herramienta de análisis de documentos no debería depender de un único resultado de referencia. Si durante la introducción se pierden las tablas, los encabezados o el orden de lectura, los modelos de embeddings o los modelos más grandes posteriores no podrán recuperar la estructura perdida. Por ello, las organizaciones tendrán que probar Parse 5 con sus documentos más difíciles y medir la precisión de la recuperación y de las tareas finales, en lugar de limitarse a evaluar el aspecto del texto extraído.

Las opiniones de los expertos incluidas en la fuente respaldan este uso prudente; consideran que Parse 5 se sitúa entre el OCR tradicional y la ejecución de un modelo general de alto costo en cada página. La pregunta abierta sigue siendo si proporcionar estructura, coordenadas de los elementos y un precio bajo conducirá realmente a mejores resultados en las aplicaciones finales, especialmente en documentos con abundantes gráficos o diseños complejos.

Fuente de la noticia
VentureBeat Startups & Funding
Abrir fuente original ↗
ف
Autor

فريق تحرير certi.news

De la misma categoría

También te puede interesar

Ver todas las noticias