인공지능

Cohere, 문서 AI 처리를 위해 페이지 1,000장당 1.50달러의 Parse 5 출시

Cohere가 PDF, 프레젠테이션 및 이미지를 표준화된 Markdown으로 변환하는 23억 개 매개변수 규모의 비전·언어 모델 Parse 5를 출시했다. 이 모델은 표 지원, 이미지 설명 및 요소 위치 지정을 제공한다. 회사가 공개한 정확도 비교에서 선두를 차지하지는 않지만, 대규모 처리 비용 절감을 목표로 하며 가격은 페이지 1,000장당 1.50달러다.

2026-08-28
3 분 읽기
6 조회수
فريق تحرير certi.news
Cohere, 문서 AI 처리를 위해 페이지 1,000장당 1.50달러의 Parse 5 출시

Cohere는 PDF 파일, 프레젠테이션 및 스캔 이미지를 표준화된 Markdown으로 변환하는 Parse 5를 제공한다고 발표했다. 대량의 문서를 AI 애플리케이션과 소프트웨어 에이전트에 입력해야 하는 기업을 대상으로 하며, Cohere API, Model Vault, Microsoft Foundry 및 AWS SageMaker를 통해 이용할 수 있다.

회사는 Parse 5를 더 큰 범용 AI 모델과는 다른 위치에 둔다. 가장 정확한 모델이라기보다 수백만 페이지를 처리할 때 정확도와 비용 사이의 균형을 이루려는 시도라는 것이다. Cohere는 API 사용 가격을 페이지 1,000장당 1.50달러로 책정했으며, Model Vault는 더 큰 규모의 작업을 위해 단일 테넌트 보안 플랫폼에서 관리형 배포를 제공한다.

별도의 처리 파이프라인 대신 하나의 모델

Parse 5는 23억 개 매개변수를 포함하는 비전·언어 모델로, Cohere Labs의 North-Micro-Vision-Instruct 아키텍처를 기반으로 한다. 컨텍스트 윈도우 길이는 8,192토큰이며 모델 크기는 약 4.6기가바이트다. 이 모델은 PDF 또는 PowerPoint 페이지나 JPEG 이미지를 base64로 인코딩된 이미지 형식으로 입력받은 뒤, 읽기 순서에 따라 Markdown으로 내용을 반환한다.

표는 HTML로 변환되며, 모델은 이미지 설명과 표 및 이미지의 바운딩 박스 좌표도 추가한다. 기본 모드는 페이지별 Markdown 문자열을 반환하고, blocks 모드는 유형이 지정된 요소를 제공하므로 각 표에는 자체 HTML, 설명 및 좌표가 포함된다. Cohere는 이러한 형식이 에이전트 애플리케이션에서 인용 수준으로 정보의 출처를 추적하는 데 도움이 된다고 본다.

아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어 및 스페인어는 출처에 따르면 안정적인 정확도를 제공하며, 다른 언어도 지원하지만 zero-shot 정확도는 더 낮다.

더 큰 모델보다 낮은 정확도와 다른 비용 구조

Cohere가 공개한 ParseBench 비교에서 Parse 5는 표, 콘텐츠 충실도 및 의미적 서식이라는 세 가지 차원에서 79.2점을 기록했다. GPT-5.5 모델은 84.4점, Opus 4.8은 84.3점, Gemini 3.5 Flash는 81.8점으로 Parse 5를 앞섰다. 반면 Parse 5는 78.3점을 기록한 LlamaParse의 Cost Effective 등급과 74.5점의 Mistral OCR 4, 72.4점의 Databricks AI Parse, 69.3점의 Azure Document Intelligence를 앞섰다.

이 비교에서는 레이아웃 Layout과 차트 Chart라는 두 차원을 제외했으며, Cohere는 제품 범위 때문이라고 설명한다. 이 모델은 각 텍스트 요소의 좌표를 제공하는 대신 읽기 순서에 따라 텍스트를 반환하고, 차트의 기초 데이터를 추출하는 대신 차트를 설명한다. 회사는 차트 데이터 추출을 향후 출시할 예정이라고 밝혔다.

기업에 실질적으로 달라지는 점은 무엇인가?

Parse 5의 핵심 가치는 처리 도구를 절대적으로 능가하는 데 있는 것이 아니라, 페이지마다 대형 범용 모델에 의존하는 일을 줄이는 데 있다. Cohere는 연간 7억 5천만 개의 문서를 처리하는 금융 서비스 기업의 전형적인 작업 흐름에서 GPT-5.5 대신 Parse 5를 사용하면 비용을 98% 이상 낮출 수 있다고 추정했다. 그러나 이 비율은 회사가 모델링한 작업 흐름을 바탕으로 산출한 추정치이며, 감사를 거친 배포 결과나 독립적인 연구 결과는 아니다.

이 비교는 문서 분석 도구의 선택이 하나의 벤치마크 결과에만 좌우되어서는 안 된다는 점을 보여준다. 입력 과정에서 표, 제목 또는 읽기 순서를 잃으면 이후의 임베딩 모델이나 더 큰 모델도 손실된 구조를 복원할 수 없다. 따라서 기업은 추출된 텍스트의 형태만 평가하는 데 그치지 말고, 가장 어려운 문서에서 Parse 5를 테스트하고 검색 정확도와 최종 작업 성능을 측정해야 한다.

출처에 포함된 전문가 의견도 이러한 신중한 사용을 뒷받침한다. 전문가들은 Parse 5가 전통적인 OCR과 모든 페이지에서 비용이 높은 범용 모델을 실행하는 방식 사이에 있다고 본다. 구조와 요소 좌표, 낮은 가격이 특히 차트가 많거나 레이아웃이 복잡한 문서에서 최종 애플리케이션의 실제 결과 개선으로 이어질지는 여전히 열린 질문이다.

뉴스 출처
VentureBeat Startups & Funding
원문 보기 ↗
ف
작성자

فريق تحرير certi.news

같은 카테고리

추천 기사

모든 뉴스 보기