Cohere, PDF dosyalarını, sunumları ve taranmış görselleri düzenli Markdown’a dönüştürmek üzere Parse 5’i kullanıma sunduğunu açıkladı. Model, büyük miktarlarda belgeyi yapay zekâ uygulamalarına ve yazılım ajanlarına aktarması gereken kurumları hedefliyor. Model Cohere API, Model Vault, Microsoft Foundry ve AWS SageMaker üzerinden sunuluyor.
Şirket, Parse 5’i daha büyük genel amaçlı yapay zekâ modellerinden farklı bir konumda değerlendiriyor: En yüksek doğruluğa sahip model olarak değil, milyonlarca sayfayı işlerken doğruluk ile maliyet arasında denge kurma girişimi olarak. Cohere, API kullanımı için 1.000 sayfa başına 1,50 dolar fiyat belirledi. Model Vault ise daha büyük hacimler için tek kiracılı güvenli bir platformda yönetilen dağıtım olanağı sunuyor.
Ayrı bir işleme zinciri yerine tek model
Parse 5, Cohere Labs’ın North-Micro-Vision-Instruct mimarisi temelinde oluşturulmuş, 2,3 milyar parametreli bir görme ve dil modeline dayanıyor. Bağlam penceresinin uzunluğu 8.192 token, modelin boyutu ise yaklaşık 4,6 gigabayt. Model, bir PDF veya PowerPoint sayfasını ya da base64 ile kodlanmış JPEG görselini alıyor ve içeriğini okuma sırasına göre Markdown biçiminde geri döndürüyor.
Tablolar HTML’ye dönüştürülüyor; model ayrıca görseller için açıklamalar ve tablolarla görsellere ait sınırlayıcı kutu koordinatları ekliyor. Varsayılan mod, her sayfa için bir Markdown dizisi döndürürken blocks modu, türü belirtilmiş öğeler sunuyor; böylece her tablo kendi HTML’sini, açıklamasını ve koordinatlarını içeriyor. Cohere, bu biçimin ajan uygulamalarında alıntı düzeyinde bilgi kaynağının izlenmesine yardımcı olduğunu düşünüyor.
Kaynağa göre Arapça, İngilizce, Fransızca, Almanca, İtalyanca, Japonca, Korece, Portekizce ve İspanyolca için istikrarlı doğruluk elde ediliyor; diğer diller için ise daha düşük doğrulukla zero-shot desteği sunuluyor.
Daha büyük modellerden düşük doğruluk, farklı bir fiyat karşılığı
Cohere’nin yayımladığı ParseBench karşılaştırmasına göre Parse 5, tablolar, içerik sadakati ve anlamsal biçimlendirme olmak üzere üç boyutta 79,2 puan aldı. GPT-5.5 modelleri 84,4 puanla, Opus 4.8 84,3 puanla ve Gemini 3.5 Flash 81,8 puanla Parse 5’in önünde yer aldı. Buna karşılık Parse 5, 78,3 puan alan LlamaParse’in Cost Effective kategorisini, 74,5 puan alan Mistral OCR 4’ü, 72,4 puan alan Databricks AI Parse’ı ve 69,3 puan alan Azure Document Intelligence’ı geride bıraktı.
Karşılaştırma, Layout ve Chart boyutlarını kapsamıyor. Cohere bunun ürünün kapsamından kaynaklandığını belirtiyor. Model, her metin öğesi için koordinat sağlamak yerine metni okuma sırasına göre döndürüyor ve grafiklerden temel verileri çıkarmak yerine grafikleri açıklıyor. Şirket, grafik verilerinin çıkarılmasının gelecekteki bir sürüm için planlandığını söylüyor.
Kurumlar açısından pratikte ne değişiyor?
Parse 5’in temel değeri, her sayfa için büyük bir genel amaçlı modele duyulan bağımlılığı azaltmasında yatıyor; işleme araçlarını mutlak anlamda geride bırakmasında değil. Cohere, yılda 750 milyon belge işleyen bir finansal hizmetler şirketinin örnek iş akışında GPT-5.5 yerine Parse 5 kullanılmasının maliyeti yüzde 98’den fazla azaltabileceğini tahmin etti. Ancak bu oran, şirketin modellenmiş bir iş akışı için yaptığı tahmindir; denetlenmiş bir dağıtımın veya bağımsız bir çalışmanın sonucu değildir.
Bu karşılaştırma, belge analiz aracının seçiminin tek bir kıyaslama sonucuna dayanmaması gerektiğini gösteriyor. Giriş sırasında tablolar, başlıklar veya okuma sırası kaybedilirse, daha sonra kullanılan gömme modelleri ya da daha büyük modeller kaybolan yapıyı geri getiremez. Bu nedenle kurumların Parse 5’i en zor belgeleri üzerinde test etmesi ve yalnızca çıkarılan metnin görünümünü değerlendirmekle yetinmeyerek erişim doğruluğunu ve nihai görevleri ölçmesi gerekecek.
Kaynakta yer alan uzman görüşleri de bu ihtiyatlı kullanımı destekliyor; uzmanlar Parse 5’in geleneksel OCR ile her sayfada yüksek maliyetli bir genel amaçlı model çalıştırma arasında konumlandığını düşünüyor. Açık soru ise yapının ve öğe koordinatlarının sağlanmasıyla düşük fiyatın, özellikle grafikler veya karmaşık düzenler açısından zengin belgelerde, nihai uygulamalarda gerçekten daha iyi sonuçlara yol açıp açmayacağı.