FineBooks projesinin ilk aşamasının sonuçları, açık optik karakter tanıma (OCR) modellerinin çoğu kullanım durumunda tarihî kitapların metinlerini, geniş kamu malı kitap koleksiyonlarının yeniden işlenmesini pratik kılacak doğrulukla çıkarabildiğini gösteriyor. Ancak sonuçlar aynı zamanda metnin tarihî özelliklerini koruma, çıktının kütüphane sistemleriyle uyumluluğu ve değerlendirmeye dâhil edilmeyen belge ve yazı türleriyle başa çıkma konusunda önemli sınırlılıkları ortaya koyuyor.
Proje, Hugging Face ile EleutherAI arasındaki bir iş birliği ve iki amacı var: Mevcut açık OCR modellerinin tarihî kitapları geniş ölçekte işlemek için yeterince doğru, hızlı ve düşük maliyetli olup olmadığını test etmek ve ardından kamu malı kapsamındaki kitap koleksiyonlarını yeniden işleyerek iyileştirilmiş metinleri açık veri kümeleri biçiminde yayımlamak. Proje, ilk aşamasında doğal tarih alanında 300 binden fazla tarihî belgeyi ve 64 milyondan fazla bilimsel bilgi sayfasını barındıran küresel bir koleksiyon olan Biodiversity Heritage Library’yi (BHL) seçti.
Doğrulanmış 2.165 sayfaya dayanan test
FineBooks, FineBooks BHL OCR Leaderboard tablosunu; ayrıca finebooks/bhl-impact-gt referans veri kümesini ve finebooks/bhl-ocr-eval değerlendirme aracını yayımladı. Tablo, yeniden kullanıma izin veren lisanslarla sunulan 14 açık ağırlıklı OCR modelini karşılaştırıyor. Bu modeller, API anahtarları veya sayfa başına ücretler olmadan özel donanım üzerinde çalıştırılabiliyor.
Değerlendirme, 2011 ile 2012 yılları arasında IMPACT ve BHL-Europe projeleri kapsamında uzmanlar tarafından düzeltilen transkripsiyonlara dayandı. Materyal, İngilizce, Fransızca, Almanca ve Latince dillerinde altı ciltten 2.165 sayfayı kapsıyor ve yaklaşık her iki bin karakterde bir hata düzeyine sahip. Bu transkripsiyonlar, BHL koleksiyonunun tamamının AWS Open Data üzerinden toplu indirmeye açılmasından yararlanılarak her taranmış görüntüyü karşılık gelen metinle ilişkilendiren güncel bir veri kümesinde yeniden oluşturuldu.
Tablo neyi ölçüyor?
Temel ölçüm, doğru metinle karşılaştırıldığında değiştirme, silme ve eklemeleri hesaplayan karakter hata oranına (CER) dayanıyor. Sunumu kolaylaştırmak amacıyla oran doğruluk yüzdesine dönüştürüldü; CER 0,024 olduğunda bu, karakterlerin %97,6’sının doğru tanındığı anlamına geliyor.
Tablo yalnızca bu göstergeyle sınırlı değil; aynı zamanda CER’in biri okunabilir, diğeri uzun s «ſ» harfi gibi tarihî farklılıkları koruyan diplomatik olmak üzere iki sürümünü de gösteriyor. Ayrıca sayfada gerçekten bulunan kelimelerin geri çağrılma oranını, sayfada görünmeyen fazla metin oranını ve modelin belirteç sınırına ulaşana kadar metni yeniden üretmesiyle ortaya çıkan tekrarlama oranını ölçüyor. Tekrarlama döngüsüne giren sayfalar diğer bazı sonuçlardan çıkarılıyor; bu nedenle tekrarlama oranı doğruluk puanlarıyla birlikte okunmalı.
Düşük işletim maliyetiyle doğru modeller
Yayımlanan sonuç örneğine göre dots.mocr modeli %97,6 okunabilirlik doğruluğuyla ilk sırada yer aldı. Onu %96,9 doğrulukla OvisOCR2, ardından %96,1 doğrulukla PaddleOCR-VL-1.6 izledi. olmOCR-2 %95,7, LightOnOCR-2 %95,1 ve Qwen3.5-9B %94,9 oranına ulaşırken DeepSeek-OCR’un performansı %93,8 oldu.
- Hugging Face Jobs kullanılarak bin sayfanın işlenmesi, dots.mocr modeli için yaklaşık 1,94 dolara mal oldu.
- Maliyet OvisOCR2 için 0,46 dolar, PaddleOCR-VL-1.6 için 0,34 dolar ve olmOCR-2 için 0,45 dolar oldu.
- Qwen3.5-9B, bin sayfa başına 0,89 dolar maliyet kaydetti.
Hugging Face Jobs, GPU’yu başlatan, modeli veri kümesi üzerinde çalıştıran ve ardından ortamı durduran tek bir komutla görevi yürütüyor. Ayrıca her işlem model sürümünü, konteyner imajını ve betik sürümünü sabitliyor; böylece sonuçların yeniden üretilmesi ve tabloya tek bir görevle yeni modeller eklenmesi mümkün oluyor.
Modeller gerçek kullanım için yeterli mi?
Dil modeli eğitiminde kullanılan veri kümeleri açısından projenin yazarları yanıtın çoğunlukla evet olduğunu düşünüyor. Kamuya açık metinler eğitim için büyük bir kaynak oluşturuyor, ancak değerleri kalitelerine bağlı. Makale, Talkie projesinin, OCR teknolojisiyle çıkarılmış metinler üzerinde eğitilen bir dil modelinin, aynı kitapların insan eliyle hazırlanmış transkripsiyonları üzerinde eğitilen bir modelin verimliliğinin %30’u kadar verimlilikle öğrendiğini ortaya koyduğuna işaret ediyor. EleutherAI ve iş birliği yaptığı kuruluşlar tarafından başlatılan Common Pile da metni daha eski OCR işleme hatlarından çıkarılmış yaklaşık 300 bin kamu malı kitap içeriyor. Bu da daha iyi modeller kullanılarak yeniden işlenmesini açık eğitim veri kümelerinde etkili bir iyileştirme hâline getiriyor.
Kütüphanelerdeki eski OCR hatlarının değiştirilmesi ise gereken teknik altyapıya bağlı. Geleneksel sistemler genellikle kelime düzeyinde koordinatlar sağlayan ALTO XML dosyaları üretirken yeni modeller Markdown veya düz metin ve bazen metin bölgelerine ait koordinatlar üretiyor, ancak kelime koordinatları sağlamıyor. Bu nedenle kütüphaneler yeni metni mevcut altyapıya doğrudan ekleyemeyebilir.
Modeller henüz hassas akademik transkripsiyon için yeterli görünmüyor. Temel sorun her zaman sayfanın yanlış okunması değil; modelin uzun s harfini, tipografik bağları ve diğer tarihî özellikleri sessizce güncellemesi. Makalenin yazarları, uzmanlaşmış ince ayarın bu sınırlılıkları giderebileceğini düşünüyor.
Değerlendirmenin sınırları ve sonraki adımlar
Sonuçlar yalnızca dört dili ve antiqua ailesinden yazı karakterleriyle yazılmış altı cildi kapsıyor. Bu nedenle sonuçlar Alman Fraktur yazısına, Latin dışı yazı sistemlerine, Avrupa dışı dillere veya el yazmalarına genellenemez. Ayrıca proje bilerek kitaplara odaklanıyor; kitaplar gazetelerden, dergilerden ve arşiv materyallerinden görsel olarak daha düzenli. Tablo, çok sütunlu sayfaları veya karmaşık unsurları da test etmiyor.
FineBooks, yeni modelleri tabloya eklemeye ve ardından BHL’nin tüm kamuya açık koleksiyonunu yeniden işlemeye devam etmeyi planlıyor. Koleksiyondaki yaklaşık 300 bin öğeden yaklaşık 200 bini, kamu malı kapsamında olduğunu gösteren verilere sahip. Proje, bu materyalleri işlemek ve ortaya çıkan metni ilk FineBooks veri kümesi olarak yayımlamak için gelişmiş modellerden birini kullanacak; geliştirilecek veri kümelerini, işleme hatlarını ve destekleyici modelleri açık biçimde paylaşacak.