الذكاء الاصطناعي

FineBooks تختبر قدرة نماذج OCR المفتوحة على استعادة المعرفة من الكتب التاريخية

تقيّم مبادرة مشتركة بين Hugging Face وEleutherAI أداء 14 نموذج OCR مفتوحاً على 2,165 صفحة تاريخية، وتخلص إلى أن النماذج الحالية مناسبة غالباً لتحسين بيانات تدريب النماذج اللغوية، لكنها لا تلبي جميع متطلبات المكتبات أو النسخ الأكاديمي بعد.

15 يوليو 2026
5 دقائق قراءة
1 قراءة
FineBooks تختبر قدرة نماذج OCR المفتوحة على استعادة المعرفة من الكتب التاريخية

تُظهر نتائج المرحلة الأولى من مشروع FineBooks أن نماذج التعرف الضوئي على الحروف (OCR) المفتوحة باتت قادرة، في معظم حالات الاستخدام، على استخراج نصوص الكتب التاريخية بدقة تجعل إعادة معالجة مجموعات ضخمة من الكتب العامة أمراً عملياً. لكن النتائج تكشف في الوقت نفسه عن قيود مهمة تتعلق بالحفاظ على السمات التاريخية للنص، وتوافق المخرجات مع أنظمة المكتبات، والتعامل مع أنواع الوثائق والخطوط التي لم يشملها التقييم.

المشروع هو تعاون بين Hugging Face وEleutherAI، وله هدفان: اختبار ما إذا كانت نماذج OCR المفتوحة الحالية دقيقة وسريعة ومنخفضة التكلفة بما يكفي لمعالجة الكتب التاريخية على نطاق واسع، ثم إعادة معالجة مجموعات من الكتب الواقعة ضمن الملكية العامة ونشر النصوص المحسنة في صورة مجموعات بيانات مفتوحة. اختار المشروع في مرحلته الأولى مكتبة Biodiversity Heritage Library (BHL)، وهي مجموعة عالمية تضم أكثر من 300 ألف وثيقة تاريخية في التاريخ الطبيعي، بما يزيد على 64 مليون صفحة من المعرفة العلمية.

اختبار يعتمد على 2,165 صفحة موثقة

أصدر FineBooks لوحة FineBooks BHL OCR Leaderboard، إلى جانب مجموعة البيانات المرجعية finebooks/bhl-impact-gt وأداة التقييم finebooks/bhl-ocr-eval. وتقارن اللوحة بين 14 نموذج OCR مفتوح الأوزان ومرخصاً بتراخيص تسمح بإعادة الاستخدام، بحيث يمكن تشغيلها على العتاد الخاص من دون مفاتيح API أو رسوم لكل صفحة.

استند التقييم إلى نسخ صححها خبراء ضمن مشروعَي IMPACT وBHL-Europe بين عامي 2011 و2012. وتشمل هذه المادة 2,165 صفحة من ستة مجلدات، باللغات الإنجليزية والفرنسية والألمانية واللاتينية، مع مستوى دقة يقارب خطأ واحداً لكل ألفي حرف. وقد أُعيد بناء هذه النسخ في مجموعة بيانات حديثة تربط كل صورة مسح ضوئي بالنص المقابل لها، مستفيدة من إتاحة مجموعة BHL بأكملها للتنزيل الجماعي عبر AWS Open Data.

ماذا تقيس اللوحة؟

يعتمد القياس الأساسي على معدل خطأ الأحرف (CER)، الذي يحسب الاستبدالات والحذف والإضافات مقارنة بالنص الصحيح. ولتبسيط العرض، حُوّل المعدل إلى نسبة دقة؛ فعندما يبلغ CER مقدار 0.024 فهذا يعني التعرف بدقة على 97.6% من الأحرف.

لا تكتفي اللوحة بهذا المؤشر، إذ تعرض أيضاً نسختين من CER، إحداهما للقراءة والأخرى دبلوماسية تحافظ على الفروق التاريخية مثل حرف s الطويل «ſ». كما تقيس استدعاء الكلمات الموجودة فعلياً في الصفحة، ونسبة النص الزائد الذي لا يظهر في الصفحة، ومعدل التكرار الذي يحدث عندما يعيد النموذج إنتاج النص حتى يصل إلى حد الرموز. وتُستبعد الصفحات التي تدخل في حلقة تكرار من بعض النتائج الأخرى، لذلك ينبغي قراءة معدل التكرار إلى جانب درجات الدقة.

نماذج دقيقة بتكلفة تشغيل منخفضة

وفق العينة المنشورة من النتائج، تصدر نموذج dots.mocr بدقة قراءة بلغت 97.6%، يليه OvisOCR2 بدقة 96.9%، ثم PaddleOCR-VL-1.6 بدقة 96.1%. وسجل olmOCR-2 نسبة 95.7%، وLightOnOCR-2 95.1%، وQwen3.5-9B 94.9%، بينما بلغ أداء DeepSeek-OCR 93.8%.

  • بلغت تكلفة معالجة ألف صفحة باستخدام Hugging Face Jobs نحو 1.94 دولار لنموذج dots.mocr.
  • بلغت التكلفة 0.46 دولار لـ OvisOCR2، و0.34 دولار لـ PaddleOCR-VL-1.6، و0.45 دولار لـ olmOCR-2.
  • سجل Qwen3.5-9B تكلفة قدرها 0.89 دولار لكل ألف صفحة.

تُشغّل Hugging Face Jobs المهمة عبر أمر واحد يبدأ تشغيل وحدة معالجة رسومية، ويمرر النموذج على مجموعة البيانات، ثم يوقف البيئة. كما تُثبت كل عملية إصدار النموذج وصورة الحاوية ونسخة البرنامج النصي، ما يتيح إعادة إنتاج النتائج وإضافة نماذج جديدة إلى اللوحة بمهمة واحدة.

هل تكفي النماذج للاستخدام الفعلي؟

بالنسبة إلى مجموعات البيانات المستخدمة في تدريب النماذج اللغوية، يرى مؤلفو المشروع أن الإجابة غالباً نعم. فالنصوص العامة تمثل مصدراً كبيراً للتدريب، لكن قيمتها تعتمد على جودتها. ويشير المقال إلى أن مشروع Talkie وجد أن نموذجاً لغوياً دُرّب على نصوص مستخرجة بتقنية OCR تعلم بكفاءة تبلغ 30% من كفاءة نموذج دُرّب على نسخ بشرية للكتب نفسها. كما يضم Common Pile، الذي أطلقته EleutherAI ومتعاونون معها، نحو 300 ألف كتاب عام استُخرج نصها من خطوط معالجة OCR أقدم، ما يجعل إعادة المعالجة باستخدام نماذج أفضل تحسيناً مؤثراً في مجموعات التدريب المفتوحة.

أما استبدال خطوط OCR القديمة في المكتبات، فالأمر يعتمد على البنية التقنية المطلوبة. فالأنظمة التقليدية تنتج عادة ملفات ALTO XML التي توفر إحداثيات على مستوى الكلمات، بينما تنتج النماذج الجديدة Markdown أو نصاً عادياً، وأحياناً إحداثيات لمناطق النص، لكنها لا توفر إحداثيات الكلمات. لذلك لا تستطيع المكتبات بالضرورة إدخال النص الجديد مباشرة في البنية القائمة.

ولا تبدو النماذج كافية بعد للنسخ الأكاديمي الدقيق. فالمشكلة الأساسية ليست دائماً سوء قراءة الصفحة، بل قيام النموذج بتحديث حرف s الطويل أو الوصلات الطباعية وغيرها من السمات التاريخية بصمت. ويرى مؤلفو المقال أن الضبط الدقيق المتخصص قد يعالج هذه القيود.

حدود التقييم والخطوات التالية

لا تشمل النتائج سوى أربعة لغات وستة مجلدات مكتوبة بخطوط من عائلة antiqua. ولذلك لا يمكن تعميمها على الخط الألماني Fraktur، أو أنظمة الكتابة غير اللاتينية، أو اللغات غير الأوروبية، أو المخطوطات اليدوية. كما يركز المشروع عمداً على الكتب، وهي أكثر انتظاماً بصرياً من الصحف والمجلات والمواد الأرشيفية، ولا تختبر اللوحة الصفحات متعددة الأعمدة أو العناصر المعقدة.

يعتزم FineBooks مواصلة إضافة النماذج الجديدة إلى اللوحة، ثم إعادة معالجة مجموعة BHL العامة بأكملها. ومن بين نحو 300 ألف عنصر في المجموعة، يحمل قرابة 200 ألف عنصر بيانات تشير إلى وقوعه ضمن الملكية العامة. وسيستخدم المشروع أحد النماذج المتقدمة لمعالجة هذه المواد ونشر النص الناتج بوصفه أول مجموعة بيانات FineBooks، مع مشاركة مجموعات البيانات وخطوط المعالجة والنماذج المساندة التي سيجري تطويرها بصورة مفتوحة.

من نفس التصنيف

مقالات قد تهمك

عرض جميع المقالات