FineBooks 项目第一阶段的结果显示,开放光学字符识别(OCR)模型在大多数使用场景中已经能够以足够高的准确率提取历史书籍文本,使大规模重新处理公共领域书籍集合成为可行之事。但结果同时揭示了重要限制,包括保留文本历史特征、使输出与图书馆系统兼容,以及处理评估未涵盖的文档类型和字体。
该项目由 Hugging Face 与 EleutherAI 合作开展,目标有两个:测试当前开放 OCR 模型是否足够准确、快速且低成本,以便大规模处理历史书籍;然后重新处理公共领域书籍集合,并以开放数据集的形式发布改进后的文本。项目第一阶段选择了生物多样性遗产图书馆(Biodiversity Heritage Library,BHL),这是一个全球性集合,包含超过 30 万份自然史领域的历史文献,涵盖超过 6,400 万页科学知识。
基于 2,165 个经过验证页面的测试
FineBooks 发布了 FineBooks BHL OCR Leaderboard,以及基准数据集 finebooks/bhl-impact-gt 和评估工具 finebooks/bhl-ocr-eval。该排行榜比较了 14 个开放权重且采用允许再利用的许可证授权的 OCR 模型,因此可以在自有硬件上运行,无需 API 密钥或按页付费。
评估依据是 IMPACT 和 BHL-Europe 项目在 2011 年至 2012 年间由专家校正的转录文本。这些材料包括六卷书中的 2,165 页,语言为英语、法语、德语和拉丁语,准确度约为每 2,000 个字符出现一个错误。这些转录文本被重新整理为现代数据集,将每张扫描图像与对应文本关联起来,并利用 BHL 整个集合可通过 AWS Open Data 批量下载这一条件。
排行榜测量什么?
基本指标是字符错误率(CER),用于计算与正确文本相比的替换、删除和插入数量。为便于展示,错误率被转换为准确率;例如 CER 为 0.024,意味着 97.6% 的字符被准确识别。
排行榜并不只提供这一指标,还展示两个版本的 CER:一个用于可读性,另一个是保留历史差异的外交式版本,例如长 s 字符“ſ”。此外,它还测量页面中实际存在的词语召回率、页面中不存在的额外文本比例,以及模型重复生成文本直至达到令牌上限时产生的重复率。进入重复循环的页面会被排除在部分其他结果之外,因此应结合准确率分数解读重复率。
准确且运行成本低的模型
根据发布的结果样本,dots.mocr 模型以 97.6% 的可读性准确率排名第一,其次是准确率为 96.9% 的 OvisOCR2,以及准确率为 96.1% 的 PaddleOCR-VL-1.6。olmOCR-2 的准确率为 95.7%,LightOnOCR-2 为 95.1%,Qwen3.5-9B 为 94.9%,而 DeepSeek-OCR 的表现为 93.8%。
- 使用 Hugging Face Jobs 处理 1,000 页时,dots.mocr 的成本约为 1.94 美元。
- OvisOCR2 的成本为 0.46 美元,PaddleOCR-VL-1.6 为 0.34 美元,olmOCR-2 为 0.45 美元。
- Qwen3.5-9B 的成本为每 1,000 页 0.89 美元。
Hugging Face Jobs 通过一条命令运行任务:启动图形处理器,在数据集上运行模型,然后关闭环境。此外,每次运行都会固定模型版本、容器镜像和脚本版本,从而能够复现结果,并通过一个任务将新模型添加到排行榜中。
这些模型是否足以用于实际场景?
对于用于训练语言模型的数据集,项目作者认为答案通常是肯定的。公共领域文本是重要的训练来源,但其价值取决于质量。文章指出,Talkie 项目发现,在通过 OCR 提取的文本上训练的语言模型,其学习效率达到了在同一批书籍的人工作者版本上训练的模型的 30%。EleutherAI 及其合作者推出的 Common Pile 还包含约 30 万本公共领域书籍,其文本来自较早的 OCR 处理流程,因此使用更好模型重新处理这些文本,将对开放训练集合产生显著改进。
至于是否应在图书馆中替换旧的 OCR 流程,则取决于所需的技术架构。传统系统通常生成 ALTO XML 文件,为词语级别提供坐标;而新模型生成 Markdown 或纯文本,有时也会提供文本区域坐标,但不会提供词语坐标。因此,图书馆未必能将新文本直接导入现有架构。
这些模型目前似乎也不足以完成精确的学术转录。核心问题并不总是页面识别错误,而是模型会默默地将长 s 或印刷连字等历史特征现代化。文章作者认为,专门的微调可能有助于解决这些限制。
评估局限与后续步骤
结果仅涵盖四种语言和六卷采用 antiquа 字体家族书写的书籍。因此,不能将其推广到德语 Fraktur 字体、非拉丁文字系统、非欧洲语言或手写稿件。项目还刻意聚焦于书籍,因为书籍在视觉上比报纸、杂志和档案材料更加规整;排行榜也未测试多栏页面或复杂元素。
FineBooks 计划继续向排行榜添加新模型,然后重新处理整个 BHL 公共领域集合。在集合约 30 万个项目中,约 20 万个项目带有表明其属于公共领域的数据。项目将使用其中一个先进模型处理这些材料,并将生成的文本作为首个 FineBooks 数据集发布,同时开放共享将开发的数据集、处理流程和辅助模型。