Искусственный интеллект

FineBooks тестирует способность открытых OCR-моделей восстанавливать знания из исторических книг

Совместная инициатива Hugging Face и EleutherAI оценивает работу 14 открытых OCR-моделей на 2 165 исторических страницах и приходит к выводу, что современные модели в основном подходят для улучшения данных, используемых при обучении языковых моделей, но пока не отвечают всем требованиям библиотек или академической транскрипции.

2026-07-15
5 мин. чтения
8 просмотров
فريق تحرير certi.news
FineBooks тестирует способность открытых OCR-моделей восстанавливать знания из исторических книг

Результаты первого этапа проекта FineBooks показывают, что открытые модели оптического распознавания символов (OCR) в большинстве сценариев уже способны извлекать тексты исторических книг с точностью, делающей практичной повторную обработку крупных коллекций книг, находящихся в общественном достоянии. Вместе с тем результаты выявляют важные ограничения, связанные с сохранением исторических особенностей текста, совместимостью выходных данных с библиотечными системами, а также обработкой типов документов и шрифтов, не охваченных оцениванием.

Проект представляет собой сотрудничество Hugging Face и EleutherAI и преследует две цели: проверить, достаточно ли современные открытые OCR-модели точны, быстры и недороги для обработки исторических книг в больших масштабах, а затем повторно обработать коллекции книг, находящихся в общественном достоянии, и опубликовать улучшенные тексты в виде открытых наборов данных. На первом этапе проект выбрал Biodiversity Heritage Library (BHL) — глобальную коллекцию, включающую более 300 тысяч исторических документов по естественной истории и более 64 миллионов страниц научных знаний.

Тестирование на основе 2 165 проверенных страниц

FineBooks выпустил таблицу лидеров FineBooks BHL OCR Leaderboard, а также эталонный набор данных finebooks/bhl-impact-gt и инструмент оценки finebooks/bhl-ocr-eval. В таблице сравниваются 14 открытых OCR-моделей с доступными весами и лицензиями, разрешающими повторное использование, благодаря чему их можно запускать на собственном оборудовании без API-ключей и постраничной оплаты.

Оценивание основывалось на экспертно исправленных транскрипциях, подготовленных в рамках проектов IMPACT и BHL-Europe в 2011–2012 годах. Материал включает 2 165 страниц из шести томов на английском, французском, немецком и латинском языках, с уровнем точности около одной ошибки на две тысячи символов. Эти транскрипции были заново собраны в современный набор данных, связывающий каждое отсканированное изображение с соответствующим текстом, с использованием возможности массовой загрузки всей коллекции BHL через AWS Open Data.

Что измеряет таблица лидеров?

Основным показателем является частота ошибок в символах (CER), которая подсчитывает замены, удаления и вставки по сравнению с эталонным текстом. Для упрощения представления показатель был преобразован в процент точности: например, CER 0,024 означает точное распознавание 97,6% символов.

Таблица лидеров не ограничивается этим показателем: в ней также представлены две версии CER — одна для чтения, а другая дипломатическая, сохраняющая исторические различия, например длинную букву s «ſ». Кроме того, измеряются полнота распознавания слов, фактически присутствующих на странице, доля лишнего текста, отсутствующего на странице, и частота повторов, возникающих, когда модель продолжает воспроизводить текст до достижения лимита токенов. Страницы, попавшие в цикл повторения, исключаются из некоторых других результатов, поэтому частоту повторов следует рассматривать вместе с показателями точности.

Точные модели с низкой стоимостью эксплуатации

Согласно опубликованной выборке результатов, модель dots.mocr заняла первое место с точностью чтения 97,6%, за ней следуют OvisOCR2 с точностью 96,9% и PaddleOCR-VL-1.6 с точностью 96,1%. Показатель olmOCR-2 составил 95,7%, LightOnOCR-2 — 95,1%, Qwen3.5-9B — 94,9%, а результат DeepSeek-OCR достиг 93,8%.

  • Стоимость обработки тысячи страниц с использованием Hugging Face Jobs составила около 1,94 доллара для модели dots.mocr.
  • Стоимость составила 0,46 доллара для OvisOCR2, 0,34 доллара для PaddleOCR-VL-1.6 и 0,45 доллара для olmOCR-2.
  • Стоимость Qwen3.5-9B составила 0,89 доллара за тысячу страниц.

Hugging Face Jobs запускает задачу одной командой: включает графический процессор, прогоняет модель по набору данных, а затем останавливает среду. Каждая операция также фиксирует версию модели, образ контейнера и версию скрипта, что позволяет воспроизводить результаты и добавлять новые модели в таблицу лидеров с помощью одной задачи.

Достаточны ли модели для практического использования?

Что касается наборов данных, используемых для обучения языковых моделей, авторы проекта считают, что в большинстве случаев ответ положительный. Публичные тексты представляют собой крупный источник обучающих данных, однако их ценность зависит от качества. В статье указывается, что проект Talkie обнаружил: языковая модель, обученная на текстах, извлечённых с помощью OCR, обучалась с эффективностью 30% от эффективности модели, обученной на созданных людьми транскрипциях тех же книг. В Common Pile, запущенном EleutherAI и её партнёрами, также содержится около 300 тысяч книг, находящихся в общественном достоянии, тексты которых были извлечены с помощью более старых OCR-конвейеров, поэтому повторная обработка с использованием более совершенных моделей может существенно улучшить открытые обучающие наборы.

Что касается замены старых OCR-конвейеров в библиотеках, всё зависит от требуемой технической инфраструктуры. Традиционные системы обычно создают файлы ALTO XML, содержащие координаты на уровне слов, тогда как новые модели выдают Markdown или обычный текст, а иногда координаты текстовых областей, но не координаты слов. Поэтому библиотеки не всегда могут напрямую встроить новый текст в существующую структуру.

Пока модели также не выглядят достаточными для точной академической транскрипции. Основная проблема заключается не всегда в неправильном чтении страницы, а в том, что модель молча модернизирует длинную букву s, типографские лигатуры и другие исторические особенности. Авторы статьи считают, что специализированная тонкая настройка может устранить эти ограничения.

Ограничения оценки и дальнейшие шаги

Результаты охватывают только четыре языка и шесть томов, напечатанных шрифтами семейства antiqua. Поэтому их нельзя распространять на немецкий шрифт Fraktur, нелатинские системы письма, неевропейские языки или рукописи. Кроме того, проект намеренно сосредоточен на книгах, которые визуально более однородны, чем газеты, журналы и архивные материалы, а таблица лидеров не тестирует страницы с несколькими колонками или сложными элементами.

FineBooks намерен продолжать добавлять новые модели в таблицу лидеров, а затем повторно обработать всю коллекцию BHL, находящуюся в общественном достоянии. Из примерно 300 тысяч объектов коллекции около 200 тысяч имеют данные, указывающие на их нахождение в общественном достоянии. Проект использует одну из передовых моделей для обработки этих материалов и опубликует полученный текст как первый набор данных FineBooks, открыто предоставив наборы данных, конвейеры обработки и вспомогательные модели, которые будут разработаны.

Источник новости
ف
Автор

فريق تحرير certi.news

В той же категории

Вам также может понравиться

Все новости