Совместный проект Hugging Face и EleutherAI под названием FineBooks направлен на решение проблемы низкого качества оцифровки исторических текстов. Исследователи протестировали 14 моделей оптического распознавания символов (OCR) на 2000 страниц старинных книг. Лучшая модель, dots.mocr, достигла точности распознавания символов 97,6%, что делает её пригодной для подготовки качественных датасетов для обучения языковых моделей.
Качество данных остается критическим фактором при обучении современных нейросетей. Исторические документы часто содержат ошибки распознавания, вызванные плохим состоянием бумаги, сложной версткой или выцветшими чернилами. Использование таких «зашумленных» текстов в обучающих выборках снижает эффективность моделей. Проект FineBooks систематизирует подходы к выбору инструментов OCR, позволяя исследователям эффективно переводить архивные материалы в машиночитаемый формат с минимальными затратами.
Хотя достигнутая точность в 97,6% достаточна для тренировки ИИ, разработчики отмечают, что для академических публикаций и критических изданий этого уровня пока недостаточно. Тем не менее, масштабируемость решения и низкая стоимость обработки делают его важным шагом для оцифровки огромных массивов исторических знаний, которые ранее были недоступны для качественного анализа нейросетями.
Ключевые факты
- Проект FineBooks протестировал 14 различных моделей OCR на выборке из 2000 страниц исторических книг.
- Модель dots.mocr показала наилучший результат, достигнув точности распознавания символов 97,6%.
- Стоимость обработки составляет менее 2 долларов за 1000 страниц, что обеспечивает высокую экономическую эффективность при масштабировании.
- Инициатива реализуется силами специалистов Hugging Face и EleutherAI для улучшения качества данных, используемых в обучении LLM.
