FineBooks 專案測試開源OCR模型對歷史書籍數字化
FineBooks 專案是一個由 Hugging Face 和 EleutherAI 合作的計畫,旨在測試開源 光學字符識別(Optical Character Recognition, OCR) 模型對歷史書籍數字化的效果。該計畫測試了 14 個開源OCR模型,使用了 2,165 頁歷史書籍進行測試,結果顯示最好的模型可以達到 97% 以上的字符準確率,且每千頁的成本不到兩美元。
背景與影響
訓練開源 人工智慧(AI) 語言模型需要使用公共領域書籍,但是這些書籍的文本往往是使用OCR技術從掃描文件中提取的,且結果常常充滿錯誤。根據 Talkie 專案的研究,使用OCR文本訓練的語言模型其效率只有使用人工抄錄文本訓練的模型的 30%。FineBooks 專案旨在解決這個問題,測試目前的開源OCR模型是否能夠有效地提高數字化書籍的質量。
測試結果
FineBooks 專案使用了 14 個開源OCR模型,包括 dots.mocr、Qwen3.5-9B 和 OvisOCR2 等,測試了這些模型在歷史書籍數字化中的表現。測試結果顯示,領先的 dots.mocr 模型使用了只有 3 億個參數,卻達到了最高的字符準確率,而 Qwen3.5-9B 模型儘管具有更大的模型大小,卻表現不佳。OvisOCR2 模型以 0.9 億個參數和每千頁 46 美分的成本,取得了第二好的成績。這些結果表明,模型大小和OCR質量之間沒有明顯的相關性。
未來展望
FineBooks 專案的結果對於歷史書籍數字化具有重要的意義。該計畫計劃使用最好的模型重新處理約 20 萬個公共領域書籍,並將結果發布為開源資料集。這將有助於提高開源AI語言模型的質量和效率。同時,FineBooks 專案也為未來的OCR模型開發提供了重要的參考資料和基準。隨著OCR技術的不斷進步和開源模型的發展,歷史書籍數字化的質量和效率將會進一步提高,為人工智慧和數字人文研究提供更加豐富和可靠的資料。
