Dự Án FineBooks Thử 14 Model OCR Trên Sách Lịch Sử, Mục Tiêu Tái Xử Lý Kho BHL
2 phút đọc

Nhóm FineBooks chạy 14 model OCR có trọng số mở trên 2.165 trang sách lịch sử và công bố kết quả dưới dạng bảng xếp hạng. Thước đo dùng là Tỉ lệ lỗi ký tự (CER), và bảng xếp hạng phân thành hai biến thể: "diplomatic" tính lỗi khi hiện đại hóa các ký tự cổ như chữ long s (ſ), còn biến thể "reading" dung nạp những thay đổi đó.
Kết quả cho thấy model tốt nhất đạt độ chính xác ký tự trên 97% với chi phí dưới 2 đô la cho 1.000 trang. Model dẫn đầu là dots.mocr với 3 tỉ tham số; OvisOCR2 xếp thứ hai với 0,9 tỉ tham số và chi phí 0,46 đô la cho 1.000 trang. Nhóm nhận xét kích thước model không tương quan với chất lượng OCR trên tài liệu lịch sử.
FineBooks dùng dữ liệu kiểm chứng từ dự án IMPACT và BHL-Europe: giữa 2011 và 2012, chuyên gia đã phiên âm sáu tập của BHL bằng tiếng Anh, Pháp, Đức và Latin với tỉ lệ lỗi khoảng một ký tự trên 2.000. Dữ liệu này có giấy phép CC-BY và được lưu trên GitHub, tạo bộ dữ liệu đối chứng cho đánh giá.
Nhóm nêu vấn đề ban đầu: nhiều sách công cộng được nạp bằng OCR cũ nên chứa nhiều lỗi, và một nghiên cứu trước đó cho thấy model ngôn ngữ huấn luyện trên văn bản OCR cũ chỉ đạt 30% hiệu quả so với dùng bản phiên âm của con người. FineBooks chọn Biodiversity Heritage Library làm mục tiêu đầu tiên; BHL lưu trữ hơn 300.000 tài liệu lịch sử với trên 64 triệu trang và cung cấp bản sao lưu theo dạng tải về hàng loạt qua AWS.
Đánh giá chỉ bao phủ phông chữ Antiqua trong bốn ngôn ngữ và trang sách một cột; nó không tính đến Fraktur, chữ không phải chữ Latinh hay chữ viết tay. Nhóm dự định tái xử lý khoảng 200.000 tài liệu công cộng của BHL bằng một trong các model hàng đầu và phát hành văn bản kết quả như một tập dữ liệu mở.
Nguồn
- Old OCR text cripples language model training, and FineBooks wants to fix that at scale— The Decoder, 11 tháng 8, 2026