Reproducible benchmark

Benchmark PDF sang Word

Trang này công bố phương pháp, nguồn dữ liệu và kết quả có thể tái lập. ChuyenFile không công bố điểm chất lượng trước khi đủ corpus và kiểm duyệt thủ công.

Đang thu thập corpus — chưa chứng nhận
Tài liệu
100
Mục tiêu tối thiểu: 30
Trang
100
Mục tiêu tối thiểu: 100
CER
0.69
WER
1.7

Phương pháp

  1. Tách tập development và acceptance; không điều chỉnh engine theo tập acceptance.
  2. Đo CER/WER sau chuẩn hóa Unicode NFC; báo cả số mẫu và khoảng lỗi, không dùng confidence OCR thay cho độ chính xác.
  3. Kiểm tra số trang, khổ giấy, text node, bảng và bản render; bố cục phức tạp được nghiệm thu thủ công.
  4. Công bố lỗi và nhóm tài liệu thất bại, không chỉ công bố điểm trung bình.

Nguồn dữ liệu

Omni OCR Benchmark

Public OCR images with reference markdown, deterministically sampled and converted to one-page PDFs

License/use constraint: MIT

ChuyenFile controlled Vietnamese set

Vietnamese ground truth, tables, fonts and controlled scan degradation; published when its generator and artifacts are complete

License/use constraint: project-generated test data

Tệp máy đọc

Báo cáo JSON hiện tại công khai trạng thái chưa chứng nhận thay vì tạo số liệu giả.

pdf-to-word.json