Baidu Phát Hành Unlimited-OCR Hỗ Trợ Phân Tích Tài Liệu Dài Trong Một Lần Chạy
Baidu đã mã nguồn mở Unlimited-OCR, một dự án dựa trên Python được thiết kế để nhận dạng ký tự quang học (OCR) và phân tích tài liệu dài chỉ trong một lần chạy (one-shot). Công cụ này có khả năng phân tích toàn bộ tài liệu nhiều trang hoặc thậm chí cả cuốn sách trong một lượt xử lý duy nhất mà vẫn duy trì được ngữ cảnh cấu trúc. Các công cụ OCR truyền thống thường gặp khó khăn với tài liệu có ngữ cảnh dài, đòi hỏi phải xử lý từng trang khiến tính liên tục của cấu trúc bị mất đi. Unlimited-OCR giải quyết vấn đề này bằng cách coi toàn bộ tài liệu là một chuỗi duy nhất, giúp cải thiện đáng kể quy trình làm việc trong lĩnh vực Document AI và phân tích tài liệu tự động. Dự án được xây dựng dựa trên mô hình nền tảng DeepSeek-OCR và vượt trội hơn nhờ sử dụng các kỹ thuật triệt tiêu lặp lại dựa trên ngram để ngăn chặn việc tạo văn bản lặp đi lặp lại. Nó hỗ trợ phân tích cú pháp PDF nhiều trang bằng cách chuyển đổi các trang thành hình ảnh và xử lý chúng một cách tuần tự bằng các tham số như `no_repeat_ngram_size` và `ngram_window`.
## KIẾN THỨC NỀN
Document AI liên quan đến việc sử dụng học máy và xử lý ngôn ngữ tự nhiên để tự động đọc, hiểu và trích xuất thông tin từ các tài liệu bán cấu trúc như biểu mẫu, bảng biểu và báo cáo. Phân tích tài liệu dài (long-horizon) mở rộng khả năng này bằng cách duy trì ngữ cảnh và mối quan hệ giữa nhiều trang, thay vì coi mỗi trang là một hình ảnh riêng biệt.