So sánh MinerU, Granite-Docling và PaddleOCR-VL trong việc phân tích cú pháp PDF
Một nhà phát triển đã thực hiện đánh giá chi tiết so sánh ba công cụ phân tích tài liệu mã nguồn mở gồm MinerU, Granite-Docling và PaddleOCR-VL trên 12 tính năng bằng cách sử dụng sáu loại tài liệu khác nhau trên GPU L4. Thử nghiệm đã đánh giá hiệu suất của chúng trên các bố cục phức tạp như bài báo nhiều cột, hóa đơn quét, bảng dữ liệu đa ngôn ngữ và biểu đồ nhúng. Phân tích cú pháp tài liệu là một điểm nghẽn quan trọng trong các quy trình Tạo tăng cường truy xuất (RAG), và so sánh này cung cấp các thông tin thực tế giúp các nhà phát triển lựa chọn công cụ phù hợp cho các cấu trúc tài liệu cụ thể. Việc hiểu cách các mô hình này xử lý các trường hợp đặc biệt như chân trang, văn bản đa ngôn ngữ và bảng biểu là rất cần thiết để xây dựng các quy trình AI tài liệu mạnh mẽ. Granite-Docling là công cụ duy nhất tạo ra các bảng dạng đường ống (pipe table) chuẩn markdown và giữ nguyên các cấp độ tiêu đề thực tế, giúp đầu ra thô của nó dễ đọc nhất. Trong khi đó, MinerU đã chuyển đổi thành công biểu đồ cột thành bảng nhưng lại tự động loại bỏ các phần phụ của trang như chân trang (ví dụ: làm mất mã IBAN), đòi hỏi phải xây dựng lại tùy chỉnh từ danh sách khối để giữ lại dữ liệu này.
## KIẾN THỨC NỀN
Các công cụ phân tích cú pháp tài liệu chuyển đổi các tệp PDF và hình ảnh phức tạp, không cấu trúc thành các định dạng có cấu trúc như Markdown hoặc JSON, vốn rất quan trọng để huấn luyện các mô hình AI và đưa dữ liệu vào hệ thống RAG. Granite-Docling là một mô hình ngôn ngữ thị giác (VLM) nhỏ gọn do IBM phát triển, MinerU là một trình phân tích tài liệu AI-native được thiết kế để trích xuất Markdown sạch, và PaddleOCR-VL là một VLM tiết kiệm tài nguyên từ hệ sinh thái PaddlePaddle của Baidu.