NVIDIA Ra Mắt Nemotron-Parse-2.0 Giúp Phân Tích Bố Cục Và Trích Xuất Tài Liệu Nâng Cao
NVIDIA đã phát hành Nemotron-Parse-2.0, một mô hình thị giác-ngôn ngữ nâng cấp được thiết kế để chuyển đổi hình ảnh tài liệu thành văn bản có cấu trúc và chú thích bố cục. Phiên bản này giới thiệu khả năng phân tích biểu đồ, cải thiện việc trích xuất chữ viết tay và mở rộng từ vựng thêm 20.000 token để hỗ trợ đa ngôn ngữ tốt hơn. Mô hình này cải thiện đáng kể quy trình xử lý tài liệu và Tạo truy xuất tăng cường (RAG) bằng cách phân tích chính xác các tài liệu phức tạp, nhiều biểu đồ và đa ngôn ngữ. Giấy phép thương mại tự do của nó cho phép các nhà phát triển tích hợp trực tiếp vào các tác nhân AI doanh nghiệp và quy trình quản lý dữ liệu. Nemotron-Parse-2.0 sử dụng một token mới là `<class_Chart>` để xác định các vùng biểu đồ và chuyển đổi dữ liệu biểu đồ trực quan thành văn bản có cấu trúc. Nó cũng mang lại hiệu suất OCR nâng cao cho các chữ viết CJK (Trung, Nhật, Hàn) và Ấn Độ, cùng khả năng khôi phục cấu trúc bảng mạnh mẽ hơn.
## KIẾN THỨC NỀN
Phân tích bố cục tài liệu là một quy trình thị giác máy tính và xử lý ngôn ngữ tự nhiên (NLP) giúp xác định và phân loại các vùng quan tâm như văn bản, bảng biểu và hình ảnh trong tài liệu quét. Các phiên bản trước như Nemotron-Parse v1.2 tập trung vào hiểu ngữ nghĩa cơ bản và định vị không gian, nhưng gặp khó khăn với các biểu đồ phức tạp và các hệ chữ viết đa ngôn ngữ khác nhau.