Tencent ra mắt mô hình EVIE-8B và EVIE-4.5B giúp truy xuất tài liệu hình ảnh
Tencent đã mở mã nguồn EVIE-8B và EVIE-4.5B, các mô hình thị giác-ngôn ngữ tiên tiến dành cho truy xuất tài liệu hình ảnh, đạt điểm số kỷ lục 66,75 nDCG@10 trên bảng xếp hạng ViDoRe V3. Các mô hình này sử dụng biểu diễn đa vector trên từng token kết hợp với kỹ thuật Prefix-Matryoshka Representation Learning để mang lại độ chính xác truy xuất cao cùng kích thước vector linh hoạt. Các mô hình này thúc đẩy sự phát triển của hệ thống RAG đa thức (multimodal RAG) bằng cách cho phép tìm kiếm chính xác trên các tài liệu trực quan phức tạp chứa bảng biểu, đồ thị và bố cục đặc thù. Nhờ ứng dụng nhúng Matryoshka và phân cụm vector, EVIE giảm đáng kể dung lượng lưu trữ chỉ số xuống còn 3,81 GiB cho mỗi triệu trang mà vẫn giữ được tính linh hoạt trong tính toán. EVIE-8B sử dụng biểu diễn đa vector 4096 chiều trên mỗi token và đóng vai trò mô hình giáo viên để huấn luyện EVIE-4.5B thông qua phương pháp chắt lọc tri thức bảo toàn neo (EVIE-ARD). EVIE-4.5B áp dụng kỹ thuật Phân cụm Phân cấp Dồn tích (HAC) để nén từ khoảng 750 vector token mỗi trang xuống 32 vector, đồng thời hỗ trợ cắt giảm chiều dữ liệu từ 64 đến 2048 ngay khi vận hành.
## KIẾN THỨC NỀN
Truy xuất Tài liệu Hình ảnh (Visual Document Retrieval - VDR) đánh giá hiệu quả của các mô hình AI trong việc tìm kiếm và trích xuất ngữ cảnh từ tài liệu PDF, biểu đồ và trang quét có bố cục phức tạp, vốn được kiểm thử qua các bộ benchmark như ViDoRe. Kỹ thuật Matryoshka Representation Learning (MRL) cho phép mã hóa thông tin theo nhiều mức độ chi tiết lồng nhau trong một vector nhúng duy nhất, hỗ trợ nén dung lượng và bộ nhớ ngay khi khởi chạy mà không cần huấn luyện lại.