Apple Ra Mắt LensVLM-9B Phục Vụ Xử Lý Tài Liệu Hình Ảnh Hiệu Quả
Apple Machine Learning Research đã phát hành LensVLM-9B, một mô hình thị giác - ngôn ngữ 9 tỷ tham số, cùng với bài báo nghiên cứu, mã nguồn và trọng số nén định dạng GGUF. Mô hình này giới thiệu kỹ thuật mở rộng ngữ cảnh có chọn lọc mới, giúp quét các hình ảnh tài liệu đã nén và sử dụng các công cụ đã học để giải nén chỉ những trang liên quan. Việc xử lý các tài liệu hình ảnh nhiều trang thường tốn rất nhiều chi phí tính toán do các mô hình thị giác - ngôn ngữ yêu cầu đầu vào là ảnh độ phân giải cao. Bằng cách quét các trang nén độ phân giải thấp và phóng to động vào các phần nội dung liên quan, LensVLM giúp giảm đáng kể chi phí tính toán mà không làm giảm độ chính xác. LensVLM được xây dựng dựa trên kiến trúc mô hình Qwen chỉnh sửa và sử dụng khung làm việc sau huấn luyện nhằm hướng dẫn mô hình kích hoạt tính năng mở rộng văn bản hoặc phóng to hình ảnh độ phân giải cao tùy thuộc vào cấu trúc tài liệu. Trọng số mô hình được cung cấp theo Giấy phép Mô hình Nghiên cứu Machine Learning của Apple, với các bản nén GGUF có sẵn để triển khai cục bộ.
## KIẾN THỨC NỀN
Các mô hình thị giác - ngôn ngữ (VLM) kết hợp thị giác máy tính và xử lý ngôn ngữ tự nhiên để hiểu cả văn bản lẫn bố cục hình ảnh. Khi áp dụng vào xử lý tài liệu nhiều trang, việc nạp hình ảnh độ phân giải cao của từng trang vào mô hình sẽ nhanh chóng tạo ra nút thắt cổ chai về bộ nhớ và tài nguyên tính toán.