llama.cpp Phát Hành Bản b11327 Sửa Lỗi Giới Hạn Ảnh Cho Các Mô Hình Non-Causal
Bản phát hành b11327 của llama.cpp giới thiệu một bản sửa lỗi nhỏ trong mô-đun đa thức (`mtmd`), giúp giới hạn `max_image` theo kích thước `ubatch` cho các mô hình non-causal. Cập nhật này giải quyết PR #29773 nhằm bảo đảm xử lý đầu vào hình ảnh chính xác trong quá trình suy luận. Dù đây là một bản cập nhật bảo trì nhỏ, nó giúp cải thiện độ ổn định khi thực thi cho các nhà phát triển làm việc với kiến trúc AI đa thức và non-causal. Thay đổi này ngăn ngừa lỗi cấp phát bộ nhớ hoặc các hành vi bất thường khi xử lý ngữ cảnh hình ảnh kèm theo văn bản. Bản sửa lỗi quy định số lượng token hình ảnh tối đa được xử lý đồng thời không vượt quá `ubatch`, đại diện cho giới hạn kích thước micro-batch vật lý gửi đến các backend tính toán phần cứng. Các tệp biên dịch sẵn đã được phát hành trên tất cả các hệ điều hành và nền tảng phần cứng chính bao gồm CUDA, Vulkan, SYCL, OpenVINO và Snapdragon.
## KIẾN THỨC NỀN
Trong `llama.cpp`, `ubatch` (kích thước micro-batch) điều khiển số lượng token tối đa được đánh giá trong một bước tính toán phần cứng để quản lý bộ nhớ và tối ưu hóa hiệu năng. Khác với các mô hình causal thông thường vốn chỉ dự đoán token tiếp theo dựa trên ngữ cảnh quá khứ, các mô hình non-causal sử dụng cơ chế chú ý hai chiều để xử lý toàn bộ chuỗi ngữ cảnh cùng một lúc.