llama.cpp Phát Hành Phiên Bản b10926 Sửa Lỗi Xử Lý Định Dạng Lượng Hóa tq1_0 Trên SYCL
Công cụ suy luận LLM mã nguồn mở llama.cpp đã phát hành phiên bản b10926, tích hợp pull request #28681. Bản vá này đảm bảo rằng backend SYCL xử lý mượt mà các định dạng lượng hóa tq1_0 không được hỗ trợ và báo lỗi an toàn thay vì làm hỏng ứng dụng đột ngột. Cập nhật này tăng cường tính ổn định khi vận hành cho các nhà phát triển và người dùng chạy llama.cpp trên phần cứng tăng tốc qua SYCL, chẳng hạn như GPU Intel. Việc ngăn ngừa lỗi sập ứng dụng giúp duy trì tính toàn vẹn của ứng dụng khi tải các trọng số mô hình không tương thích. Bản vá nhắm mục tiêu cụ thể vào định dạng lượng hóa tam phân `tq1_0` (~1.69 bit mỗi trọng số), vốn chưa được hỗ trợ nhân tính toán gốc trong SYCL. Các tệp thực thi biên dịch sẵn cho bản b10926 đã được phát hành trên nhiều nền tảng bao gồm Linux, Windows, macOS, Android và nhiều backend tăng tốc phần cứng khác nhau.
## KIẾN THỨC NỀN
SYCL là một mô hình lập trình C++ mở, đa nền tảng được thiết kế để cho phép tái sử dụng mã nguồn trên nhiều bộ tăng tốc phần cứng khác nhau như GPU và FPGA. Trong llama.cpp, các định dạng lượng hóa như `tq1_0` giảm trọng số mô hình xuống độ chính xác cực thấp nhằm tiết kiệm bộ nhớ và cho phép chạy LLM hiệu quả trên thiết bị người dùng.