llama.cpp Bổ Sung Hỗ Trợ Cho Mô Hình GLM-5.3-Flash
Một pull request mới (#27773) từ lập trình viên timkhronos đã bổ sung hỗ trợ suy luận trực tiếp cho GLM-5.3-Flash (GLM5-Next) vào llama.cpp. Cập nhật này cho phép người dùng chạy mô hình trọng số mở đa phương thức này cục bộ trên phần cứng máy tính cá nhân. Việc tích hợp GLM-5.3-Flash vào llama.cpp giúp người dùng AI cục bộ trải nghiệm các khả năng đa phương thức hàng đầu mà không cần phụ thuộc vào API đám mây. Điều này thúc đẩy hệ sinh thái suy luận LLM hiệu năng cao, bảo vệ quyền riêng tư trên GPU và CPU phổ thông. GLM-5.3-Flash sở hữu tổng cộng 320 tỷ tham số với 18 tỷ tham số kích hoạt cho mỗi token, sử dụng sự kết hợp giữa cơ chế chú ý thưa (sparse attention) và tuyến tính (linear attention). Thiết kế kiến trúc này giúp giảm 4,44 lần bộ nhớ đệm KV cache và 3,01 lần tính toán chú ý so với các mô hình tiêu chuẩn.
## KIẾN THỨC NỀN
llama.cpp là một bộ công cụ suy luận mã nguồn mở phổ biến được viết bằng C/C++, tối ưu hóa các mô hình ngôn ngữ lớn để chạy hiệu quả trên phần cứng cục bộ. Dòng mô hình GLM do Z.ai phát triển là một họ các mô hình trọng số mở được thiết kế cho hiệu suất cao trong các tác vụ văn bản, lập trình và xử lý hình ảnh.