llama.cpp Phát Hành Bản b10874 Sửa Lỗi Đếm Tham Số Cho Mô Hình Granite3 MoE
Phiên bản b10874 của llama.cpp giải quyết lỗi khiến số lượng tham số của các mô hình Granite3 Mixture-of-Experts (MoE) từ IBM bị báo là không xác định. Yêu cầu kéo (#28632) này được đóng góp trực tiếp bởi kỹ sư Aaron Teo của IBM. Việc sửa lỗi này đảm bảo thông tin đặc tả và số lượng tham số được hiển thị chính xác khi chạy các kiến trúc IBM Granite3 MoE cục bộ bằng llama.cpp. Điều này thể hiện sự hỗ trợ bảo trì tích cực từ các nhà phát triển AI doanh nghiệp cho công cụ suy luận mã nguồn mở. Bản vá xử lý PR #28632 mà không làm thay đổi thuật toán suy luận hay logic lượng hóa. Các gói tệp thực thi biên dịch sẵn cho phiên bản b10874 đã được phát hành trên nhiều nền tảng bao gồm macOS, Linux, Windows và Android.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận LLM hiệu năng cao bằng C/C++ cho phép chạy cục bộ các mô hình ngôn ngữ được lượng hóa trên phần cứng người dùng. IBM Granite3 MoE là chuỗi mô hình ngôn ngữ mở dạng Mixture-of-Experts của IBM, được thiết kế cho các tác vụ độ trễ thấp bằng cách kích hoạt một phần nhỏ tổng số tham số cho mỗi token.