llama.cpp bổ sung hỗ trợ tối ưu cho GLM-5 Multi-Token Prediction
Pull request #29928 cho llama.cpp do lập trình viên pwilkin thực hiện đã bổ sung hỗ trợ tối ưu hóa để chạy các mô hình GLM-5 Flash sử dụng Multi-Token Prediction (MTP). Điều này cho phép người dùng chạy GLM-5 Flash trên máy cục bộ với khả năng tăng tốc MTP tích hợp sẵn. Cải tiến này giúp người dùng suy luận mô hình ngôn ngữ lớn (LLM) cục bộ đạt tốc độ tạo chuỗi cao hơn trên mô hình GLM-5 mà không cần mô hình dự thảo (draft model) bên ngoài. Nó mở rộng khả năng chạy các mô hình tiên tiến, hiệu năng cao trên các thiết bị phần cứng cá nhân. Pull request này tích hợp luồng xử lý GLM5Next MTP và tối ưu hóa các thao tác tensor liên quan trong llama.cpp. Bằng cách dự đoán nhiều token tiếp theo trong mỗi lượt truyền thẳng (forward pass) thông qua các đầu dự đoán tích hợp, mô hình giảm đáng kể độ trễ khi suy luận.
## KIẾN THỨC NỀN
llama.cpp là một bộ công cụ suy luận mã nguồn mở phổ biến được viết bằng C/C++, giúp chạy các mô hình ngôn ngữ lớn một cách hiệu quả trên phần cứng cá nhân. Multi-Token Prediction (MTP) là phương pháp kiến trúc cho phép mô hình dự đoán nhiều token tiếp theo cùng lúc, hoạt động như cơ chế tăng tốc tích hợp sẵn. GLM-5 Flash là mô hình nhỏ gọn, hiệu năng cao thuộc họ GLM được tối ưu cho tốc độ phản hồi.