llama.cpp hỗ trợ kiến trúc mô hình Hy4 Preview của Tencent
Nhà phát triển Little0o0 đã gửi Pull Request #28127 đến dự án llama.cpp, bổ sung sự hỗ trợ cho kiến trúc mô hình thử nghiệm Hy4 (hy_v4) của Tencent. Tích hợp này cho phép suy luận và lượng tử hóa mô hình trọng số mở mới nhất của Tencent trực tiếp trên thiết bị cục bộ. Việc hỗ trợ Hy4 mang mô hình trọng số mở mới nhất của Tencent vào hệ sinh thái AI cục bộ, cho phép các nhà phát triển và nghiên cứu chạy các mô hình tiên tiến mà không cần phụ thuộc vào API đám mây. Điều này mở rộng tập hợp các kiến trúc Mixture-of-Experts hiệu suất cao được llama.cpp hỗ trợ. Tencent Hy4 Preview là mô hình Mixture-of-Experts với tổng cộng 770 tỷ tham số, 49 tỷ tham số kích hoạt trên mỗi token và cửa sổ ngữ cảnh lên tới 1 triệu token. Mô hình cũng tích hợp kỹ thuật dự đoán đa token tự nhiên (Native Multi-Token Prediction) nhằm nâng cao hiệu quả tạo văn bản.
## KIẾN THỨC NỀN
llama.cpp là một khung mã nguồn mở C/C++ được sử dụng rộng rãi, giúp suy luận hiệu quả các mô hình ngôn ngữ lớn trên phần cứng cá nhân nhờ tăng tốc bằng CPU và GPU. Mixture-of-Experts (MoE) là một thiết kế mạng thần kinh định tuyến dữ liệu đầu vào đến các mạng con chuyên gia cụ thể, cho phép mở rộng dung lượng mô hình nhưng vẫn duy trì khối lượng tính toán hợp lý cho mỗi token.