llama.cpp Hỗ Trợ Các Mô Hình MoE Laguna XS.2 và M.1 Của Poolside
Một yêu cầu kéo (pull request) mới trong kho lưu trữ llama.cpp đã bổ sung hỗ trợ cho các mô hình Hỗn hợp chuyên gia (MoE) Laguna XS.2 và M.1 của Poolside. Các mô hình này được tối ưu hóa đặc biệt cho các tác vụ lập trình tự chủ (agentic coding) và xử lý dài hạn trên máy cục bộ. Sự tích hợp này cho phép các nhà phát triển chạy các mô hình lập trình tiên tiến của Poolside cục bộ với hiệu suất suy luận được tối ưu hóa, mang lại khả năng tự chủ mạnh mẽ cho phần cứng tiêu dùng. Điều này mở rộng hệ sinh thái các mô hình trọng số mở có sẵn cho quy trình phát triển phần mềm cục bộ. Laguna XS.2 là mô hình 33 tỷ tham số (3 tỷ tham số kích hoạt) sử dụng Cơ chế chú ý cửa sổ trượt (Sliding Window Attention) với cơ chế cổng theo từng đầu (per-head gating) trong 30 trên 40 lớp để giảm thiểu yêu cầu bộ nhớ đệm KV cache. Trong khi đó, Laguna M.1 là mô hình khổng lồ với 225 tỷ tham số (23 tỷ tham số kích hoạt) sở hữu cửa sổ ngữ cảnh 256K và hỗ trợ gọi công cụ (tool calling).
## KIẾN THỨC NỀN
llama.cpp là một khung mã nguồn mở phổ biến được thiết kế để suy luận LLM hiệu quả trên phần cứng cục bộ bằng C/C++. Kiến trúc Hỗn hợp chuyên gia (MoE) chỉ kích hoạt một phần nhỏ trong tổng số tham số cho mỗi mã thông báo (token), cho phép đạt hiệu suất cao mà không đòi hỏi tài nguyên tính toán khổng lồ cho mỗi bước. Cơ chế chú ý cửa sổ trượt (Sliding Window Attention) giúp tối ưu hóa bộ nhớ hơn nữa bằng cách giới hạn khoảng cách mà các mã thông báo có thể truy xuất ngược lại trong lịch sử ngữ cảnh, giúp giảm kích thước KV cache.