llama.cpp b11132 Bổ Sung Hỗ Trợ Mô Hình Nháp Gemma 4 DSpark
Phiên bản b11132 của llama.cpp bổ sung khả năng chuyển đổi định dạng GGUF và hỗ trợ suy luận thời gian chạy (runtime) cho các mô hình nháp Gemma 4 DSpark. Bản cập nhật hỗ trợ cả hai biến thể chú ý toàn phần (full-attention) và chú ý cửa sổ trượt (SWA), cùng với trọng số đầu ra liên kết và suy luận tính năng dựa trên siêu dữ liệu. Các mô hình nháp DSpark kích hoạt kỹ thuật suy luận suy đoán (speculative decoding) giúp tăng tốc đáng kể tốc độ tạo token của LLM. Việc đưa hỗ trợ DSpark và Chú ý cửa sổ trượt cho Gemma 4 vào llama.cpp cho phép các nhà phát triển chạy suy luận hiệu suất cao một cách hiệu quả hơn trên các thiết bị người dùng. Bản phát hành bổ sung các tham số siêu dữ liệu backbone dạng boolean và cho phép tự động phát hiện tính năng thông qua dflash. Nó cũng xử lý các trọng số đầu ra liên kết trên cả hai kiến trúc mô hình nháp Gemma 4 chú ý toàn phần và SWA.
## KIẾN THỨC NỀN
Suy luận suy đoán (speculative decoding) sử dụng một mô hình nháp nhỏ hơn để đề xuất nhiều token ứng viên mà LLM chính sẽ xác minh song song, giúp tăng tốc độ tạo văn bản. DSpark là một phương pháp suy luận suy đoán được thiết kế để tạo các khối token nháp một cách hiệu quả. Chú ý cửa sổ trượt (SWA) giới hạn phạm vi chú ý trong một cửa sổ ngữ cảnh gần nhất cố định, giúp giảm sự tăng trưởng của bộ nhớ đệm KV và độ phức tạp tính toán từ cấp số nhân xuống tuyến tính.