llama.cpp Phát Hành Phiên Bản b10231 Hỗ Trợ DSpark Speculative Sidecar
Phiên bản b10231 của llama.cpp bổ sung hỗ trợ phân giải speculative sidecar cho DSpark. Bản cập nhật này cho phép các tệp dspark- phân giải tương tự như các speculative sidecar khác, đồng thời ưu tiên DSpark hơn DFlash trong quá trình tự động lựa chọn nhờ tích hợp thêm Markov head. Kỹ thuật speculative decoding (giải mã suy đoán) đóng vai trò quan trọng trong việc tăng tốc độ suy luận của LLM, và việc tích hợp hỗ trợ DSpark giúp quá trình tạo và xác thực bản nháp (draft) hiệu quả hơn. Điều này giúp các nhà phát triển đạt được thông lượng cao hơn và độ trễ thấp hơn khi chạy các mô hình tương thích trên llama.cpp. Bản cập nhật áp dụng thẻ -hfd cho các tệp DSpark, cho phép sidecar được yêu cầu phân giải mà không cần mô hình đầy đủ tại thẻ đó, trong khi tùy chọn -md rõ ràng sẽ vô hiệu hóa tính năng tự động phát hiện này. Nếu không có loại cụ thể nào được yêu cầu, DSpark sẽ được tự động chọn thay vì DFlash vì sidecar của nó chứa thêm một Markov head.
## KIẾN THỨC NỀN
Speculative decoding (giải mã suy đoán) tăng tốc độ suy luận của LLM bằng cách sử dụng một mô hình nháp nhỏ hơn, nhanh hơn (hoặc "sidecar") để đề xuất các token, sau đó được xác thực song song bởi mô hình đích lớn hơn. DSpark là một khung giải mã suy đoán do DeepSeek phát triển, sử dụng Markov head để cải thiện hiệu quả tạo và xác thực bản nháp. llama.cpp là một công cụ suy luận mã nguồn mở viết bằng C/C++ phổ biến, được tối ưu hóa để chạy các LLM trên nhiều nền tảng phần cứng khác nhau.