llama.cpp b11298 bổ sung hỗ trợ chuyển đổi và trích xuất đặc trưng cho DFlash
llama.cpp phiên bản b11298 vừa được phát hành, bổ sung hỗ trợ chuyển đổi mô hình và trích xuất đặc trưng cho DFlash. Cập nhật này cho phép người dùng llama.cpp chuyển đổi và thử nghiệm với DFlash, một kiến trúc suy luận khuếch tán khối mới giúp tăng tốc suy luận LLM thông qua kỹ thuật suy luận suy đoán (speculative decoding). Bản cập nhật tích hợp pull request #29650 được đóng góp bởi nhà phát triển từ Hugging Face, cùng với các tệp thực thi hỗ trợ đa nền tảng cho Linux, Windows, macOS, Android và các thiết bị Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một bộ công cụ nguồn mở phổ biến viết bằng C/C++ dùng để thực thi các mô hình ngôn ngữ lớn (LLM) cục bộ trên nhiều loại phần cứng khác nhau. DFlash là kiến trúc mô hình suy luận khuếch tán khối siêu nhẹ được thiết kế cho suy luận suy đoán (speculative decoding), giúp tăng tốc quá trình tạo văn bản bằng cách dự đoán song song nhiều token nháp.