llama.cpp b10228 Ra Mắt Hỗ Trợ DeepSeek-V4 MTP và DSpark
Phiên bản b10228 của llama.cpp bổ sung hỗ trợ cho tính năng Dự đoán Đa Token (MTP) của DeepSeek-V4 và DSpark. Bản cập nhật này tích hợp trực tiếp các tính năng trên vào công cụ suy luận LLM cục bộ. Bản phát hành này cho phép triển khai cục bộ các mô hình DeepSeek-V4 với tốc độ suy luận được tăng tốc đáng kể. Bằng cách tận dụng MTP và DSpark, người dùng có thể chạy giải mã đầu cơ hiệu quả cao mà không cần mô hình nháp riêng biệt. Bản cập nhật này được theo dõi trong pull request #25784 và khả dụng trên nhiều nền tảng, mặc dù hỗ trợ KleidiAI cho macOS Apple Silicon vẫn bị vô hiệu hóa trong bản dựng này.
## KIẾN THỨC NỀN
Dự đoán Đa Token (MTP) là một phương pháp giải mã đầu cơ, trong đó mô hình ngôn ngữ tự dự đoán nhiều token tiếp theo cùng lúc để tăng tốc độ tạo văn bản. DSpark là công nghệ tối ưu hóa suy luận do DeepSeek phát triển giúp tăng tốc đáng kể quá trình thực thi mô hình. llama.cpp là một thư viện C/C++ mã nguồn mở phổ biến được thiết kế để chạy các mô hình ngôn ngữ lớn cục bộ với hiệu suất cao.