~/LLM INFERENC/llama-cpp-adds-mtp-and-dspark-support-for-deepseek-v4-flash

llama.cpp Thêm Hỗ Trợ MTP và DSpark cho DeepSeek V4 Flash

Trình suy luận mã nguồn mở phổ biến llama.cpp đã bổ sung hỗ trợ cho Dự đoán đa mã thông báo (MTP) và khung công nghệ DSpark của DeepSeek. Sự tích hợp này giúp tối ưu hóa hiệu suất suy luận cục bộ dành riêng cho mô hình DeepSeek V4 Flash. Bản cập nhật này cho phép suy luận cục bộ nhanh hơn đáng kể đối với các mô hình mở tiên tiến như DeepSeek V4 Flash mà không làm giảm chất lượng đầu ra. Bằng cách tận dụng kỹ thuật giải mã suy đoán của DSpark, người dùng có thể đạt tốc độ suy luận nhanh hơn tới 85%. DeepSeek V4 Flash là một mô hình hỗn hợp chuyên gia (MoE) với tổng cộng 284 tỷ tham số, trong đó có 13 tỷ tham số được kích hoạt cho mỗi mã thông báo. DSpark đạt được sự tăng tốc này thông qua kỹ thuật giải mã suy đoán, đảm bảo kết quả đầu ra trùng khớp từng byte mà không yêu cầu huấn luyện lại mô hình.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn truyền thống dự đoán văn bản theo từng mã thông báo một, điều này có thể gây chậm trễ về mặt tính toán. Dự đoán đa mã thông báo (MTP) cho phép các mô hình dự đoán đồng thời nhiều mã thông báo tiếp theo, trong khi các khung giải mã suy đoán như DSpark sử dụng các mô hình nháp nhỏ hơn để đoán trước các mã thông báo tương lai nhằm tăng tốc quá trình tạo văn bản.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#llama.cpp#DeepSeek#Multi-Token Prediction#Open Source AI

$ subscribe --daily

llama.cpp Thêm Hỗ Trợ MTP và DSpark cho DeepSeek V4 Flash | Daily News