~/LLAMA CPP/llama-cpp-adds-support-for-deepseek-s-dspark-speculative-decoding

Llama.cpp Hỗ Trợ Kỹ Thuật Giải Mã Đầu Cơ DSpark Của DeepSeek

Một yêu cầu kéo (pull request #25173) mới trong kho lưu trữ llama.cpp đã bổ sung hỗ trợ cho kỹ thuật giải mã đầu cơ DSpark do DeepSeek phát triển. Sự tích hợp này cho phép người dùng chạy các mô hình như DeepSeek-V4 với các checkpoint hỗ trợ DSpark để tăng tốc độ suy luận cục bộ. Kỹ thuật giải mã đầu cơ giúp cải thiện đáng kể tốc độ suy luận của LLM mà không làm giảm độ chính xác, và việc tích hợp DSpark vào llama.cpp giúp người dùng dễ dàng tiếp cận suy luận AI cục bộ hiệu năng cao hơn. Tối ưu hóa này đặc biệt có lợi cho việc chạy các mô hình lớn như DeepSeek-V4 trên phần cứng tiêu dùng. DSpark là một giải pháp tối ưu hóa suy luận chứ không phải là một mô hình mới, hoạt động bằng cách tái sử dụng trọng số DeepSeek-V4 hiện có cùng với một mô-đun nháp (draft module) đi kèm để tăng tốc độ tạo văn bản. Yêu cầu kéo này đã thúc đẩy các thành viên cộng đồng bắt đầu đo kiểm hiệu năng (benchmark), cụ thể là theo dõi tốc độ xử lý prompt (pp) và tạo token (tg).

## KIẾN THỨC NỀN

Giải mã đầu cơ (speculative decoding) tăng tốc độ suy luận của LLM bằng cách sử dụng một mô hình "nháp" nhỏ hơn, nhanh hơn để dự đoán nhiều token, sau đó được xác thực song song bởi một mô hình "mục tiêu" lớn hơn. Khung DSpark của DeepSeek giải quyết các nút thắt cổ chai của quá trình xác thực nháp truyền thống bằng cách giới thiệu giải mã đầu cơ lập lịch theo độ tin cậy với khả năng tạo bán song song, giúp tăng tốc độ tạo văn bản từ 60-85% so với các phương pháp trước đó.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#Speculative Decoding#LLM Inference#Open Source AI

$ subscribe --daily

Llama.cpp Hỗ Trợ Kỹ Thuật Giải Mã Đầu Cơ DSpark Của DeepSeek | Daily News