~/LLAMA CPP/llama-cpp-b11387-fixes-n-gram-draft-rejection-bug-in-speculative-decoding

llama.cpp b11387 Sửa Lỗi Từ Chối Bản Thảo N-Gram Trong Giải Mã Đầu Cơ

Bản phát hành llama.cpp b11387 sửa lỗi khiến các token bản thảo n-gram trong giải mã đầu cơ (speculative decoding) bị từ chối không chính xác khi nhiệt độ lấy mẫu lớn hơn 0 sau khi cắt giảm ngữ cảnh. Sửa lỗi này được đóng góp trong PR #29924 bởi kỹ sư Pranesh Gonegandla từ NVIDIA. Giải mã đầu cơ n-gram giúp tăng tốc suy luận LLM bằng cách khớp các chuỗi văn bản đã xuất hiện trước đó mà không cần mô hình bản thảo phụ. Việc sửa lỗi này giúp logic chấp nhận bản thảo hoạt động chính xác ở nhiệt độ lấy mẫu lớn hơn 0, tránh việc phải sinh lại token không cần thiết và suy giảm hiệu năng. Bản phát hành đi kèm các tệp thực thi biên dịch sẵn cho Linux, Windows, macOS, Android và iOS, hỗ trợ nhiều backend như CUDA 12/13, Vulkan, ROCm 10.0, OpenVINO, SYCL và phần cứng Snapdragon.

## KIẾN THỨC NỀN

llama.cpp là một dự án mã nguồn mở phổ biến cho phép suy luận LLM hiệu năng cao trên nhiều nền tảng phần cứng khác nhau. Giải mã đầu cơ (speculative decoding) là kỹ thuật tăng tốc trong đó các token ứng viên (bản thảo) được đề xuất nhanh—chẳng hạn như qua khớp chuỗi n-gram—và được mô hình LLM chính xác minh song song.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source-ai#bug-fix

$ subscribe --daily

llama.cpp b11387 Sửa Lỗi Từ Chối Bản Thảo N-Gram Trong Giải Mã Đầu Cơ | Daily News