~/LLAMA CPP/llama-cpp-release-b10906-fixes-speculative-decoding-bug-after-image-inputs

llama.cpp Phát Hành Bản b10906 Sửa Lỗi Giải Mã Suy Đoán Sau Khi Nhập Hình Ảnh

llama.cpp đã phát hành bản dựng b10906, sửa lỗi theo dõi vị trí token trong thành phần server khi thực hiện giải mã suy đoán (speculative decoding) sau khi nhập dữ liệu hình ảnh. Bản sửa lỗi đảm bảo truyền vị trí token thực tế (`pos0`) cho mô hình bản thảo (draft model) thay vì số lượng token tích lũy (`n_past`). Bản sửa lỗi này giải quyết nguy cơ sai lệch và lỗi tạo văn bản khi vận hành các mô hình LLM đa thức có kích hoạt giải mã suy đoán trên server. Thay đổi này tác động đến toàn bộ các mô hình bản thảo, giúp cải thiện độ chính xác suy luận sau khi xử lý hình ảnh. Cập nhật đổi tên tham số bản thảo từ `n_past` thành `pos0` để phản ánh đúng vị trí token thay vì số lượng token. Bản sửa lỗi áp dụng cho tất cả các mô hình dự đoán suy đoán (không chỉ DFlash) khi xử lý đầu vào hình ảnh trong `llama-server`.

## KIẾN THỨC NỀN

llama.cpp là một khung làm việc mã nguồn mở bằng C/C++ phổ biến phục vụ việc chạy các mô hình ngôn ngữ lớn cục bộ trên nhiều kiến trúc phần cứng. Giải mã suy đoán (speculative decoding) là kỹ thuật tối ưu hóa suy luận, sử dụng một mô hình bản thảo nhỏ hơn để đề xuất các token ứng viên cho mô hình mục tiêu lớn hơn xác minh, giúp tăng tốc độ tạo văn bản. Khi xử lý các đầu vào đa thức như hình ảnh, việc theo dõi chính xác chỉ số vị trí của token là yếu tố then chốt để duy trì sự đồng bộ giữa mô hình bản thảo và mô hình mục tiêu.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#LLM#AI Infrastructure#Open Source

$ subscribe --daily

llama.cpp Phát Hành Bản b10906 Sửa Lỗi Giải Mã Suy Đoán Sau Khi Nhập Hình Ảnh | Daily News