~/LLAMA CPP/llama-cpp-b11472-optimizes-zero-temperature-sampling-with-greedy-selection

llama.cpp b11472 Tối ưu hóa Lấy mẫu Nhiệt độ 0 bằng Phương pháp Chọn lựa Tham ăn

Phiên bản b11472 của llama.cpp giới thiệu cơ chế lựa chọn token tham ăn (greedy selection) cho các chuỗi lấy mẫu có nhiệt độ bằng 0 trên môi trường CPU, các đường dẫn giới hạn ngữ pháp và ngân sách suy luận. Cập nhật này đơn giản hóa logic khi nhiệt độ bằng 0 bằng cách bỏ qua bước lấy mẫu phân phối xác suất khi nhiệt độ bằng 0 hoặc sau khi lọc top-k giảm lựa chọn xuống còn một token. Cập nhật này giúp tối ưu hóa quá trình suy luận ở nhiệt độ bằng 0, nâng cao hiệu suất thực thi và khả năng bảo trì mã nguồn khi giải mã định hình (deterministic decoding). Điều này đảm bảo các đường dẫn đặc biệt, chẳng hạn như đầu ra có cấu trúc bị ràng buộc bởi ngữ pháp, sử dụng cùng một cơ chế lấy mẫu tham ăn tối ưu như sinh văn bản thông thường. Việc lấy mẫu phân phối xác suất vẫn được duy trì khi người dùng yêu cầu nhiệt độ động hoặc xác suất token cụ thể. Cập nhật này cũng bổ sung các bài kiểm tra hành vi lấy mẫu để bao quát logic nhiệt độ 0 dùng chung trên CPU và các chuỗi lấy mẫu có ràng buộc.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn dự đoán xác suất token tiếp theo, trong đó tham số nhiệt độ (temperature) điều chỉnh mức độ ngẫu nhiên; đặt nhiệt độ bằng 0 thường kích hoạt giải mã tham ăn (greedy decoding) để chọn token có xác suất cao nhất. Giải mã ràng buộc theo ngữ pháp che đi các token không hợp lệ ở mỗi bước để bắt buộc tuân thủ đúng định dạng (như JSON), đòi hỏi logic lấy mẫu phải xử lý việc lựa chọn token một cách chuẩn xác.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#llm-inference#open-source#ai-infrastructure

$ subscribe --daily

llama.cpp b11472 Tối ưu hóa Lấy mẫu Nhiệt độ 0 bằng Phương pháp Chọn lựa Tham ăn | Daily News