llama.cpp Phát hành Bản b11078 Bổ sung Biến Môi trường cho Tùy chọn Sampling Server
Phiên bản b11078 của llama.cpp bổ sung hỗ trợ biến môi trường (thông qua LLAMA_ARG_*) để cấu hình các tham số sampling như temperature, top-p, min-p và các hình phạt penalty trong llama-server. Điều này cho phép người vận hành máy chủ quản lý đầy đủ các thiết lập suy luận bằng tệp cấu hình môi trường như EnvironmentFile của systemd trên Linux. Cập nhật này đơn giản hóa việc tự động hóa hạ tầng và triển khai container hiện đại (như Docker, Kubernetes và các dịch vụ systemd) cho các điểm cuối LLM tự host. Người vận hành không còn phải truyền các đối số dòng lệnh dài dòng, phức tạp để tùy chỉnh hành vi tạo văn bản của mô hình. Các cờ tham số mới được hỗ trợ ánh xạ bao gồm --temp, --top-p, --min-p, --repeat-penalty, --presence-penalty và --frequency-penalty. Các bản dựng sẵn đã được cập nhật trên Linux, macOS, Windows và Android, mặc dù bản dựng KleidiAI trên macOS Apple Silicon vẫn đang bị vô hiệu hóa.
## KIẾN THỨC NỀN
llama.cpp là một khung suy luận C/C++ mã nguồn mở phổ biến giúp chạy các Mô hình Ngôn ngữ Lớn (LLM) hiệu quả trên phần cứng người dùng. Các tham số sampling như temperature, top-p và min-p kiểm soát tính ngẫu nhiên của đầu ra và chất lượng văn bản được tạo, trong khi llama-server cung cấp giao diện HTTP tương thích với API của OpenAI.