llama.cpp Phát Hành Bản Dựng b10312 Ngăn Chặn Việc Giải Phóng Các Mô Hình Đang Bận
Dự án llama.cpp đã phát hành bản dựng b10312, mang đến bản sửa lỗi nhằm ngăn chặn bộ định tuyến máy chủ (server router) giải phóng các mô hình đang bận. Bản cập nhật này giải quyết một sự cố định tuyến cụ thể trong thành phần máy chủ để cải thiện độ ổn định. Bản phát hành này đảm bảo tính ổn định cho các môi trường phục vụ nhiều mô hình bằng cách ngăn các mô hình đang hoạt động bị giải phóng sớm trong quá trình suy luận. Điều này giúp duy trì hiệu suất nhất quán và giảm thiểu tình trạng tăng đột biến độ trễ do phải tải lại các mô hình đang bận. Bản phát hành bao gồm các tệp thực thi được biên dịch sẵn cho nhiều nền tảng như macOS, Linux, Windows và Android, hỗ trợ CPU, CUDA, Vulkan và OpenVINO. Tuy nhiên, các bản dựng cho macOS Apple Silicon kích hoạt KleidiAI và các bản dựng cho openEuler hiện đang bị vô hiệu hóa trong đợt phát hành này.
## KIẾN THỨC NỀN
llama.cpp là một thư viện phần mềm mã nguồn mở phổ biến được viết bằng C/C++, cho phép suy luận hiệu quả các mô hình ngôn ngữ lớn (LLM) trên môi trường cục bộ và đám mây. Nó đóng vai trò là công cụ cốt lõi cho nhiều công cụ AI cục bộ được sử dụng rộng rãi như Ollama và LM Studio. Thư viện này được thiết kế để chạy các LLM với cấu hình tối thiểu và hiệu suất cao trên nhiều kiến trúc phần cứng khác nhau.