llama.cpp Phát Hành Bản Build b11036 Sửa Lỗi Bộ Đệm GGML
llama.cpp đã phát hành bản build tự động b11036, tích hợp Pull Request #26070 vào thư viện ggml bên dưới. Bản cập nhật này bổ sung cơ chế xử lý lỗi khi không thể đặt trước bộ đệm đồ thị trong quá trình thiết lập tính toán. Xử lý lỗi cấp phát bộ đệm giúp ngăn ngừa tình trạng sập ứng dụng đột ngột khi chạy các mô hình ngôn ngữ lớn trên hệ thống có bộ nhớ hạn chế. Điều này làm tăng độ ổn định khi vận hành trên nhiều nền tảng được hỗ trợ như CPU, CUDA, Vulkan và ROCm. Thay đổi duy nhất trong bản phát hành này là khắc phục lỗi đặt trước bộ đệm đồ thị trong ggml. Các tệp thực thi đóng gói sẵn cho bản build b11036 đã được phát hành cho macOS, Linux, Windows, Android và iOS.
## KIẾN THỨC NỀN
llama.cpp là một công cụ suy luận nguồn mở bằng C/C++ được thiết kế để chạy các mô hình ngôn ngữ lớn (LLM) hiệu quả trên phần cứng cá nhân. Dự án phụ thuộc vào ggml, một thư viện tensor tối giản chịu trách nhiệm quản lý bộ nhớ và tính toán đồ thị ma trận trên CPU cũng như các bộ tăng tốc.