llama.cpp Phát Hành Bản b11277 Sửa Lỗi Rò Rỉ Bộ Nhớ Cho Backend ggml-zdnn
llama.cpp đã phát hành phiên bản b11277, bổ sung tính năng reset bộ đệm và xử lý các lỗi rò rỉ bộ nhớ trong backend ggml-zdnn. Bản cập nhật do kỹ sư Aaron Teo từ IBM đóng góp cùng với một số sửa đổi nhỏ về định dạng mã nguồn. Bản cập nhật này giúp tăng cường độ ổn định bộ nhớ và quản lý tài nguyên cho các môi trường doanh nghiệp chạy suy luận LLM trên máy chủ đại hình IBM. Nó đảm bảo các tác vụ suy luận chạy lâu dài sử dụng thư viện tăng tốc phần cứng zDNN không bị rò rỉ hay tích tụ bộ nhớ. Bản phát hành tập trung vào PR #29637, giúp bổ sung trực tiếp các quy trình reset bộ đệm vào ggml-zdnn. Các tệp thực thi biên dịch sẵn cũng đã được phát hành cho nhiều hệ điều hành và thiết bị bao gồm Linux, Windows, macOS, Android và Snapdragon.
## KIẾN THỨC NỀN
llama.cpp là một khung làm việc mã nguồn mở phổ biến viết bằng C/C++ giúp suy luận các mô hình ngôn ngữ lớn (LLM) hiệu năng cao dựa trên thư viện tensor GGML. Backend zDNN của dự án cho phép tăng tốc phần cứng cho các tác vụ AI riêng trên các hệ thống máy chủ IBM zSystems thông qua thư viện zDNN của IBM.