llama.cpp Phát Hành Bản b10752 Bổ Sung Hỗ Trợ Metallib Cho XCFramework
llama.cpp đã phát hành phiên bản b10752, bổ sung hỗ trợ biên dịch các thư viện Metal (.metallib) tích hợp trong định dạng nhị phân XCFramework trên các nền tảng Apple. Cải tiến này được hợp nhất qua pull request #28163 nhằm tối ưu hóa việc đóng gói tăng tốc GPU Metal cho các nhà phát triển ứng dụng Apple. Thay đổi này đơn giản hóa quy trình làm việc của nhà phát triển khi tích hợp llama.cpp vào các ứng dụng iOS và macOS bằng cách đóng gói trực tiếp các GPU shader đã biên dịch sẵn vào XCFramework. Điều này giúp suy luận mô hình ngôn ngữ lớn (LLM) cục bộ được tăng tốc phần cứng mượt mà hơn trên các nền tảng của Apple mà không cần các bước biên dịch shader thủ công khi chạy. Bản phát hành b10752 cung cấp các tệp nhị phân biên dịch sẵn cho macOS, iOS, Linux, Android và Windows hỗ trợ các backend như CUDA 12/13, ROCm, Vulkan và SYCL. Đáng chú ý, tính năng tăng tốc KleidiAI cho macOS arm64 và các bản dựng cho openEuler vẫn tiếp tục bị vô hiệu hóa trong phiên bản này.
## KIẾN THỨC NỀN
Metal là API đồ họa và tính toán tăng tốc phần cứng cấp thấp của Apple, hỗ trợ biên dịch các GPU shader thành tệp nhị phân .metallib để thực thi. XCFramework là định dạng phân phối nhị phân của Apple cho phép nhà phát triển đóng gói các thư viện dành cho nhiều nền tảng (như iOS, iOS Simulator và macOS) vào một gói duy nhất. llama.cpp là một thư viện mã nguồn mở C/C++ phổ biến được thiết kế để chạy hiệu quả các mô hình ngôn ngữ lớn cục bộ trên nhiều nền tảng phần cứng.