~/LLAMA CPP/llama-cpp-release-b10886-adds-q1-0-vector-intrinsic-support-for-s390x

llama.cpp Phát hành Phiên bản b10886 Bổ sung Hỗ trợ Vector Intrinsic Q1_0 cho s390x

Khung làm việc suy luận LLM nguồn mở llama.cpp vừa phát hành phiên bản b10886, bổ sung khả năng tăng tốc vector intrinsic cho kỹ thuật lượng hóa Q1_0 trên kiến trúc CPU s390x. Được đóng góp bởi kỹ sư Aaron Teo từ IBM, bản cập nhật triển khai các luồng tính tích vô hướng ma trận `ggml_vec_dot_q1_0_q8_0` tối ưu. Cải tiến này nâng cao tốc độ suy luận CPU cho các mô hình được lượng hóa bit cực thấp trên máy chủ mainframe IBM Z sử dụng kiến trúc s390x. Điều này mở rộng hệ sinh thái phần cứng cho việc chạy AI cục bộ sang các máy chủ doanh nghiệp chuyên dụng. Bản cập nhật triển khai cụ thể các chỉ thị vector s390x nguyên bản cho hàm `ggml_vec_dot_q1_0_q8_0` trong backend `ggml-cpu`. Các bản tệp thực thi biên dịch sẵn cho Ubuntu s390x hiện đã được cung cấp cùng với các nền tảng tiêu chuẩn như macOS, Windows, Linux và Android.

## KIẾN THỨC NỀN

llama.cpp là một thư viện C/C++ phổ biến được thiết kế để suy luận hiệu năng cao các mô hình ngôn ngữ lớn (LLM) trên nhiều kiến trúc phần cứng khác nhau. Lượng hóa (quantization) giảm độ chính xác của mô hình xuống mức bit thấp hơn (như Q1_0 hoặc Q8_0) nhằm tối thiểu hóa bộ nhớ và tăng tốc tính toán CPU, trong khi s390x là kiến trúc vi xử lý mainframe 64-bit của IBM.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#open-source-ai#quantization#s390x#release-notes

$ subscribe --daily

llama.cpp Phát hành Phiên bản b10886 Bổ sung Hỗ trợ Vector Intrinsic Q1_0 cho s390x | Daily News