~/LLAMA CPP/llama-cpp-release-b10887-adds-q4-0-repack-support-for-ibm-s390x

llama.cpp Phát Hành Bản Build b10887 Hỗ Trợ Repack q4_0 Cho Kiến Trúc IBM s390x

llama.cpp đã phát hành bản build b10887, bổ sung hỗ trợ repack bộ nhớ cho trọng số định lượng q4_0 trên kiến trúc CPU IBM s390x. Được đóng góp bởi nhà phát triển Aaron Teo thuộc IBM qua PR #28667, bản cập nhật này cũng làm sạch các chú thích mã nguồn nội bộ trong backend GGML CPU. Bản phát hành này mở rộng khả năng suy luận mô hình ngôn ngữ lớn (LLM) sang các hệ thống máy chủ mainframe của IBM chạy Linux s390x. Điều này cho phép cơ sở hạ tầng doanh nghiệp dùng phần cứng mainframe thực thi các mô hình AI định lượng hiệu quả hơn trực tiếp trên tài nguyên CPU. Thay đổi này tập trung cụ thể vào backend `ggml-cpu` cho s390x, triển khai việc sắp xếp lại (repack) bộ nhớ cho định dạng định lượng 4-bit q4_0. Các tệp nhị phân biên dịch sẵn chính thức cho Ubuntu s390x CPU được cung cấp cùng với các bản build tiêu chuẩn cho môi trường x64, ARM64, CUDA, Vulkan, ROCm và SYCL.

## KIẾN THỨC NỀN

llama.cpp là một framework suy luận LLM mã nguồn mở hiệu năng cao xây dựng trên thư viện tensor GGML, được thiết kế để chạy các mô hình trên nhiều nền tảng phần cứng khác nhau. IBM s390x là kiến trúc máy chủ mainframe 64-bit chủ yếu dùng trong các dòng máy IBM zSystems doanh nghiệp cho các tác vụ quan trọng. Các kỹ thuật định lượng như q4_0 giúp giảm dung lượng bộ nhớ của LLM bằng cách lưu trữ trọng số dưới dạng 4-bit, trong đó việc repack sẽ tổ chức lại bố cục bộ nhớ để tối ưu hóa hiệu năng các chỉ thị CPU vector.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama.cpp#open-source#AI infrastructure#release-notes

$ subscribe --daily

llama.cpp Phát Hành Bản Build b10887 Hỗ Trợ Repack q4_0 Cho Kiến Trúc IBM s390x | Daily News