~/LLAMA CPP/llama-cpp-release-b11270-optimizes-packed-byte-subtraction-for-amd-hip

llama.cpp Phát Hành Bản b11270 Tối Ưu Hóa Phép Trừ Byte Đóng Gói Cho AMD HIP

llama.cpp vừa phát hành bản dựng b11270, giới thiệu một vi tối ưu hóa trong backend ggml-cuda dành cho phần cứng AMD HIP. Bản cập nhật thay thế phép trừ byte đóng gói có bão hòa (__vsubss4) bằng các chỉ thị không bão hòa (__vsub4). Dù bản dựng b11270 là một bản phát hành định kỳ nhỏ, nó giúp cải thiện hiệu suất của chỉ thị kernel GPU khi chạy suy luận trên phần cứng AMD thông qua HIP. Những vi tối ưu hóa cấp thấp như vậy rất quan trọng để giữ cho llama.cpp hoạt động nhanh trên nhiều backend tăng tốc khác nhau. Thay đổi này được đưa vào qua pull request #29478 bởi Carl Philipp Klemm, giúp loại bỏ chi phí kiểm tra bão hòa trong các phép toán byte đóng gói. Bản phát hành cũng bao gồm cập nhật tích hợp liên tục (CI) để bỏ qua một thanh ghi mục đích chung véc-tơ (VGPR) bị tràn trong kernel fattn_vec.

## KIẾN THỨC NỀN

llama.cpp là một framework C/C++ phổ biến được thiết kế để chạy suy luận cục bộ các Mô hình Ngôn ngữ Lớn trên nhiều nền tảng phần cứng. AMD HIP (Heterogeneous-Computing Interface for Portability) là API thời gian chạy cho phép các nhà phát triển chạy mã kiểu CUDA trên GPU của AMD. Trong các kernel tính toán, phép toán bão hòa sẽ giới hạn số về khoảng cố định cực đại hoặc cực tiểu khi bị tràn, trong khi phép toán không bão hòa bỏ qua các bước kiểm tra giới hạn này để đạt tốc độ xử lý chỉ thị cao hơn khi không cần bảo vệ chống tràn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llama-cpp#cuda#hip#open-source-ai#release-notes

$ subscribe --daily

llama.cpp Phát Hành Bản b11270 Tối Ưu Hóa Phép Trừ Byte Đóng Gói Cho AMD HIP | Daily News