~/LLM INFERENC/llama-cpp-achieves-1-2k-tokens-s-prefill-for-qwen-models-on

llama.cpp Đạt Tốc Độ Prefill 1,2k Token/Giây Cho Mô Hình Qwen Trên AMD Strix Halo

Một nhà phát triển mã nguồn mở đã tối ưu hóa llama.cpp bằng HIP runtime tùy chỉnh để đạt tốc độ prefill 1.200 token/giây cho mô hình Qwen3.8 Flash Next trên phần cứng AMD Strix Halo. Thành tựu hiệu năng này san bằng khoảng cách với phần mềm nguồn đóng Halogen Flash Server, vốn trước đây có tốc độ prefill nhanh gấp ba lần mã nguồn mở. Đột phá tối ưu này mang lại tốc độ suy luận cục bộ cực nhanh cho các kiến trúc sparse attention trên phần mềm hoàn toàn mở, xóa bỏ sự phụ thuộc vào các engine nguồn đóng. Việc này nâng cao đáng kể hiệu năng chạy LLM cục bộ trên đồ họa tích hợp AMD và hứa hẹn mang lại lợi ích cho các kiến trúc tương tự như GLM 5.3 Flash khi được đóng góp vào dự án chính. Tốc độ này đạt được nhờ việc khôi phục và chỉnh sửa một HIP runtime tùy chỉnh cùng nhánh mã nguồn tinh chỉnh riêng cho cơ chế sparse attention của Qwen. Tác giả dự định làm sạch mã nguồn để gửi các đóng góp pull request (PR) đến nhánh chính llama.cpp và các phiên bản cộng đồng.

## KIẾN THỨC NỀN

Quá trình suy luận mô hình ngôn ngữ lớn (LLM) bao gồm hai giai đoạn chính: prefill (xử lý ngữ cảnh đầu vào theo dạng song song) và decode (tạo nối tiếp từng token đầu ra). AMD HIP (Heterogeneous-Compute Interface for Portability) là môi trường runtime C++ cho phép lập trình tính toán trên phần cứng AMD GPU. Các trình suy luận mã nguồn mở thường cần những tinh chỉnh kernel chuyên biệt để đạt hiệu năng tương đương phần mềm nguồn đóng trên các kiến trúc phần cứng mới như AMD Strix Halo.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#llama.cpp#Performance Optimization#AMD#Local AI

$ subscribe --daily

llama.cpp Đạt Tốc Độ Prefill 1,2k Token/Giây Cho Mô Hình Qwen Trên AMD Strix Halo | Daily News