~/LOCALLLAMA/qwen-27b-model-can-now-run-on-amd-npus-using-fastflowlm

Mô hình Qwen 27B hiện có thể chạy trên AMD NPU thông qua FastFlowLM

Các nhà phát triển đã thử nghiệm chạy thành công mô hình ngôn ngữ lớn Qwen 27 tỷ tham số trên AMD NPU bằng khung suy luận FastFlowLM. Tuy nhiên, hiệu suất tạo câu hiện tại cực kỳ chậm, chỉ đạt khoảng 1 token mỗi giây trong quá trình giải mã. Cột mốc này mở rộng khả năng suy luận AI cục bộ bằng cách lần đầu tiên đưa mô hình 27 tỷ tham số lên phần cứng AMD NPU tiêu dùng. Dù vậy, tốc độ 1 token/giây cho thấy kiến trúc NPU tiêu dùng vẫn gặp điểm nghẽn nghiêm trọng về băng thông bộ nhớ khi xử lý các LLM lớn. Mặc dù FastFlowLM được tối ưu hóa riêng cho NPU AMD Ryzen AI, việc chạy mô hình lớn tới 27B vượt xa ngưỡng hoạt động tối ưu của phần cứng này. Tốc độ hiện tại 1 token/giây khiến cấu hình này chủ yếu phục vụ cho mục đích thử nghiệm kỹ thuật thay vì ứng dụng thực tế hàng ngày.

## KIẾN THỨC NỀN

Neural Processing Unit (NPU), chẳng hạn như dòng XDNA của AMD tích hợp trong bộ xử lý Ryzen AI, là các chip chuyên dụng được thiết kế cho việc tăng tốc AI hiệu quả và tiết kiệm năng lượng. FastFlowLM là bộ thực thi (runtime) suy luận được thiết kế riêng để tối ưu hóa việc chạy LLM cục bộ trên AMD NPU. Các mô hình lớn như Qwen 27B thường đòi hỏi băng thông và dung lượng bộ nhớ lớn, điều mà NPU trên máy tính phổ thông thường khó đáp ứng so với GPU rời chuyên dụng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LocalLLaMA#AMD NPU#LLM Inference#Hardware Acceleration#Open Source AI

$ subscribe --daily

Mô hình Qwen 27B hiện có thể chạy trên AMD NPU thông qua FastFlowLM | Daily News