Bản Fork llama.cpp Tối Ưu Hóa Tăng Gấp Ba Tốc Độ Decode Trên Dual GPU AMD RX 7900 XTX
Một nhà phát triển đã phát hành bản fork llama.cpp tùy chỉnh được tối ưu hóa riêng cho hệ thống chạy 2 card AMD Radeon RX 7900 XTX trên Linux. Dự án giúp tăng tốc độ decode cho mô hình Qwen 3.8B Q8 lên 82 token/giây ở độ dài ngữ cảnh 60k, vượt trội so với mức 28 token/giây của bản Vulkan mặc định. Card màn hình AMD trước đây thường yếu thế hơn Nvidia về khả năng hỗ trợ suy luận LLM cục bộ và tối ưu hóa phần mềm. Sự tối ưu hóa riêng cho RDNA 3 này chứng minh rằng mã nguồn được tinh chỉnh cho phần cứng có thể khai phá hiệu năng vượt trội cho phần cứng AMD thương mại. Kho lưu trữ (`nasone32/llama.cpp-RDNA3-7900xtx-opt`) đạt tốc độ nhanh gấp gần 3 lần so với llama.cpp tiêu chuẩn dùng Vulkan dưới tải ngữ cảnh lớn. Bản tối ưu này tập trung vào mức lượng hóa Q8, giúp giữ độ chính xác của mô hình trong khi tận dụng hiệu quả VRAM của cả hai GPU.
## KIẾN THỨC NỀN
llama.cpp là một framework C/C++ phổ biến được sử dụng để chạy các mô hình ngôn ngữ lớn (LLM) cục bộ trên phần cứng cá nhân. Kỹ thuật lượng hóa như Q8 nén độ chính xác của trọng số mô hình xuống 8-bit, giúp giảm mức sử dụng VRAM nhưng vẫn duy trì chất lượng đầu ra. Kiến trúc vi xử lý RDNA 3 của AMD là nền tảng của các GPU thương mại cao cấp như Radeon RX 7900 XTX.