Mô hình Qwen 27B đạt hiệu năng chạy cục bộ ấn tượng trên APU AMD Strix Halo
Một người dùng đã trình diễn hiệu năng chạy LLM cục bộ ấn tượng khi vận hành mô hình Qwen 27B Q8_0 trên nền tảng Ryzen AI Max+ 395 (Strix Halo) mới của AMD với 128GB bộ nhớ thống nhất. Sử dụng llama.cpp kết hợp với ROCm và kỹ thuật giải mã suy đoán Multi-Token Prediction (MTP) gốc, hệ thống đạt tốc độ từ 9 đến 19 token mỗi giây với cửa sổ ngữ cảnh lớn lên tới 142k. Thử nghiệm này cho thấy tiềm năng của các APU bộ nhớ thống nhất băng thông cao của AMD như một giải pháp thay thế mạnh mẽ và tiết kiệm chi phí cho GPU rời khi chạy các mô hình AI cục bộ lượng tử hóa kích thước lớn. Nó làm nổi bật khả năng của phần cứng phân khúc người dùng phổ thông sở hữu bộ nhớ thống nhất trong việc xử lý các cửa sổ ngữ cảnh khổng lồ và các quy trình tác vụ tự động phức tạp tại chỗ. Hệ thống đã phân chia 64 GB VRAM và 64 GB RAM từ 128 GB bộ nhớ thống nhất để chạy mô hình. Kỹ thuật giải mã suy đoán MTP gốc đạt tỷ lệ chấp nhận từ 97-99%, cho phép tác nhân AI tạo ra một trình giả lập bay hoàn chỉnh bằng HTML trong khoảng 20 phút.
## KIẾN THỨC NỀN
Strix Halo (Ryzen AI Max+) của AMD là một kiến trúc APU sở hữu các nhân CPU hiệu năng cao và đồ họa tích hợp chia sẻ chung một bể bộ nhớ thống nhất băng thông cao dung lượng lớn. Multi-Token Prediction (MTP) là một kỹ thuật giải mã suy đoán giúp tăng tốc độ suy luận bằng cách dự đoán nhiều token cùng lúc mà không cần mô hình nháp riêng biệt. ROCm là nền tảng phần mềm mã nguồn mở của AMD dành cho tính toán GPU, đóng vai trò là giải pháp thay thế cho hệ sinh thái CUDA của Nvidia.