Halogen 0.17.2 Tăng Tốc Độ Suy Luận Qwen Flash Next Lên 45 TPS Trên AMD Strix Halo
Công cụ suy luận Halogen vừa phát hành phiên bản 0.17.2, giúp mô hình Qwen 3.8 Flash Next (~177 tỷ tham số) duy trì tốc độ giải mã khoảng 45 token/giây ngay cả với độ dài ngữ cảnh lớn trên hệ thống AMD Strix Halo 128GB. Đạt được tốc độ suy luận cục bộ nhanh cho các mô hình khổng lồ gần 177 tỷ tham số giúp các tác vụ AI phức tạp trở nên khả thi hơn trên phần cứng APU cá nhân mà không cần phụ thuộc vào GPU đám mây đắt đỏ. Điều này thể hiện sự tối ưu hóa nhanh chóng của các công cụ LLM cục bộ dành cho kiến trúc bộ nhớ hợp nhất băng thông cao hiện đại. Thử nghiệm tốc độ được thực hiện trên cấu hình AMD Strix Halo 128GB chạy Halogen 0.17.2 với Qwen 3.8 Flash Next. Người dùng cho biết tốc độ giải mã duy trì ổn định ở mức gần 45 token/giây khi xử lý ngữ cảnh dài và mang lại kết quả lập kế hoạch chất lượng cao.
## KIẾN THỨC NỀN
Các APU AMD Strix Halo (Ryzen AI MAX) sở hữu kiến trúc bộ nhớ hợp nhất với băng thông cao, rất phù hợp để chạy các mô hình AI lớn tại chỗ. Các công cụ suy luận như Halogen liên tục cập nhật các nhân thực thi và luồng truy xuất bộ nhớ để gia tăng tốc độ sinh dữ liệu, được tính bằng token trên giây (TPS).