~/LLM INFERENC/qwen3-8-flash-next-125b-runs-at-59-tok-s-on-amd

Qwen3.8-Flash-Next (125B) chạy đạt 59 tok/s trên Mini PC AMD Strix Halo

Yamz Labs đã phát hành trọng số định lượng EXL3 95 GB nguồn mở cùng công cụ suy luận Kyojin mới để chạy cục bộ mô hình Qwen3.8-Flash-Next (125B MoE, 6B active). Khi chạy trên một máy tính mini PC AMD Strix Halo 128 GB duy nhất, hệ thống đạt tốc độ giải mã từ 44 đến 59 tok/s nhờ kỹ thuật giải mã dự đoán. Thành tựu này chứng minh các mô hình MoE khổng lồ 125 tỷ tham số có thể thực thi ở tốc độ đáp ứng tốt nhu cầu thực tế trên phần cấp APU cá nhân sở hữu bộ nhớ hợp nhất. Điều này thể hiện sự tiến bộ nhanh chóng của tối ưu hóa nguồn mở, đưa việc chạy LLM cục bộ chất lượng cao đến gần hơn với các nhà phát triển cá nhân. Nếu không dùng giải mã dự đoán, công cụ đạt tốc độ 32,7 tok/s, trong khi tốc độ nạp ngữ cảnh (prefill) duy trì ổn định khoảng ~1.400 tok/s ở độ dài ngữ cảnh lên tới 128K. Công cụ Kyojin ưu tiên độ chính xác, đạt tỷ lệ tương đồng top-1 94,1% so với bản gốc FP8 và đảm bảo kết quả giải mã dự đoán trùng khớp hoàn toàn với giải mã thông thường.

## KIẾN THỨC NỀN

AMD Strix Halo (Ryzen AI Max+ 395) là dòng APU với kiến trúc bộ nhớ hợp nhất, cho phép đồ họa tích hợp truy cập dung lượng RAM hệ thống lên tới 128 GB mà không gặp nút thắt bộ nhớ VRAM của GPU rời. Các mô hình Mixture-of-Experts (MoE) chỉ kích hoạt một phần tham số (như 6 tỷ trên tổng số 125 tỷ) cho mỗi token, mang lại năng lực cao với chi phí tính toán thấp hơn. Kỹ thuật giải mã dự đoán (speculative decoding) tăng tốc độ suy luận bằng cách dùng một mô hình nhỏ dự thảo các token để mô hình lớn xác thực song song.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#Local AI#Hardware Benchmarks#Open Source#Speculative Decoding

$ subscribe --daily

Qwen3.8-Flash-Next (125B) chạy đạt 59 tok/s trên Mini PC AMD Strix Halo | Daily News