So sánh hiệu năng thực tế: DeepSeek-V4-Flash-Vision với Qwen3.8-Flash-Next
Một người dùng đã so sánh hiệu năng hai mô hình lượng hóa Q8 của DeepSeek-V4-Flash-Vision và Qwen3.8-Flash-Next chạy cục bộ trên hệ thống APU AMD Strix Halo kép qua llama.cpp RPC. Kết quả cho thấy mặc dù DeepSeek-V4 có tốc độ tạo token thô chậm hơn khoảng 40%, mô hình này lại hoàn thành các tác vụ lập trình phức tạp nhanh gấp hai lần so với Qwen3.8. Thử nghiệm thực tế này cho thấy tốc độ tạo token thô cao không đồng nghĩa với thời gian hoàn thành công việc nhanh hơn nếu mô hình gặp hiện tượng ảo giác hoặc suy diễn quá mức. Đồng thời, nó cũng chứng minh tính khả thi của hệ thống bộ nhớ hợp nhất đa APU trong việc chạy cục bộ các mô hình LLM lớn. Thử nghiệm được thực hiện trên hai hệ thống Strix Halo 128GB kết nối qua cổng USB-C 4 sử dụng backend RPC của llama.cpp. DeepSeek-V4 đã hoàn thành tác vụ lập trình thử nghiệm trong 12 phút ở chế độ 'medium' so với 25 phút của Qwen3.8, trong khi Qwen3.8 không thể hoàn thành tác vụ sau 3 giờ ở chế độ 'xhigh' do suy diễn chỉ dẫn quá mức.
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở phổ biến giúp chạy các mô hình ngôn ngữ lớn (LLM) trên phần cấp người dùng thông qua các phương pháp lượng hóa tối ưu bộ nhớ như Q8. APU AMD Strix Halo cung cấp bộ nhớ hợp nhất dung lượng lớn, cho phép chạy các mô hình AI kích thước lớn trên đồ họa tích hợp mà không cần card đồ họa rời đắt tiền. Tính năng Remote Procedure Call (RPC) trong llama.cpp cho phép phân chia khối lượng xử lý của mô hình trên nhiều máy tính kết nối với nhau.