Tối ưu hóa DeepSeek V4 Flash đạt 700 PP/s bằng llama.cpp
Một người dùng đã chia sẻ cấu hình chạy DeepSeek V4 Flash trên llama.cpp giúp tăng tốc độ xử lý prompt từ 140 PP/s lên hơn 700 PP/s. Kết quả này đạt được trên hệ thống sử dụng CPU Threadripper 5965WX và GPU RTX 5090 bằng cách điều chỉnh kích thước batch và kích hoạt tính năng đẩy tải MoE (Mixture of Experts) sang CPU. Thử nghiệm này cho thấy phần cứng cấp người dùng và máy trạm có thể đạt hiệu suất suy luận LLM cục bộ cao thông qua tối ưu hóa phần mềm. Nó cung cấp một giải pháp thực tế cho những người dùng muốn chạy các mô hình Mixture of Experts lớn một cách hiệu quả mà không cần GPU máy chủ chuyên dụng. Cấu hình tối ưu đã sử dụng các tham số `-b 8192 -ub 8192 --cpu-moe`, nhưng việc tăng kích thước batch lên 16k đã khiến hệ thống bị sập hoặc làm giảm mạnh tốc độ tạo token. Ngoài ra, việc llama.cpp chưa hỗ trợ bộ nhớ đệm KV cache FP8 gốc cho mô hình này buộc phải sử dụng cache FP16, làm tăng gấp đôi dung lượng bộ nhớ yêu cầu.
## KIẾN THỨC NỀN
Xử lý Prompt (PP) và Tạo Token (TG) là các chỉ số đo lường tốc độ đọc đầu vào và ghi đầu ra của LLM. Các mô hình Mixture of Experts (MoE) như DeepSeek V4 định tuyến dữ liệu đầu vào đến các mạng con chuyên biệt, và tính năng đẩy tải sang CPU của llama.cpp cho phép chia sẻ các expert này giữa VRAM của GPU và RAM hệ thống để chạy các mô hình vượt quá giới hạn bộ nhớ GPU.