Tối ưu hóa tráo đổi VRAM giúp tăng 2.2-2.5 lần tốc độ prefill cho mô hình MoE trên GPU phổ thông
Một nhà phát triển đã giới thiệu chiến lược quản lý VRAM động trên llama.cpp giúp tăng tốc độ prefill từ 2.2 đến 2.5 lần khi chạy mô hình MoE Qwen3.8-Flash-Next trên hệ thống 2 card RTX 3090. Bằng cách giải phóng tạm thời các ô nhớ đệm chuyên gia (expert cache) trong lúc xử lý prompt, máy chủ có thể mở rộng kích thước micro-batch từ 512 lên 2048, giảm đáng kể chi phí truyền tải dữ liệu qua PCIe. Kỹ thuật này giúp cắt giảm mạnh thời gian phản hồi đầu tiên (TTFT)—rút ngắn thời gian prefill ngữ cảnh 119k từ 24 phút xuống dưới 10 phút—mà không ảnh hưởng đến chất lượng đầu ra hay tốc độ decode. Phương pháp này mang lại giải pháp tối ưu bộ nhớ thực tiễn, chi phí thấp cho việc vận hành các mô hình Hỗn hợp Chuyên gia (MoE) lớn ngay trên phần cứng tiêu dùng. Quá trình tráo đổi động này được điều khiển qua các biến môi trường (`LLAMA_PHASE_PREFILL_UBATCH=2048` và `LLAMA_PHASE_PREFILL_MODE=transaction`) với chi phí thời gian cố định khoảng 2.8 giây cho mỗi prompt để giải phóng và khôi phục bộ nhớ. Do các trọng số chuyên gia MoE được nạp qua bus PCIe một lần trên mỗi micro-batch, micro-batch lớn hơn giúp tận dụng băng thông PCIe hiệu quả hơn rất nhiều trong giai đoạn xử lý prompt.
## KIẾN THỨC NỀN
Quá trình suy luận của mô hình ngôn ngữ lớn (LLM) gồm hai giai đoạn tách biệt: prefill (xử lý song song prompt để xây dựng KV cache) và decode (sinh từng token nối tiếp). Kiến trúc Hỗn hợp Chuyên gia (MoE) định tuyến dữ liệu đến các mạng con cụ thể (chuyên gia); trên các hệ thống hạn chế VRAM, các chuyên gia chưa dùng tới thường được đẩy sang RAM máy chủ và chỉ nạp vào GPU khi cần thiết.