Lý do vLLM đạt tốc độ prefill nhanh vượt trội so với llama.cpp trên hệ thống nhiều GPU
Một người dùng khi thử nghiệm benchmark các engine suy luận LLM trên hệ thống 4x NVIDIA RTX 4090 đã ghi nhận tốc độ prefill đạt tới 7.500 token/giây khi dùng các bản fork của vLLM. Người này chỉ ra khoảng cách hiệu năng rất lớn trong xử lý prefill so với các engine như llama.cpp, ngay cả khi loại bỏ yếu tố bộ nhớ đệm. Tốc độ prefill quyết định trực tiếp thời gian tạo token đầu tiên (TTFT) khi xử lý các câu lệnh dài, điều quan trọng đối với ứng dụng ngữ cảnh dài và hiệu năng cho doanh nghiệp. Việc vLLM thể hiện ưu thế vượt trội trên hệ thống multi-GPU giải thích lý do các engine hướng máy chủ được ưu tiên cho môi trường triển khai lưu lượng cao. Thử nghiệm benchmark được đo bằng kịch bản tính thời gian tùy chỉnh để chủ động loại bỏ cache hit nhằm đo chính xác khả năng prefill thuần túy. Lợi thế tốc độ này đến từ khả năng phân tách song song tensor (tensor parallelism) tối ưu của vLLM trên nhiều GPU và tích hợp sâu với các kỹ thuật như Multi-Token Prediction (MTP).
## KIẾN THỨC NỀN
Suy luận LLM bao gồm hai giai đoạn riêng biệt: prefill và decode. Trong giai đoạn prefill, engine xử lý toàn bộ câu lệnh đầu vào cùng lúc để nạp vào bộ nhớ đệm Key-Value (KV cache), biến đây thành một tác vụ phụ thuộc nhiều vào năng lực tính toán (compute-bound). Ngược lại, giai đoạn decode tạo ra từng token một và phụ thuộc chính vào băng thông bộ nhớ (memory-bandwidth-bound).