vLLM v0.30.0 Phát Hành Hỗ Trợ DeepSeek-V4 và Trình Quản Lý Nạp Trọng Số Nhanh
vLLM phiên bản 0.30.0 bổ sung hỗ trợ gốc cho các kiến trúc mô hình mới như DeepSeek-V4.1-Flash và GLM-5.3-Flash cùng tầng giải mã HiSparse lưu trữ trên máy chủ. Phiên bản này cũng giới thiệu trình quản lý bộ nhớ tạm trọng số theo GPU chạy ẩn bằng CUDA IPC, giúp bỏ qua việc đọc từ đĩa khi khởi động lại engine để rút ngắn thời gian khởi tạo. Bản cập nhật này giúp giảm đáng kể độ trễ khởi động lạnh và chi phí khởi tạo engine cho hạ tầng phục vụ LLM trong môi trường sản xuất. Ngoài ra, việc nâng cấp hỗ trợ cho Multi-head Latent Attention (MLA) thưa và các định dạng dữ liệu độ chính xác thấp giúp khắc phục nút thắt băng thông bộ nhớ trên các dòng GPU cao cấp như NVIDIA H200 và kiến trúc Blackwell. Tính năng đóng băng cơ chế dọn rác Python khi ghi nhận CUDA graph giúp giảm thời gian khởi tạo engine trên GPU H200 từ 28,9 giây xuống 8,2 giây. Release này cũng tích hợp KV-cache dạng MXFP8, thuật toán cân bằng tải song song chuyên gia (EPLB) cho định tuyến MoE và cơ chế đóng dấu bản quyền Gumbel-max hai khóa tương thích với suy luận đoán trước.
## KIẾN THỨC NỀN
vLLM là engine suy luận LLM mã nguồn mở phổ biến được thiết kế để đạt hiệu suất cao và tối ưu bộ nhớ nhờ các kỹ thuật như PagedAttention. Các kiến trúc MoE (Mixture-of-Experts) và định dạng chú ý MLA (Multi-head Latent Attention) thưa hiện đại phụ thuộc vào các kernel CUDA chuyên biệt như FlashMLA và bộ cân bằng tải động như EPLB để duy trì băng thông phục vụ lớn khi triển khai quy mô rộng.