SGLang v0.5.20 Ra Mắt Hỗ Trợ Mô Hình Mới Và Tối Ưu Suy Luận
SGLang v0.5.20 đã chính thức ra mắt với 713 pull request từ 237 người đóng góp, bổ sung hỗ trợ cho các kiến trúc mô hình mới như GLM-5.3-Flash, Qwen3.8-Flash-Next và FastH3. Bản cập nhật này giới thiệu sampling mask cho quá trình huấn luyện học tăng cường (RL rollout), bộ nhớ đệm điểm phân nhánh radix tree hợp nhất và công cụ giả lập trên CPU. Bản phát hành giúp nâng cao hiệu suất suy luận cho các tác vụ ngữ cảnh dài và nhiều lượt hội thoại, đồng thời tăng tốc quy trình huấn luyện học tăng cường (RL). Các tính năng như bộ nhớ đệm điểm phân nhánh cho chú ý cửa sổ trượt giúp giảm đáng kể thời gian tạo token đầu tiên (TTFT) và tối ưu hóa tái sử dụng bộ nhớ trong các hệ thống triển khai quy mô lớn. Tính năng sampling mask kết hợp overlap scheduling giúp tăng hiệu năng giải mã trên Qwen3-8B lên tới 52% ở kích thước batch 64, trong khi tối ưu hóa radix tree nâng tỷ lệ trúng token từ 43,8% lên 60,8% trên DeepSeek-V4-Flash. Ngoài ra, việc lưu trữ bộ nhớ phản hồi cho `/v1/responses` hiện đã chuyển sang chế độ tùy chọn thông qua cờ `--enable-response-store` để tránh tiêu tốn bộ nhớ không cần thiết.
## KIẾN THỨC NỀN
SGLang là một framework mã nguồn mở hiệu năng cao dùng để phục vụ suy luận mô hình ngôn ngữ lớn (LLM) với độ trễ thấp và băng thông cao trên GPU đơn lẻ cũng như các cụm máy chủ phân tán. Framework này dựa vào các thuật toán chia sẻ bộ nhớ đệm KV tiên tiến như RadixAttention để tăng tốc xử lý câu lệnh trong các quy trình tạo văn bản phức tạp.