~/LLM SERVING/sglang-v0-5-21-released-with-expanded-model-support-and-performance-upgrades

SGLang Phát Hành Phiên Bản 0.5.21 Mở Rộng Hỗ Trợ Mô Hình và Tối Ưu Hiệu Năng

SGLang v0.5.21 đã chính thức phát hành, tổng hợp 779 pull request từ 227 người đóng góp. Bản cập nhật này bổ sung khả năng phục vụ (serving) cho nhiều mô hình LLM, VLM và diffusion mới như DeepSeek-V4.1 Flash, MiMo-V2.6 và DiffusionGemma, đồng thời chuyển lõi bộ nhớ đệm tiền tố (prefix cache) sang sử dụng Rust mặc định. Bản cập nhật này củng cố vị thế của SGLang như một công cụ suy luận (inference engine) mã nguồn mở hàng đầu cho các tác vụ ngôn ngữ, đa thức và tạo ảnh. Các cải tiến như chuyển đổi linh hoạt giữa tính năng prefill và decode mà không cần khởi động lại máy chủ giúp kỹ sư hạ tầng tối ưu hóa hiệu suất GPU và giảm độ trễ trong môi trường thực tế. Các cải tiến hiệu năng chính bao gồm giảm 22% thời gian tạo token đầu tiên đối với câu lệnh dài cho DeepSeek-V4.1 và tăng 20.6% băng thông prefill cho Kimi K3 trong kiến trúc phục vụ phân tách. Phiên bản này cũng bổ sung các endpoint mới `/v1/decisions` và `/v1/score` giúp phân loại độ trễ thấp và chấm điểm nhiều phương án trong một yêu cầu duy nhất.

## KIẾN THỨC NỀN

SGLang là một khung làm việc (framework) mã nguồn mở hiệu năng cao được thiết kế để phục vụ các mô hình ngôn ngữ lớn và mô hình đa thức từ GPU đơn lẻ đến các cụm máy chủ phân tán lớn. Trong vận hành LLM, quá trình suy luận được chia thành giai đoạn prefill ngốn nhiều năng lực tính toán để xử lý đầu vào và giai đoạn decode tiêu tốn băng thông bộ nhớ để tạo văn bản theo thứ tự.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Serving#Inference#SGLang#Open Source#AI Infrastructure

$ subscribe --daily

SGLang Phát Hành Phiên Bản 0.5.21 Mở Rộng Hỗ Trợ Mô Hình và Tối Ưu Hiệu Năng | Daily News