~/LLM INFERENC/sglang-v0-5-19-released-with-new-model-support-and-performance-optimizations

SGLang Ra Mắt Phiên Bản v0.5.19 Bổ Sung Hỗ Trợ Mô Hình Mới Và Tối Ưu Hiệu Năng

SGLang đã phát hành phiên bản v0.5.19, bổ sung hỗ trợ các mô hình tự hồi quy mới bao gồm Qwen3.8, Ling-3.0 và Granite 4.2, cùng với mô hình khuếch tán như LongCat-Image-Edit. Bản cập nhật này cũng tích hợp khả năng tìm kiếm chùm (beam search), DeepEP v2 cho các mô hình MoE, song song chuỗi LayerNorm và lượng hóa kích hoạt FP8 cho các chuyên gia MoE trên GPU Hopper. Khi các mô hình LLM mã nguồn mở phát triển nhanh chóng, các công cụ suy luận cần nhanh chóng thích ứng với các kiến trúc mô hình mới và các tối ưu hóa phần cứng để duy trì hiệu suất cao. Những nâng cấp này giúp các đội ngũ triển khai SGLang có thể chạy các mô hình mới hơn với độ trễ thấp hơn và băng thông đầu ra cao hơn trên nhiều nền tảng phần cứng khác nhau. Tính năng beam search mới cho phép người dùng yêu cầu các chuỗi kết quả tốt nhất qua tham số `beam_width`, dù hiện tại chưa hỗ trợ kết hợp với speculative decoding hoặc disaggregation. Bên cạnh đó, tính năng song song chuỗi LayerNorm giúp giảm thời gian giai đoạn prefill lên tới 5,6% trên GPU NVIDIA B200, trong khi DeepEP v2 chuẩn hóa bộ đệm kích thước cố định để quá trình decode có thể chạy dưới CUDA graphs trên nhiều nút.

## KIẾN THỨC NỀN

SGLang là một framework phục vụ suy luận mã nguồn mở thuộc quản lý của LMSYS, được thiết kế để phục vụ hiệu năng cao cho các mô hình ngôn ngữ lớn và đa thức. Framework này cung cấp các backend thực thi chuyên dụng, các quy trình quản lý bộ nhớ và hỗ trợ lượng hóa nhằm phục vụ các mô hình AI một cách hiệu quả ở quy mô doanh nghiệp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#SGLang#AI Infrastructure#Open Source#Model Serving

$ subscribe --daily

SGLang Ra Mắt Phiên Bản v0.5.19 Bổ Sung Hỗ Trợ Mô Hình Mới Và Tối Ưu Hiệu Năng | Daily News