Thử nghiệm Qwen3.8-Flash-Next: SGLang nhanh hơn llama.cpp 7,3 lần về thời gian tạo token đầu tiên
Một bài kiểm thử hiệu năng mô hình Qwen3.8-Flash-Next ở cửa sổ ngữ cảnh 262K token đã cho thấy sự chênh lệch lớn giữa các engine phục vụ LLM trên GPU NVIDIA RTX PRO 6000 Blackwell. SGLang đạt thời gian tạo token đầu tiên (TTFT) là 35,4 giây so với 258,4 giây của llama.cpp bản gốc, giảm thời gian chờ đợi ban đầu tới 7,3 lần. Các ứng dụng LLM ngữ cảnh dài phụ thuộc rất nhiều vào độ trễ xử lý đầu vào (prefill) thấp, khiến việc lựa chọn engine và các tối ưu hóa riêng trở nên quan trọng đối với khả năng sử dụng thực tế. Mặc dù các framework phục vụ máy chủ như SGLang vượt trội về tốc độ ngữ cảnh dài, các engine nhẹ như llama.cpp vẫn duy trì lợi thế lớn về thời gian khởi động nhanh. SGLang dẫn đầu về tốc độ giải mã (decode) ở ngữ cảnh đầy đủ với 126,9 tok/s so với 20,3 tok/s của llama.cpp bản gốc, mặc dù llama.cpp tích hợp MTP (Multi-Token Prediction) đã cải thiện tốc độ giải mã lên tới 1,69 lần. Ngược lại, thời gian khởi động lại ưu thế hơn cho llama.cpp khi bắt đầu trả lời chỉ sau 16 giây so với 108 giây của SGLang và 126 giây của FreeToken.
## KIẾN THỨC NỀN
Thời gian tạo token đầu tiên (TTFT) đo lường thời gian engine suy luận xử lý các token đầu vào (giai đoạn prefill) trước khi tạo ra token đầu ra đầu tiên, một quá trình tiêu tốn rất nhiều tài nguyên tính toán ở cửa sổ ngữ cảnh cực lớn. Các framework như SGLang được thiết kế cho việc triển khai máy chủ hiệu năng cao với quản lý KV-cache tối ưu, trong khi llama.cpp ưu tiên tính di động và tiêu thụ ít tài nguyên.