Engine Strata Đạt 65 Token/Giây Trên VRAM 12GB Nhờ Offloading Sang RAM Hệ Thống
Nhà phát triển KnownAd4832 đã phát hành Strata, một công cụ suy luận CUDA mã nguồn mở được thiết kế để tối ưu hóa việc vận hành mô hình ngôn ngữ lớn trên GPU tầm trung kết hợp offload sang RAM DDR5. Khi chạy mô hình lượng hóa Qwen3.8-Flash-Next trên card RTX 5070 12GB VRAM cùng 64GB RAM DDR5, Strata đạt tốc độ sinh văn bản lên tới 65,1 token/giây và xử lý đầu vào trên 540 token/giây. Strata thể hiện tốc độ nhanh gấp tới 4 lần so với llama.cpp đối với các mô hình lượng hóa vượt quá dung lượng VRAM của GPU. Điều này cho thấy các nhân CUDA tối ưu riêng cho phần cứng kết hợp với định dạng lượng hóa tiên tiến có thể hạ thấp đáng kể rào cản phần cứng cho việc suy luận AI cục bộ trên PC cá nhân. Thử nghiệm trên cấu hình gồm RTX 5070 12GB, Ryzen 5 7600 và 64GB RAM DDR5-5600, engine tận dụng các định dạng lượng hóa chuyên dụng bao gồm RCO-GSQ từ ISTA-DASLab và các định dạng GGUF (Q2_0, IQ2_XS, IQ3_XXS) ở độ dài ngữ cảnh 128K. Tổng dung lượng bộ nhớ yêu cầu dao động từ 37,6GB đến 47GB kết hợp giữa RAM và VRAM, cộng thêm 0,91GB cho bộ mã hóa thị giác (vision encoder).
## KIẾN THỨC NỀN
Lượng hóa (Quantization) giúp giảm độ chính xác của trọng số mô hình để thu nhỏ dung lượng bộ nhớ và tăng tốc suy luận, giúp các mô hình lớn chạy được trên GPU phổ thông hoặc hệ thống kết hợp RAM và VRAM. Các kỹ thuật như GSQ (Group-Sparse Quantization) và RCO (Residual Control Optimization) từ ISTA-DASLab áp dụng độ chính xác hỗn hợp trên từng trọng số để duy trì chất lượng mô hình ngay cả ở mức nén 2-bit hoặc 3-bit.