Suy luận LLM tốc độ cao trên phần cứng phổ thông nhờ bản Strata tùy chỉnh
Nhà phát triển bodhi371 đã trình diễn việc chạy mô hình Qwen3.8-Flash-Next lượng tử hóa IQ3_S bằng bản fork thử nghiệm của công cụ Strata trên máy tính có 12GB VRAM, 32GB RAM và SSD NVMe. Cấu hình này đạt tốc độ giải mã 20–30 token/giây và tốc độ xử lý nạp ngữ cảnh (prefill) lên tới 90.000 token/giây ở độ dài ngữ cảnh 131k. Cấu hình thử nghiệm này chứng minh rằng việc kết hợp lượng tử hóa sâu với chuyển giao bộ nhớ thông minh cho phép chạy các mô hình Mixture-of-Experts cỡ lớn ngay trên phần cứng tầm trung. Điều này giúp hạ thấp rào cản truy cập AI cục bộ hiệu năng cao mà không cần phụ thuộc vào hạ tầng đám mây đắt đỏ hay GPU doanh nghiệp cao cấp. Dự án dựa trên các tùy chỉnh kiến trúc đối với Strata nhằm luân chuyển động các lớp expert giữa VRAM, RAM hệ thống và ổ cứng NVMe. Khi giảm mức lượng tử hóa xuống Q2, tốc độ giải mã tăng thêm, đạt mức 39–45 token/giây.
## KIẾN THỨC NỀN
Strata là một công cụ suy luận LLM cục bộ mã nguồn mở được thiết kế để chạy các mô hình Mixture-of-Experts (MoE) lớn trên phần cứng người dùng bằng cách tự động đẩy các lớp expert không hoạt động giữa VRAM GPU, RAM hệ thống và ổ cứng NVMe. IQ3_S là kỹ thuật lượng tử hóa dựa trên ma trận tầm quan trọng (i-quant) trong hệ sinh thái ggml, giúp nén trọng số mô hình xuống khoảng 3 bit mỗi tham số mà vẫn duy trì độ chính xác. Các mô hình "abliterated" là biến thể LLM được chỉnh sửa để giảm hành vi từ chối câu hỏi nhưng vẫn giữ nguyên khả năng suy luận cơ bản.