Động Cơ Strata Cho Phép Chạy Mô Hình MoE Qwen3.8 125B Trên GPU 12GB
Nhà phát triển Niko1221 đã mở mã nguồn Strata, một động cơ suy luận có khả năng chạy các mô hình MoE 125 tỷ tham số được định lượng như Qwen3.8-Flash-Next trên GPU người dùng với chỉ 12GB VRAM. Nhờ kết hợp đẩy bớt chuyên gia (expert offloading) và giải mã suy đoán (speculative decoding), Strata đạt tốc độ sinh dữ liệu lên tới 94 token/giây trên card NVIDIA RTX 5070. Strata hạ thấp đáng kể yêu cầu phần cứng để chạy cục bộ các mô hình MoE kích thước lớn mà không cần đến GPU máy chủ doanh nghiệp đắt đỏ. Điều này thúc đẩy việc triển khai AI cục bộ khi mang lại hiệu năng tương tác thời gian thực trên các cấu hình máy tính để bàn phổ thông. Động cơ này lưu toàn bộ mô hình MoE trong RAM hệ thống và chỉ lưu đệm các trọng số chuyên gia được dùng thường xuyên vào VRAM, kết hợp mô hình nháp nhỏ để tăng tốc đầu ra qua giải mã suy đoán. Thử nghiệm thực tế cho thấy RTX 5070 (12GB VRAM) cùng 64GB RAM đạt 94 token/giây ở định dạng Q2_0 và 53 token/giây ở định dạng IQ3_S, với yêu cầu phần cứng tối thiểu là 12GB VRAM, 32GB RAM hệ thống và 80GB bộ nhớ lưu trữ.
## KIẾN THỨC NỀN
Các mô hình Phối hợp Chuyên gia (MoE) chia nhỏ mạng nơ-ron thành nhiều mạng con chuyên biệt ('chuyên gia'), chỉ định tuyến đầu vào tới một phần nhỏ tham số cho mỗi token. Kỹ thuật đẩy bớt chuyên gia (expert offloading) tận dụng cấu trúc này bằng cách lưu các chuyên gia không hoạt động trong RAM hệ thống và nạp chuyên gia được chọn vào VRAM khi cần. Giải mã suy đoán (speculative decoding) giúp tăng tốc suy luận bằng cách dùng một mô hình nháp nhẹ để nhanh chóng tạo các token dự đoán, sau đó mô hình chính sẽ xác thực song song mà không ảnh hưởng tới độ chính xác.