Huấn luyện lại DFlash 2 Drafter giúp tăng tốc Ternary Bonsai 2 27B lên đến 3,2x
Lập trình viên naklitechie đã tinh chỉnh mô hình dự đoán (draft model) DFlash 2 bằng 1,5 triệu token do LLM Ternary Bonsai 2 27B của PrismML tạo ra. Sự cân chỉnh này mang lại tốc độ suy luận nhanh hơn tới 2,2 lần trên các bài kiểm tra tiêu chuẩn và 3,15 lần đối với chỉnh sửa mã nguồn khi kết hợp với n-gram lookup trên GPU NVIDIA L4. Các mô hình dự đoán tiêu chuẩn thường hoạt động kém với các LLM định dạng lượng tử hóa 3 giá trị (ternary) do sự lệch phân phối đầu ra, làm giảm hiệu quả của giải mã suy đoán. Dự án này chứng minh rằng việc tinh chỉnh mô hình dự đoán trên đầu ra của mô hình lượng tử hóa cực thấp sẽ khôi phục tỷ lệ chấp nhận token cao, cho phép thực thi tốc độ cao trên GPU NVIDIA, Apple Silicon và WebGPU. DFlash 2 ban đầu được huấn luyện trên đầu ra BF16 tiêu chuẩn, dẫn đến tỷ lệ từ chối token cao khi ghép nối với mô hình ternary. Bộ tối ưu hóa này bao gồm kernel Metal GEMM 2-bit 8 hàng tùy chỉnh cho bước xác minh trên macOS và bản chuyển mã WGSL cho trình duyệt Chrome, duy trì độ chính xác trong khoảng chênh lệch 1–2 bài toán.
## KIẾN THỨC NỀN
Giải mã suy đoán (speculative decoding) tăng tốc độ sinh văn bản của LLM bằng cách sử dụng một mô hình dự đoán nhỏ để đoán các token tiếp theo, sau đó mô hình chính sẽ xác minh chúng song song. Lượng tử hóa 3 giá trị (ternary quantization) biểu diễn trọng số mô hình chỉ bằng ba giá trị (-1, 0, +1), giúp giảm mạnh dung lượng bộ nhớ để mô hình 27 tỷ tham số có thể chạy trên phần cứng cá nhân. DFlash 2 là kiến trúc dự đoán block-diffusion được thiết kế để tạo nhanh các khối nhiều token.