CUDA Megakernel Tùy Chỉnh Giúp Mô Hình 27B Đạt 140 tok/s Trên RTX 3090
Một nhà phát triển đã phát hành CUDA megakernel mã nguồn mở thực thi toàn bộ chu kỳ giải mã suy đoán chỉ trong một lần khởi chạy kernel, giúp mô hình 27B tham số đạt tới 140 token/giây trên RTX 3090. Trình thực thi tùy chỉnh này đạt tốc độ nhanh hơn từ 1,4x đến 1,9x so với llama.cpp trên các tác vụ sinh mã nguồn và xử lý đầu vào. Dự án này cho thấy việc hợp nhất kernel GPU tối đa có thể giải phóng tốc độ suy luận vượt trội trên phần cứng tiêu dùng nhờ loại bỏ chi phí khởi chạy và nút thắt băng thông bộ nhớ. Nó chứng minh rằng các tối ưu hóa sâu dành riêng cho một phần cứng và mô hình có thể vượt trội đáng kể so với các trình thực thi LLM tổng quát phổ biến như llama.cpp. Trình thực thi (open-jet) cung cấp một máy chủ API tương thích với OpenAI, nhưng hiện được thiết kế tối ưu riêng cho bản định lượng Q4_K_M của Unsloth trên GPU RTX 3090. Nhờ thực thi toàn bộ chu kỳ nháp-và-xác nhận trong một lần khởi chạy, việc xác nhận 4 đến 5 token dự đoán tốn chi phí khởi chạy GPU gần như tương đương với việc kiểm tra một token duy nhất.
## KIẾN THỨC NỀN
Giải mã suy đoán (speculative decoding) tăng tốc suy luận LLM bằng cách sử dụng một mô hình nháp nhỏ để sinh các token ứng viên, sau đó mô hình đích lớn hơn sẽ xác nhận song song nhằm thay thế quy trình sinh tuần tự chậm chạp. CUDA megakernel là kỹ thuật tối ưu hóa GPU hợp nhất nhiều bước tính toán riêng biệt vào một kernel duy nhất, giúp tránh chi phí gọi GPU liên tục từ CPU.