Chạy suy luận LLM Qwen3.5 trên phần cứng khai thác tiền điện tử bằng FPGA giá rẻ
Nhà phát triển Nero7991 đã triển khai thành công thiết kế RTL bằng VHDL để chạy suy luận mô hình Qwen3.5 9B và 27B INT4 trên các bo mạch khai thác tiền điện tử FPGA giá rẻ SQRL FK33 và Jungle Cat. Chạy trên phần cứng Xilinx Virtex UltraScale+ tái sử dụng có tích hợp bộ nhớ HBM2, hệ thống đạt tốc độ tạo văn bản khoảng 3,2 token/giây ở xung nhịp 75 MHz. Dự án này chứng minh rằng các bo mạch đào tiền điện tử cũ giá rẻ có bộ nhớ băng thông cao (HBM2) có thể trở thành bộ tăng tốc phần cứng khả thi cho suy luận LLM. Điều này mở ra một hướng đi nguồn mở khả thi để thay thế các GPU đắt tiền bằng cách lập trình phần cứng trực tiếp trên các chip FPGA doanh nghiệp đã qua sử dụng. Kho lưu trữ nguồn mở (llm.vhdl) xử lý suy luận mô hình INT4 trên thiết lập nhiều bo mạch kết nối song song (pipeline parallelism) thông qua máy host điều phối. Dự đoán cho thấy khi mở rộng thiết kế lên xung nhịp 200 MHz trên 4 die XCVU35P (tổng cộng 32GB HBM2), tốc độ tạo văn bản có thể đạt 25 token/giây ở ngữ cảnh ngắn và hỗ trợ chiều dài ngữ cảnh lên tới 262k token.
## KIẾN THỨC NỀN
FPGA (Field-Programmable Gate Array) là các thiết bị bán dẫn có thể tái lập trình phần cứng, cho phép nhà phát triển thiết kế mạch tích hợp tùy chỉnh bằng các ngôn ngữ mô tả phần cứng như VHDL. Các bo mạch khai thác tiền điện tử như SQRL FK33 và Jungle Cat được trang bị chip FPGA Xilinx Virtex UltraScale+ đi kèm bộ nhớ băng thông cao (HBM2), cung cấp băng thông lên đến 400 GB/s rất cần thiết cho tác vụ suy luận LLM vốn bị giới hạn bởi tốc độ bộ nhớ.