Tối ưu hóa suy luận LLM cục bộ trên cặp GPU NVIDIA Tesla V100 không đối xứng
Một người dùng đã thử nghiệm thành công hiệu năng suy luận LLM tốc độ cao trên cặp GPU doanh nghiệp thế hệ cũ không đối xứng (NVIDIA Tesla V100 PCIe 16 GB + 32 GB, tổng 48 GB VRAM). Nhờ tối ưu hóa cấu hình llama.cpp với phân tách tensor (tensor split), FlashAttention và phân bổ bộ nhớ NUMA, hệ thống đạt tốc độ xử lý prompt trên 1.370 token/giây và suy luận ra gần 40 token/giây trên các mô hình Qwen 27B. Thử nghiệm này chứng minh rằng các nhà phát triển với ngân sách hạn chế hoàn toàn có thể tận dụng GPU doanh nghiệp thế hệ cũ để đạt hiệu năng suy luận LLM cục bộ ấn tượng mà không cần chi đắt đỏ cho phần cứng mới. Nó cũng làm nổi bật vai trò quyết định của việc tinh chỉnh phần mềm—như việc ưu tiên phân tách tensor hơn phân tách theo lớp trên các cặp GPU không đồng nhất—để tối đa hóa hiệu suất. Việc cấu hình llama.cpp sử dụng phân tách tensor và đặt GPU V100 32 GB làm GPU chính đã giúp tăng gần gấp đôi tốc độ tạo token (từ 22,88 lên 39,88 token/giây) so với phương pháp phân tách theo lớp truyền thống. Hệ thống cũng vận hành thành công mô hình Mixture of Experts (MoE) dạng GGUF với 177B tổng tham số (6B tham số kích hoạt) trên 48 GB VRAM với tốc độ khoảng 26 token/giây.
## KIẾN THỨC NỀN
Chạy các mô hình ngôn ngữ lớn cục bộ phụ thuộc nhiều vào các trình thực thi như llama.cpp và định dạng tệp GGUF, vốn lưu trữ các trọng số mô hình đã lượng hóa để suy luận hiệu quả trên CPU và GPU. Thuật toán FlashAttention giúp tối ưu hóa trao đổi dữ liệu bộ nhớ GPU trong quá trình tính toán attention, trong khi kiến trúc Mixture of Experts (MoE) giúp mô hình lớn hoạt động hiệu quả bằng cách định tuyến token đến các mạng con (experts) cụ thể thay vì kích hoạt toàn bộ tham số.