~/LLM INFERENC/llamampere-v0-4-achieves-95-tps-for-27b-llm-on-single-rtx

LlamAmpere v0.4 Đạt Trên 95 TPS Cho LLM 27B Trên Một Card RTX 3090 Duy Nhất

Nhà phát triển JakeATX đã phát hành LlamAmpere v0.4, một bản fork tối ưu hóa cho kiến trúc Ampere của llama.cpp, đạt tốc độ trên 95 token/giây trong suốt quá trình tạo 100.000 token cho mô hình 27B trên một GPU RTX 3090 đơn lẻ. Bản cập nhật mang lại tốc độ tăng ~10% và mở rộng chiều dài ngữ cảnh thêm hơn 10% so với phiên bản trước, hỗ trợ cửa sổ ngữ cảnh lên tới 262K token. Dự án này cho thấy cách các tối ưu hóa kernel CUDA dành riêng cho kiến trúc phần cứng kết hợp với định lượng bộ nhớ đệm KV có thể giúp phần cứng tiêu dùng chạy các mô hình nhiều tham số ở độ dài ngữ cảnh cực lớn. Điều này cho phép người dùng AI cục bộ đạt được tốc độ suy luận tương đương hoặc vượt qua các framework máy chủ như vLLM mà không cần đến GPU trung tâm dữ liệu đắt tiền. Thử nghiệm được thực hiện bằng bản định lượng IQ4_XS-M 4.6 bits-per-weight của Qwen 27B cùng với định lượng bộ nhớ đệm KV TurboQuant (TQ5/TQ4) ở mức nhiệt độ (temperature) bằng 1 nhằm phản ánh tốc độ sinh văn bản thực tế. Tác giả lưu ý rằng định lượng KV TurboQuant tạo ra mức phân kỳ Kullback–Leibler nhỏ hơn một phần ba so với khi chuyển trọng số từ 8-bit xuống 4.6-bit, và không làm giảm độ chính xác có ý nghĩa thống kê ở cấp độ nhiệm vụ.

## KIẾN THỨC NỀN

Llama.cpp là một thư viện suy luận nguồn mở C/C++ phổ biến được tối ưu hóa để chạy các Mô hình Ngôn ngữ Lớn cục bộ trên phần cứng tiêu dùng bằng định dạng định lượng GGUF. Việc chạy các mô hình 27 tỷ tham số với cửa sổ ngữ cảnh lên tới 262K token thường đòi hỏi dung lượng VRAM rất lớn; các kỹ thuật tiết kiệm bộ nhớ như định lượng bộ nhớ đệm KV và tối ưu hóa cho kiến trúc Ampere đã giúp khả thi hóa việc chạy ngữ cảnh siêu dài trên các GPU 24GB như NVIDIA RTX 3090.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Inference#llama.cpp#GPU Optimization#Local AI#CUDA

$ subscribe --daily

LlamAmpere v0.4 Đạt Trên 95 TPS Cho LLM 27B Trên Một Card RTX 3090 Duy Nhất | Daily News