Nhà phát triển ra mắt llamAmpere, bản fork llama.cpp tối ưu cho GPU Ampere
Một nhà phát triển đã ra mắt llamAmpere, bản fork của llama.cpp được tối ưu hóa cho các GPU kiến trúc NVIDIA Ampere như RTX 3090. Dự án đạt tốc độ suy luận vượt quá 90 token mỗi giây ở độ dài ngữ cảnh lên tới 100K token trên phần cứng tiêu dùng. Suy luận LLM với ngữ cảnh dài trên GPU tiêu dùng thường gặp phải điểm nghẽn nghiêm trọng về bộ nhớ và tốc độ khi ngữ cảnh tăng lên. Bằng cách tùy chỉnh các tối ưu hóa CUDA cấp thấp cho dòng card Ampere, llamAmpere cho phép chạy cục bộ các mô hình 27B với tốc độ nhanh hơn cả API thương mại mà không cần GPU cấp doanh nghiệp. Bản fork này hỗ trợ độ dài ngữ cảnh lên tới 240K token và mang lại tốc độ tăng tới 80% so với các bản cài đặt tiêu chuẩn ở mức ngữ cảnh 200K. Tác giả khuyên nên kết hợp dự án với các định dạng định lượng GGUF tùy chỉnh như IQ4_XS để tối đa hóa tốc độ xuất token trong khi vẫn vừa vặn với giới hạn VRAM.
## KIẾN THỨC NỀN
llama.cpp là một công cụ suy luận mã nguồn mở phổ biến bằng C/C++ được thiết kế để thực thi các mô hình ngôn ngữ lớn một cách hiệu quả trên phần cứng cục bộ bằng các tệp GGUF đã định lượng. Kiến trúc Ampere của NVIDIA là nền tảng cho các card đồ họa tiêu dùng như dòng RTX 30 (bao gồm RTX 3090), vốn có các Tensor Core chuyên dụng cho các tác vụ AI. Các định dạng định lượng GGUF như IQ4_XS giúp nén trọng số mô hình xuống độ chính xác bit thấp hơn để vừa với dung lượng VRAM giới hạn của GPU.