Chạy cục bộ mô hình Kimi-k3 2,8 nghìn tỷ tham số qua llama.cpp
Một người dùng đã chạy thành công mô hình Kimi-k3 khổng lồ với 2,8 nghìn tỷ tham số trên một máy trạm cấu hình cao bằng cách sử dụng một pull request đang chờ xử lý của llama.cpp (PR #26185) để chuyển đổi và chạy mô hình ở định dạng GGUF. Tuy nhiên, tốc độ tạo văn bản cực kỳ chậm, chỉ đạt trung bình 0,23 token mỗi giây. Thành tựu này chứng minh tính khả thi của việc chạy cục bộ các mô hình Mixture of Experts (MoE) hàng đầu, cung cấp các điểm chuẩn hiệu năng phần cứng và cấu hình cơ sở có giá trị cho cộng đồng AI mã nguồn mở. Nó làm nổi bật khả năng ngày càng tăng của phần cứng máy trạm trong việc xử lý các mô hình vốn trước đây yêu cầu cơ sở hạ tầng đám mây khổng lồ. Cấu hình thử nghiệm sử dụng CPU Threadripper PRO 9965WX, 512 GB RAM DDR5 và hai GPU RTX 6000, với mô hình được phân chia giữa bộ nhớ CPU và GPU. Để cải thiện hiệu năng trong tương lai, người dùng có kế hoạch phân phối khối lượng công việc trên một cụm máy chủ bằng cách sử dụng tính năng RPC server của llama.cpp qua mạng tốc độ cao.
## KIẾN THỨC NỀN
Kimi-k3 là một mô hình ngôn ngữ lớn hàng đầu với 2,8 nghìn tỷ tham số và kiến trúc Mixture of Experts (MoE), giúp định tuyến động các tác vụ đến các mạng con chuyên biệt. llama.cpp là một dự án mã nguồn mở được thiết kế để suy luận LLM hiệu quả trên phần cứng cục bộ, và tính năng RPC server của nó cho phép nhiều máy tính gộp tài nguyên phần cứng để thực hiện suy luận phân tán.