Thử nghiệm Kimi K3 đầu tiên trên máy chủ gia đình đạt tốc độ 4 token/giây
Một người dùng đã chạy thành công phiên bản lượng tử hóa Q2_K của mô hình Kimi K3 khổng lồ với 2,8 nghìn tỷ tham số trên hệ thống máy chủ gia đình, đạt tốc độ giải mã khoảng 4 token/giây. Cấu hình này sử dụng một nhánh fork tùy chỉnh của llama.cpp, kết hợp với 768GB RAM DDR5 và hai card đồ họa Nvidia RTX 5090. Thử nghiệm này chứng minh tính khả thi của việc chạy một mô hình mở phân khúc 3T trên phần cứng tiêu dùng cao cấp, đưa khả năng AI tiên tiến đến gần hơn với việc triển khai cục bộ. Nó cung cấp dữ liệu hiệu năng thực nghiệm giá trị cho cộng đồng LLM cục bộ đang thử nghiệm các mô hình siêu lớn. Người dùng báo cáo tốc độ nạp tiền đề (prefill) đạt 50-70 token/giây và lưu ý rằng tốc độ giải mã tăng dần theo thời gian, gợi ý về hiệu ứng khởi động (warmup) hoặc tráo đổi bộ nhớ. Tuy nhiên, công cụ đo hiệu năng tiêu chuẩn llama-bench đã bị lỗi trong quá trình thử nghiệm.
## KIẾN THỨC NỀN
Kimi K3 là một mô hình ngôn ngữ lớn nguồn mở với 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, được thiết kế cho các tác vụ lập trình và suy luận phức tạp. Để chạy một mô hình khổng lồ như vậy trên phần cứng tiêu dùng, người dùng phải dựa vào các kỹ thuật lượng tử hóa như Q2_K, giúp nén trọng số mô hình để tiết kiệm bộ nhớ nhưng phải đánh đổi một phần độ chính xác.