~/LLM INFRASTR/optimizing-moonshot-ai-s-2-8t-kimi-k3-model-on-a-16x

Tối ưu hóa mô hình Kimi K3 2,8T của Moonshot AI trên cụm 16x GB10

Nhà phát triển /u/ciprianveg đã thử nghiệm và vận hành thành công mô hình Kimi K3 2,8 nghìn tỷ tham số của Moonshot AI trên cụm 16 nút GB10. Cấu hình tinh chỉnh này đạt tốc độ giải mã lập trình duy trì ở mức 30 token/giây và tốc độ prefill từ 750 đến 910 token/giây. Việc triển khai một mô hình 2,8 nghìn tỷ tham số thường gặp điểm nghẽn lớn về mạng và runtime. Việc chứng minh khả năng đạt hiệu suất cao và xử lý đa người dùng đồng thời trên phần cứng riêng cho thấy các bản vá vLLM tùy chỉnh cùng tinh chỉnh kernel có thể đưa các mô hình mở siêu lớn vào ứng dụng thực tế. Cấu hình hạ tầng sử dụng hệ thống chuyển mạch kép MikroTik với cáp chuyển đổi 4x 400G sang 4x100G được tối ưu hóa cho cấu trúc mạng NCCL. Về phần mềm, hệ thống dựa trên stack `gb10-vllm` được tinh chỉnh cùng các kernel MLA (Multi-Head Latent Attention) và KV cache tùy biến nhằm xử lý các luồng công việc có ngữ cảnh dài mà không bị cạn kệt bộ nhớ.

## KIẾN THỨC NỀN

Kimi K3 là mô hình ngôn ngữ lớn kiến trúc Mixture-of-Experts (MoE) sở hữu 2,8 nghìn tỷ tham số với trọng số mở do Moonshot AI phát triển. Việc tinh chỉnh cấu trúc NVIDIA Collective Communications Library (NCCL) đóng vai trò then chốt khi mở rộng quy mô cụm đa GPU và đa nút nhằm duy trì tốc độ truyền dữ liệu nhanh giữa các nút trong quá trình suy luận LLM.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Infrastructure#Model Inference#Distributed Systems#AI Hardware#LocalLLaMA

$ subscribe --daily