~/LLM PRE TRAI/pre-training-a-1-02b-mini-kimi-k3-replica-from-scratch-for

Tiền huấn luyện bản sao mini Kimi-K3 1,02 tỷ tham số từ đầu với dưới 250 USD

Một nhà phát triển đã tiền huấn luyện thành công bản sao mini của kiến trúc Kimi-K3 với 1,02 tỷ tham số từ đầu trên 5 tỷ token với chi phí dưới 250 USD. Mô hình này tái tạo các kiến trúc cốt lõi của Kimi-K3 như Kimi Delta Attention và LatentMoE, đồng thời vượt qua GPT-2 (124M) trên bài đánh giá HellaSwag. Dự án này chứng minh rằng các nhà phát triển cá nhân có thể tiền huấn luyện các kiến trúc LLM hiện đại, quy mô tương đối lớn với ngân sách cực kỳ hạn chế. Điều này giúp giảm rào cản gia nhập trong việc thử nghiệm các thành phần kiến trúc tiên tiến như Mixture of Experts (MoE) và cơ chế chú ý tuyến tính (linear attention). Mô hình có 145 triệu tham số kích hoạt trên mỗi token, sử dụng Kimi Delta Attention, Gated MLA và LatentMoE với bộ cân bằng không cần tổn thất phụ trợ (aux-loss-free balancer). Mô hình đạt điểm số 33,4% trên HellaSwag so với mức 28% của GPT-2, sử dụng bộ phân tách từ (tokenizer) 163.840 token gốc của Kimi-K3.

## KIẾN THỨC NỀN

Kimi-K3 là một kiến trúc mô hình ngôn ngữ tiên tiến tích hợp các kỹ thuật tối ưu hóa hiệu năng hiệu quả. Trong số đó có Kimi Delta Attention (KDA), giúp tối ưu hóa cơ chế chú ý tuyến tính với cổng kiểm soát chi tiết để giảm dung lượng KV cache, và LatentMoE, giúp chiếu các phép toán định tuyến và chuyên gia (expert) vào không gian ẩn chiều thấp hơn để tiết kiệm tính toán và bộ nhớ. Multi-head Latent Attention (MLA) cũng là một kỹ thuật quan trọng khác được thiết kế để nén KV cache trong quá trình suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM Pre-training#Mixture of Experts (MoE)#Machine Learning#Open Source AI

$ subscribe --daily

Tiền huấn luyện bản sao mini Kimi-K3 1,02 tỷ tham số từ đầu với dưới 250 USD | Daily News