~/LLM/running-the-2-8t-parameter-kimi-k3-model-on-a-macbook-pro

Chạy mô hình Kimi K3 2,8T tham số trên MacBook Pro bằng cách truyền dữ liệu từ SSD

Dự án mã nguồn mở Deltafin cho phép chạy mô hình siêu lớn Kimi K3 (2,8 nghìn tỷ tham số) của Moonshot AI trên một chiếc MacBook Pro cá nhân bằng cách truyền trọng số mô hình trực tiếp từ ổ cứng SSD. Kỹ thuật này giúp một chiếc laptop với bộ nhớ RAM khiêm tốn có thể thực thi một mô hình AI vượt xa dung lượng bộ nhớ vật lý của máy. Phát triển này chứng minh rằng các mô hình hàng nghìn tỷ tham số có thể chạy cục bộ trên phần cứng cá nhân mà không cần phụ thuộc vào các cụm máy chủ nhiều GPU đắt đỏ. Điều này cho thấy các kiến trúc truyền dữ liệu bộ nhớ mới có thể mở ra khả năng thực thi riêng tư, ngoại tuyến các mô hình AI tiên tiến nhất trên thiết bị người dùng. Deltafin tận dụng cơ chế điều hướng động của kiến trúc Mixture-of-Experts (MoE) bằng cách nạp động chỉ các trọng số chuyên gia (experts) cần thiết từ ổ đĩa vào RAM cho từng token. Mặc dù tốc độ thực thi bị giới hạn nghiêm trọng bởi băng thông đọc của ổ NVMe (từ 1 token/giây đến 1 token/phút tùy vào mảng ổ đĩa), quy trình vẫn đảm bảo kết quả đầu ra chính xác và có tính tái lập hoàn toàn.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn thường yêu cầu VRAM băng thông cao để lưu toàn bộ trọng số cho quá trình suy luận thời gian thực, khiến các mô hình hàng nghìn tỷ tham số bị giới hạn trong các cụm máy chủ doanh nghiệp. Mô hình Mixture-of-Experts (MoE) như Kimi K3 chia nhỏ dung lượng mô hình thành các mạng con chuyên biệt và chỉ kích hoạt một phần nhỏ tham số cho mỗi token, tạo điều kiện cho việc nạp các chuyên gia không hoạt động trực tiếp từ SSD khi cần.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Local AI#Hardware Hacks#System Architecture#Open Source

$ subscribe --daily

Chạy mô hình Kimi K3 2,8T tham số trên MacBook Pro bằng cách truyền dữ liệu từ SSD | Daily News