Nhà phát triển tự xây dựng LLM 250 triệu tham số chạy trên CPU chỉ với 60MB
Một nhà phát triển đã tự huấn luyện mô hình LLM 250 triệu tham số (SHADOW-250M) từ đầu trên 30 tỷ token của tập dữ liệu FineWeb. Mô hình này được lượng tử hóa xuống dưới 2-bit, cho phép chạy với tốc độ 400 token/giây trên CPU máy tính xách tay thông thường với dung lượng triển khai chỉ 60 MB. Dự án này chứng minh tính khả thi của việc chạy các LLM siêu nén, dung lượng nhẹ trên phần cứng CPU phổ thông mà không cần phụ thuộc vào các framework nặng hay GPU. Nó cũng giới thiệu cơ chế truy xuất ngữ cảnh dài sáng tạo (lên tới 100 triệu token) bằng cách lưu trữ tạm thời trên ổ đĩa, mở ra hướng đi mới cho các ứng dụng AI chạy trực tiếp trên thiết bị đầu cuối (edge AI). Mô hình sử dụng một biểu diễn từ vựng độc đáo, trong đó mỗi token là một mã 512-bit cố định thay vì bảng nhúng (embedding table) truyền thống, giúp loại bỏ các tham số nhúng cần huấn luyện. Đối với ngữ cảnh dài, 2.048 token gần nhất được giữ trong bộ nhớ đệm KV cache định dạng FP16 tiêu chuẩn, trong khi lịch sử cũ hơn được nén xuống 1-bit và ghi vào ổ đĩa.
## KIẾN THỨC NỀN
Lượng tử hóa (quantization) là kỹ thuật nén mạng thần kinh bằng cách giảm độ chính xác của các trọng số, trong đó lượng tử hóa dưới 2-bit là một dạng nén cực hạn thường làm giảm độ chính xác của mô hình. Bộ nhớ đệm Key-Value (KV cache) thường được dùng trong LLM để lưu trữ các vector attention đã tính toán trước đó nhằm tăng tốc độ tạo văn bản, nhưng lại tiêu tốn nhiều bộ nhớ khi xử lý chuỗi dài. FineWeb là tập dữ liệu tiếng Anh chất lượng cao, quy mô web do Hugging Face tuyển chọn để tiền huấn luyện các mô hình ngôn ngữ lớn.