Maple-Preview: Mô hình LLM suy luận mã nguồn mở 20B-A1B sử dụng trọng số tam phân
Maple-Preview đã được phát hành dưới dạng mô hình ngôn ngữ lớn (LLM) mã nguồn mở 20 tỷ tham số (20B), sử dụng trọng số tam phân (ternary weights) để tối ưu hóa hiệu suất suy luận. Mô hình này áp dụng kiến trúc "A1B", cho thấy nó chỉ kích hoạt 1 tỷ tham số trong mỗi lượt xử lý. Bản phát hành này đại diện cho một triển khai thực tế của kỹ thuật lượng tử hóa cực hạn kiểu 1.58-bit ở quy mô 20 tỷ tham số, giúp việc triển khai cục bộ các LLM suy luận tiết kiệm phần cứng hơn đáng kể. Nó chứng minh cách trọng số tam phân có thể giảm yêu cầu về bộ nhớ và tính toán mà không làm mất đi khả năng suy luận phức tạp. Mô hình kết hợp tổng số lượng tham số lớn lên tới 20B với số lượng tham số hoạt động cực kỳ hiệu quả là 1B (A1B) cho mỗi lượt xử lý. Bằng cách sử dụng trọng số tam phân với các giá trị bị giới hạn ở -1, 0 và 1, nó giảm đáng kể yêu cầu về băng thông bộ nhớ trong quá trình suy luận.
## KIẾN THỨC NỀN
Các LLM tam phân (ternary LLMs), thường được gọi là LLM 1.58-bit, giới hạn các giá trị trọng số trong khoảng {-1, 0, 1}, thay thế các phép toán nhân tốn tài nguyên bằng các phép cộng và trừ đơn giản hơn. Ký hiệu "A1B" liên quan đến kiến trúc hỗn hợp chuyên gia (Mixture-of-Experts - MoE), nơi chỉ một phần nhỏ trong tổng số tham số (trong trường hợp này là 1 tỷ tham số hoạt động) được tính toán cho mỗi token, giúp tối ưu hóa hơn nữa tốc độ thực thi và sử dụng tài nguyên.