DeepGrove Ra Mắt Maple-Preview, Mô Hình MoE 20B Đạt Tốc Độ 127 Token/giây Trên iPhone
Phòng nghiên cứu AI độc lập DeepGrove của Mỹ đã phát hành Maple-Preview, một mô hình Hỗn hợp chuyên gia (MoE) với 20,2 tỷ tham số, có thể chạy cục bộ trên iPhone với tốc độ 127 token/giây. Tốc độ này nhanh gấp khoảng 13 lần so với mô hình Bonsai 27B vốn chỉ đạt 9,6 token/giây trên cùng nền tảng. Thành tựu này đánh dấu một cột mốc quan trọng cho AI chạy trên thiết bị (on-device AI), chứng minh rằng các mô hình quy mô lớn có thể hoạt động hiệu quả trên phần cứng di động. Bằng cách sử dụng trọng số tam phân (ternary weights) thay vì lượng tử hóa truyền thống, nó vượt qua được các nút thắt cổ chai về băng thông bộ nhớ mà không làm giảm nghiêm trọng hiệu suất mô hình. Mô hình này có cấu trúc gồm 24 lớp, 256 chuyên gia (với 8 chuyên gia hoạt động đồng thời) và sử dụng cơ chế chú ý hỗn hợp SWA-512:GA theo tỷ lệ 3:1. Thiết kế này giúp duy trì mức chiếm dụng bộ nhớ cực thấp, chỉ 7,69 GB ngay cả khi xử lý ngữ cảnh dài tới 131.000 token.
## KIẾN THỨC NỀN
Các mô hình trọng số tam phân (thường được gọi là LLM 1.58-bit) giới hạn các giá trị trọng số trong khoảng {-1, 0, 1}, thay thế các phép nhân tiêu tốn nhiều năng lượng bằng các phép cộng đơn giản để giảm đáng kể mức sử dụng bộ nhớ. Ngoài ra, các cơ chế chú ý hỗn hợp kết hợp giữa Chú ý Cửa sổ Trượt (SWA) cục bộ và Chú ý Toàn cục (GA) để xử lý các chuỗi ngữ cảnh dài một cách hiệu quả trong khi giảm thiểu sự phình to của KV-cache.