POCKET-35B: Chạy mô hình 35 tỷ tham số trên CPU thông thường và thiết bị di động
Dòng mô hình POCKET-35B đã được phát hành, cung cấp các cấu hình lượng tử hóa cực cao của một mô hình 35 tỷ tham số được tối ưu hóa để chạy trên CPU thông thường và thiết bị di động. Sử dụng llama.cpp gốc và khung phát triển MLX của Apple, các mô hình này hoạt động mà không cần GPU hoặc kết nối đám mây. Bản phát hành này chứng minh rằng các mô hình lớn 35B có thể được triển khai cục bộ trên phần cứng thông dụng hàng ngày, bao gồm điện thoại thông minh và máy tính mini, nhờ sử dụng lượng tử hóa cực cao. Điều này giúp giảm rào cản tiếp cận để chạy các mô hình tác tử (agentic model) mạnh mẽ một cách riêng tư mà không cần hạ tầng GPU đắt đỏ. Các mô hình được lượng tử hóa xuống còn 1-2 bit (như IQ1_M và IQ2_M) để vừa với dung lượng bộ nhớ chỉ từ 5,1 GB, cho phép chạy trên các thiết bị có RAM 8 GB. Mặc dù điều này giúp đạt tốc độ thực thi cao (lên tới 59 t/s theo báo cáo), việc lượng tử hóa quá sâu có thể ảnh hưởng đến độ hỗn loạn (perplexity) và chất lượng đầu ra.
## KIẾN THỨC NỀN
Lượng tử hóa (quantization) là kỹ thuật giảm độ chính xác của các trọng số mô hình (ví dụ: từ số thực dấu phẩy động 16-bit xuống số nguyên 1-bit hoặc 2-bit) để giảm dung lượng bộ nhớ và tăng tốc độ suy luận. Các định dạng như GGUF, được sử dụng bởi khung llama.cpp, cho phép suy luận cục bộ hiệu quả trên CPU, trong khi khung MLX của Apple tối ưu hóa các mô hình học máy dành riêng cho kiến trúc bộ nhớ thống nhất của Apple Silicon.