~/LOCAL LLMS/gemma-4-26b-model-run-on-iphone-17-pro-via-model-paging

Chạy mô hình Gemma 4 26B trên iPhone 17 Pro thông qua phân trang mô hình

Một nhà phát triển đã trình diễn việc chạy phiên bản lượng tử hóa Q4_K_M của mô hình Gemma 4 26B A4B (26 tỷ tham số) trên iPhone 17 Pro bằng hệ thống Noema Overfit. Thiết lập này đạt được khả năng thực thi cục bộ bằng cách phân trang các trọng số Mixture of Experts (MoE) từ ổ SSD của thiết bị vào RAM. Bản trình diễn này chỉ ra một hướng đi khả thi để chạy các mô hình ngôn ngữ lớn (LLM) quy mô lớn trên phần cứng di động bị giới hạn tài nguyên mà không cần dung lượng RAM khổng lồ. Mặc dù tốc độ giải mã 3,5 token/giây là khá chậm, nó làm nổi bật sự đánh đổi khi độ chính xác và khả năng thực thi cục bộ được ưu tiên hơn tốc độ tạo văn bản. Hệ thống giữ các trọng số không phải chuyên gia (non-expert) trong RAM trong khi đọc động các trọng số chuyên gia (expert) từ SSD, mang lại tốc độ prefill là 34,4 token/giây nhưng tốc độ giải mã chậm chỉ 3,5 token/giây. Kỹ thuật này cũng được ghi nhận là hữu ích cho các dòng MacBook có dung lượng RAM thấp.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc LLM sử dụng mạng định tuyến để chuyển hướng đầu vào đến các mạng con "chuyên gia" (expert) cụ thể, cho phép tăng dung lượng mô hình mà không cần kích hoạt tất cả các tham số cùng một lúc. Phân trang mô hình (model paging) hoặc đẩy bớt dữ liệu (offloading) tận dụng các kỹ thuật bộ nhớ ảo để chỉ tải các phần đang hoạt động của mô hình (như các chuyên gia MoE đang hoạt động) từ ổ lưu trữ (SSD) vào RAM khi cần thiết, vượt qua các giới hạn RAM vật lý.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local LLMs#Mobile AI#Model Paging#Mixture of Experts#iOS Development

$ subscribe --daily

Chạy mô hình Gemma 4 26B trên iPhone 17 Pro thông qua phân trang mô hình | Daily News