~/LOCAL AI/running-large-moe-llms-on-64gb-apple-silicon-macs-using-omlx

Chạy các mô hình MoE LLM lớn trên Mac Apple Silicon 64GB nhờ oMLX

Một người dùng Reddit đã thử nghiệm thành công việc chạy mô hình ngôn ngữ lớn Qwen Mixture-of-Experts (MoE) dung lượng 100GB trên máy Mac M3 Max 64GB RAM nhờ phiên bản oMLX mới nhất. Cấu hình này đạt tốc độ sinh văn bản 15,8 token/giây và xử lý prompt 140 token/giây với cửa sổ ngữ cảnh lên tới 130k token. Thành tựu này cho thấy các tối ưu hóa phần mềm như offload expert và dự đoán đa token có thể giúp chạy các mô hình AI lớn cấp doanh nghiệp ngay trên phần cứng cá nhân. Điều này giảm đáng kể rào cản bộ nhớ cho các nhà phát triển và cộng đồng AI cục bộ vốn trước đây phải phụ thuộc vào các hệ thống multi-GPU đắt đỏ. Cấu hình này đã cấp 58GB RAM cho bộ nhớ GPU bằng cách bật các tính năng của oMLX như offload 50% MoE expert resident, memory guard mức aggressive và Lightning Multi-Token Prediction (MTP). Phiên làm việc đạt hiệu suất cao với tỷ lệ trúng bộ đệm prompt 90,9% qua hơn 320.000 token prefill.

## KIẾN THỨC NỀN

oMLX là một inference server cục bộ dành riêng cho máy Mac Apple Silicon, phát triển dựa trên framework MLX của Apple nhằm tối ưu hóa việc chạy LLM nhờ kiến trúc bộ nhớ hợp nhất (unified memory). Các mô hình Mixture-of-Experts (MoE) sử dụng các mạng con được kích hoạt thưa (gọi là expert), cho phép công cụ tự động đẩy (offload) các expert không hoạt động ra RAM hoặc ổ đĩa để chạy mô hình khổng lồ trên phần cứng giới hạn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Local AI#Apple Silicon#LLM Inference#MLX#MoE

$ subscribe --daily

Chạy các mô hình MoE LLM lớn trên Mac Apple Silicon 64GB nhờ oMLX | Daily News