Người Dùng LocalLLaMA So Sánh Các Biến Thể Mô Hình Qwen Trên MLX Của Apple Silicon
Một thành viên trong cộng đồng LocalLLaMA đã chia sẻ trải nghiệm hiệu năng khi chạy Qwen 27B và Qwen Flash Next trên Apple Silicon (M3 Max 96GB) bằng framework MLX, ghi nhận tốc độ xử lý đầu vào (prefill) của phiên bản 27B nhanh hơn. Bài viết cũng gợi mở thảo luận về việc tối ưu hóa hiệu suất prefill trên MLX và xây dựng kiến trúc đa tác tử (multi-agent) tắt tính năng suy luận đối với các tác tử phụ để giảm độ trễ. Khi việc triển khai AI cục bộ trên phần cứng Apple phát triển, việc tối ưu hóa độ trễ giai đoạn prefill và hoàn thiện thiết kế đa tác tử đóng vai trò quan trọng đối với các nhà phát triển. Việc kết hợp tác tử điều phối có khả năng suy luận chuyên sâu với các tác tử phụ được tối giản hóa giúp tạo ra các quy trình xử lý LLM cục bộ nhanh chóng và hiệu quả hơn. Câu hỏi tập trung vào giai đoạn prefill, nơi LLM xử lý toàn bộ câu lệnh đầu vào để khởi tạo bộ nhớ đệm KV trước khi sinh ra token đầu tiên. Tác giả bài viết cũng dẫn chứng cấu hình mô hình Qwen tắt tính năng suy luận từ JetBrains để đề xuất mô hình phân cấp, trong đó chỉ tác tử điều phối chính mới cần dùng đến khả năng suy luận sâu.
## KIẾN THỨC NỀN
MLX là một framework học máy mã nguồn mở của Apple được thiết kế để tối ưu hóa việc suy luận và huấn luyện mô hình trên chip Apple Silicon. Trong quá trình suy luận LLM, công việc được chia thành giai đoạn prefill tính toán song song câu lệnh đầu vào (quyết định thời gian tạo token đầu tiên) và giai đoạn decode tự hồi quy để sinh từng từ tiếp theo.