Xuất hiện kết quả benchmark LLM chưa xác minh của chip Apple M5 Ultra trên oMLX
Một bài đăng trên Reddit đã thu hút sự chú ý đến các kết quả benchmark suy luận LLM chưa được xác minh xuất hiện trên trang web oMLX cho dòng chip chưa ra mắt Apple M5 Ultra. Khi chạy mô hình 27B định dạng lượng tử hóa 4-bit (Qwen 3.8 27B q4) ở ngẫu cảnh 8k mà không dùng kỹ thuật dự đoán đa token (MTP), thông số ghi nhận tốc độ tạo token đạt 50 token/giây và tốc độ xử lý đầu vào (prompt processing) đạt 1.800 token/giây. Dù chưa được xác minh, các con số này cung cấp cái nhìn sớm mang tính dự đoán về hiệu năng AI cục bộ của phần cứng Apple Silicon cao cấp trong tương lai. Nếu chính xác, tốc độ xử lý đầu vào và tạo văn bản cao đối với mô hình 27B cho thấy kiến trúc bộ nhớ hợp nhất có thể tiếp tục tối ưu hóa việc chạy các LLM cục bộ nặng trên máy Mac. Benchmark được báo cáo nêu nổi bật tốc độ xử lý prompt đạt 1.800 token/giây và tốc độ tạo token đạt 50 token/giây mà không cần nhờ đến kỹ thuật Dự đoán Đa Token (MTP). Tuy nhiên, vì Apple chưa từng chính thức công bố hay cung cấp chi tiết về chip M5 Ultra, các con số này hiện thiếu sự kiểm chứng kỹ thuật và phải được xem là tuyên bố dự đoán từ bên thứ ba.
## KIẾN THỨC NỀN
oMLX là một công cụ suy luận LLM chuyên biệt được thiết kế cho Apple Silicon giúp tối ưu hóa việc chạy mô hình cục bộ và quản lý bộ nhớ đệm KV cache. Các bộ xử lý dòng Ultra cao cấp của Apple thường ghép hai chip dòng Max bằng kết nối UltraFusion băng thông cao, mang lại băng thông bộ nhớ hợp nhất khổng lồ rất phù hợp cho các tác vụ LLM phụ thuộc vào bộ nhớ. Xử lý prompt (pp) đo tốc độ công cụ nạp các token đầu vào, trong khi tốc độ tạo token (th) theo dõi tốc độ tạo ra các token mới theo tuần tự.