Trải nghiệm mô hình Qwen Image 2.1 cục bộ trên MacBook Pro chip M2
Một người dùng đã chạy thành công mô hình tạo ảnh Qwen Image 2.1 của Alibaba cục bộ trên MacBook Pro M2 với 32GB RAM bằng cách sử dụng backend MPS (Metal Performance Shaders) của PyTorch. Bằng cách cố định giá trị seed ngẫu nhiên, tác giả cho thấy các biến thể prompt vẫn chia sẻ cấu trúc không gian nền tảng đồng nhất qua nhiều phong cách nghệ thuật khác nhau. Thử nghiệm này minh họa tính khả thi thực tế và sự đánh đổi về hiệu năng khi chạy các mô hình tạo ảnh nguồn mở lớn cục bộ trên phần cứng Apple Silicon mà không cần GPU Nvidia chuyên dụng. Nó cũng cung cấp ví dụ mã nguồn thực tế để chuyển đổi các kịch bản Hugging Face Diffusers dựa trên CUDA sang chạy trên phần cứng Mac. Việc tạo một bức ảnh độ phân giải 1024x1024 mất 16 phút cho 40 bước suy luận (inference steps) trên backend MPS của Apple với độ chính xác `bfloat16`. Việc giảm số bước suy luận xuống 10 đã dẫn đến hiện tượng lỗi hiển thị và vỡ ảnh ở một số phong cách tạo hình.
## KIẾN THỨC NỀN
Qwen Image là dòng mô hình tạo ảnh nguồn mở được phát triển bởi đội ngũ Tongyi Qianwen của Alibaba. Trong học máy, không gian ẩn (latent space) biểu diễn các đặc trưng dữ liệu dạng số nén, nơi việc cố định seed giúp tạo ra đầu ra có tính xác định (deterministic) để giữ nguyên bố cục không gian ổn định ngay cả khi thay đổi prompt. Các thiết bị Apple Silicon sử dụng backend Metal Performance Shaders (MPS) của PyTorch thay vì CUDA của Nvidia để tăng tốc tính toán tensor trên GPU cục bộ.