Alibaba phát hành trọng số mở cho Qwen-Image-2.1-Turbo
Nhóm Qwen của Alibaba đã phát hành trọng số mở cho Qwen-Image-2.1-Turbo, một mô hình tạo và chỉnh sửa hình ảnh 7 tỷ tham số tốc độ cao. Mô hình này có khả năng tạo hình ảnh chất lượng 2K và chỉnh sửa theo ngôn ngữ tự nhiên chỉ trong 8 bước lấy mẫu. Bằng cách giảm số bước lấy mẫu xuống còn 8 mà không làm giảm chất lượng ảnh 2K, mô hình này giảm đáng kể độ trễ suy luận và chi phí tính toán cho AI nguồn mở. Điều này giúp việc tạo hình ảnh độ phân giải cao tương tác và chỉnh sửa ảnh phức tạp trở nên khả thi hơn nhiều trên các hệ thống cục bộ. Được xây dựng trên kiến trúc tạo hình ảnh 7B sử dụng các lớp Single-Stream DiT, mô hình này tích hợp trực tiếp vào thư viện Diffusers của Hugging Face thông qua `QwenImage21Pipeline`. Nó xử lý tự nhiên cả việc tạo ảnh từ văn bản lẫn chỉnh sửa tiếp nối, chẳng hạn như thay đổi bối cảnh hoặc thêm đối tượng thông qua câu lệnh.
## KIẾN THỨC NỀN
Các mô hình khuếch tán (diffusion models) theo truyền thống tạo hình ảnh bằng cách loại bỏ nhiễu dần dần qua hàng chục bước lấy mẫu, làm cho việc xuất ảnh độ phân giải cao tốn nhiều chi phí tính toán. Dòng Qwen-Image-2.1 là họ mô hình thị giác nguồn mở của Alibaba dựa trên kiến trúc Diffusion Transformer (DiT), hợp nhất khả năng tổng hợp ảnh từ văn bản và chỉnh sửa hình ảnh.