SupraLabs Ra Mắt Supra2-IMG, Mô Hình Tạo Ảnh Từ Văn Bản 100M Tham Số Siêu Nhỏ
SupraLabs đã phát hành Supra2-IMG, một mô hình Diffusion Transformer (DiT) mã nguồn mở với 100 triệu tham số có khả năng tạo ảnh độ phân giải 256x256. Mô hình được huấn luyện hoàn toàn từ đầu trong chưa đầy 10 giờ chỉ với một GPU NVIDIA H100 duy nhất. Đợt phát hành này thể hiện hiệu suất tính toán đáng kinh ngạc cho việc tạo ảnh từ văn bản, chứng minh rằng các kiến trúc DiT nhỏ gọn có thể tạo ra mẫu ảnh nhất quán với chi phí huấn luyện tối thiểu. Nó cho phép các nhà phát triển chạy suy luận tạo ảnh cục bộ nhanh chóng ngay trên phần cứng cá nhân, bao gồm cả CPU không có GPU chuyên dụng. Supra2-IMG tạo ảnh cục bộ trong khoảng 2 giây trên GPU và khoảng 20 giây trên CPU với 50 bước lấy mẫu (sampling steps). Tuy nhiên, hạn chế chính cho các ứng dụng thực tế là độ phân giải đầu ra bị giới hạn ở mức 256x256 pixel.
## KIẾN THỨC NỀN
Các mô hình Diffusion Transformer (DiT) thay thế mạng U-Net truyền thống trong mô hình khuếch tán bằng kiến trúc transformer có khả năng mở rộng tốt hơn. Các mô hình khuếch tán sinh hình ảnh thường dựa vào kỹ thuật Classifier-Free Guidance (CFG) trong quá trình suy luận để điều chỉnh mức độ bám sát của hình ảnh tổng hợp so with câu lệnh văn bản đầu vào.