SenseTime nguồn mở SenseNova U1.5-Lite-Preview hỗ trợ tạo ảnh 4K nguyên bản
SenseTime đã mở nguồn mở SenseNova U1.5-Lite-Preview, một mô hình đa phương thức dung lượng nhẹ với 8 tỷ tham số (8B) hỗ trợ tạo hình ảnh 4K nguyên bản. Phiên bản thử nghiệm này sử dụng kiến trúc Mixture of Transformers (MoT) và vượt trội hơn phiên bản tiền nhiệm U1 trên nhiều tiêu chuẩn đánh giá chỉnh sửa và tạo ảnh. Bằng cách đạt được khả năng tạo và chỉnh sửa hình ảnh tương đương với các mô hình thương mại mã nguồn đóng ở quy mô gọn nhẹ, bản phát hành này giúp hạ thấp rào cản đối với việc tổng hợp hình ảnh độ phân giải cao. Nó cung cấp cho các nhà phát triển và nghiên cứu một giải pháp thay thế mã nguồn mở mạnh mẽ cho các tác vụ đa phương thức nâng cao. Mô hình này cải thiện kết cấu chi tiết mịn, hiển thị văn bản tiếng Anh và tiếng Trung chính xác hơn trong hình ảnh, đồng thời thể hiện khả năng tuân thủ hướng dẫn thị giác tốt hơn. Hiện tại, mô hình đã được đăng tải trên GitHub, Hugging Face và ModelScope để cộng đồng truy cập.
## KIẾN THỨC NỀN
SenseNova là dòng mô hình nền tảng quy mô lớn của SenseTime được thiết kế cho việc tích hợp đa phương thức và các tác vụ AI hiệu năng cao. Kiến trúc Mixture of Transformers (MoT) là một thiết kế học máy thưa (sparse) giúp định tuyến các đầu vào đa phương thức thông qua các tham số đặc trưng cho từng phương thức, tối ưu hóa hiệu quả tính toán cho các mô hình lớn.