SenseNova Ra Mắt Bản Thử Nghiệm Của Mô Hình Đa Phương Thức U1.5-Lite
SenseNova đã phát hành bản thử nghiệm của mô hình U1.5-Lite (cụ thể là SenseNova-U1.5-8B-MoT-Preview), mang lại những cải tiến đáng kể về điểm hiệu năng trong việc chỉnh sửa ảnh và hiểu đa phương thức. Bản cập nhật này giới thiệu khả năng tạo ảnh 4K gốc, chỉnh sửa cục bộ và cải thiện khả năng hiển thị văn bản bằng cả tiếng Trung và tiếng Anh. Bản phát hành này thể hiện sự tiến bộ trong việc hợp nhất khả năng hiểu và tạo đa phương thức trong một kiến trúc duy nhất, cho phép thực hiện các quy trình phức tạp như chỉnh sửa lặp liên tục và kết hợp nhiều tham chiếu. Nó giải quyết các vấn đề phổ biến trong việc tạo ảnh, chẳng hạn như duy trì tính nhất quán của bố cục khi chỉnh sửa cục bộ và tuân thủ các câu lệnh cực kỳ chi tiết. Mặc dù mô hình hoạt động xuất sắc với các câu lệnh dài, có cấu trúc và chỉnh sửa cục bộ, đây vẫn là bản thử nghiệm với các hạn chế đã được thừa nhận về chi tiết khuôn mặt, hiển thị phông chữ nhỏ và tính nhất quán thẩm mỹ. Mã nguồn và trọng số của mô hình được lưu trữ trên GitHub và Hugging Face trong kho lưu trữ SenseNova-U1.
## KIẾN THỨC NỀN
SenseNova là một dòng mô hình AI nền tảng đa phương thức được phát triển bởi SenseTime, một công ty AI nổi tiếng được thành lập vào năm 2014. Nền tảng này sử dụng một kiến trúc thống nhất được thiết kế để thu hẹp khoảng cách giữa việc hiểu và tạo đa phương thức, thay vì phụ thuộc vào các mô-đun chuyển đổi (adapter) riêng biệt.