~/MULTIMODAL A/sensetime-open-sources-sensenova-u1-5-lite-multimodal-model-with-native-4k

SenseTime mở nguồn mở mô hình đa phương thức SenseNova U1.5 Lite hỗ trợ xuất ảnh 4K

SenseTime đã mở nguồn mở SenseNova U1.5 Lite, một mô hình đa phương thức dung lượng nhẹ với 8 tỷ tham số, hỗ trợ xuất ảnh 4K nguyên bản và chỉnh sửa hình ảnh nâng cao. Mô hình này tích hợp khả năng hiểu thị giác, suy luận, tạo và chỉnh sửa hình ảnh trong một kiến trúc thống nhất. Bằng cách mang lại khả năng xuất ảnh 4K nguyên bản và kiểm soát bố cục phức tạp vào một mô hình nguồn mở 8 tỷ tham số, SenseTime giúp giảm rào cản cho các nhà phát triển trong việc triển khai các tác vụ tạo hình ảnh chất lượng cao tại địa phương. Đây là một bước tiến thực tế trong bối cảnh AI đa phương thức nguồn mở đang cạnh tranh gay gắt. Mô hình hỗ trợ độ dài ngữ cảnh 3-4k nguyên bản và có tính năng kết xuất văn bản nâng cao, bảo toàn cấu trúc không gian và chỉnh sửa vùng chính xác bằng cách sử dụng hộp giới hạn (bounding box) hoặc dấu hiệu thị giác (visual marker). Người dùng có thể tải mô hình này trên GitHub, Hugging Face và ModelScope.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn đa phương thức (MLLM) có khả năng xử lý và tạo ra nhiều loại dữ liệu khác nhau, chẳng hạn như văn bản và hình ảnh, cùng một lúc. Mặc dù việc tạo ra hình ảnh độ phân giải cao với bố cục văn bản chính xác trước đây thường yêu cầu các mô hình thương mại nguồn đóng khổng lồ, các nghiên cứu gần đây đang tập trung vào việc tối ưu hóa các mô hình nguồn mở nhỏ hơn cho các tác vụ này. Dòng mô hình SenseNova của SenseTime được thiết kế để giải quyết những thách thức đó bằng cách thống nhất khả năng hiểu và tạo thị giác.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#Open Source#SenseTime#Computer Vision

$ subscribe --daily