~/MULTIMODAL A/minimax-h3-omni-modal-generative-model-released-on-hugging-face

Mô hình tạo sinh đa phương thức MiniMax-H3 phát hành trên Hugging Face

MiniMax đã phát hành MiniMax-H3, một mô hình tạo sinh đa phương thức (omni-modal) đa dụng, dưới dạng mở khóa trọng số (open-weights) trên Hugging Face. Mô hình này hỗ trợ hiểu đồng nhất các ngữ cảnh văn bản, hình ảnh, video, âm thanh và có thể tạo video độ phân giải 2K đi kèm âm thanh nổi (stereo) bản xứ. Việc phát hành này cung cấp cho cộng đồng mã nguồn mở một mô hình mạnh mẽ có khả năng tạo video và âm thanh đồng bộ chỉ trong một lượt xử lý duy nhất. Điều này giúp giảm bớt sự phụ thuộc vào các công cụ tạo âm thanh riêng biệt và thúc đẩy sự phát triển của các hệ thống AI đa phương thức thống nhất. MiniMax-H3 có thể tạo các video dài tối đa 15 giây ở độ phân giải 2K, với lời thoại và hiệu ứng âm thanh được đồng bộ chính xác theo các hành động trên màn hình. Thiết kế hướng tới khả năng khái quát hóa tác vụ giúp mô hình tuân thủ các chỉ dẫn đa phương thức phức tạp ngay từ giai đoạn tiền huấn luyện.

## KIẾN THỨC NỀN

MiniMax là một công ty trí tuệ nhân tạo có trụ sở tại Thượng Hải, Trung Quốc, được công nhận là một trong những "Mãnh hổ AI" nổi bật của quốc gia này. Công ty nổi tiếng với việc phát triển các mô hình AI đa phương thức và ứng dụng tiêu dùng, chẳng hạn như dịch vụ tạo video Hailuo AI. Trước đây, việc tạo video kèm âm thanh phù hợp thường yêu cầu các mô hình riêng biệt cho phần hình ảnh và âm thanh, dễ dẫn đến các vấn đề về lệch pha đồng bộ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#AI Models#Hugging Face#Generative AI

$ subscribe --daily

Mô hình tạo sinh đa phương thức MiniMax-H3 phát hành trên Hugging Face | Daily News