~/VIDEO GENERA/minimax-open-sources-h3-multimodal-video-generation-model-with-2k-resolution

MiniMax mã nguồn mở mô hình tạo video H3 hỗ trợ độ phân giải 2K

MiniMax đã chính thức mở mã nguồn MiniMax H3, một mô hình tạo video đa phương thức tổng quát có khả năng hiểu các đầu vào văn bản, hình ảnh, video và âm thanh. Mô hình này có thể tạo ra các video dài tối đa 15 giây với âm thanh nổi 32 kHz gốc và độ phân giải lên tới 2K. Bằng cách mở mã nguồn một mô hình tích hợp tự nhiên khả năng tạo video và âm thanh nổi từ các ngữ cảnh đa phương thức phức tạp, MiniMax giúp giảm rào cản trong việc tổng hợp video chất lượng cao và có khả năng kiểm soát tốt. Sự kiện này làm tăng tính cạnh tranh trong không gian video AI mã nguồn mở, mang lại cho các nhà phát triển một giải pháp thay thế linh hoạt cho các mô hình thương mại độc quyền. Hệ thống H3 gồm ba mô-đun: H3-Context-IR để xử lý các chỉ dẫn đa phương thức, H3-Base để tạo đầu ra 768p và H3-Regenerate-2K để nâng cấp độ phân giải. Hệ thống cung cấp hai chế độ chính: H3-Base-FL2VA để tạo video từ khung hình đầu/cuối và H3-Base-Ref2VA để tạo video dựa trên tham chiếu hỗ trợ tối đa 12 tệp đầu vào hỗn hợp.

## KIẾN THỨC NỀN

Các mô hình tạo video truyền thống thường gặp khó khăn với các câu lệnh đa phương thức phức tạp hoặc yêu cầu các mô hình riêng biệt để tạo âm thanh đi kèm. Công nghệ tạo video từ tham chiếu (R2V) và tạo video từ khung hình đầu/cuối (FL2VA) cho phép người dùng định hướng quá trình tạo video chính xác hơn bằng cách sử dụng hình ảnh, video hoặc âm thanh có sẵn làm điểm neo, đảm bảo tính nhất quán về nhân vật, phong cách và nhịp độ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Video Generation#Open Source#Multimodal AI#Artificial Intelligence

$ subscribe --daily

MiniMax mã nguồn mở mô hình tạo video H3 hỗ trợ độ phân giải 2K | Daily News