Black Forest Labs ra mắt mô hình tạo video đa phương thức FLUX 3
Black Forest Labs đã chính thức ra mắt FLUX 3, một mô hình AI đa phương thức có khả năng tạo video độ phân giải 1080p gốc dài tối đa 20 giây đi kèm âm thanh đồng bộ. Mô hình này sử dụng một kiến trúc thống nhất để học tập đồng thời từ hình ảnh, video và âm thanh. FLUX 3 vượt qua các đối thủ cạnh tranh lớn như Seedance 2.0 của ByteDance và H3 của MiniMax trong các bài kiểm tra hiệu năng chuyển văn bản thành video và hình ảnh thành video. Sự ra mắt này làm gia tăng sự cạnh tranh trong lĩnh vực tạo video bằng AI nhờ khả năng tạo video kèm âm thanh gốc chất lượng cao. Mô hình hỗ trợ các tính năng chuyển văn bản thành video, hình ảnh thành video, video thành video và chuỗi nhiều cảnh quay, với mức giá dao động từ 0,06 USD/giây cho bản nháp HD đến 0,53 USD/giây cho tính năng chuyển video thành video ở độ phân giải Full HD.
## KIẾN THỨC NỀN
Black Forest Labs là một tổ chức nghiên cứu AI nổi tiếng với việc phát triển dòng mô hình tạo ảnh FLUX. Trước đây, việc tạo video bằng AI yêu cầu các mô hình riêng biệt cho phần hình ảnh và tổng hợp âm thanh, nhưng các kiến trúc đa phương thức hiện đại như FLUX 3 và MiniMax H3 đã có thể tạo ra cả hai yếu tố này cùng lúc trong một lượt xử lý duy nhất.