~/GENERATIVE A/black-forest-labs-announces-flux-3-multimodal-model

Black Forest Labs công bố mô hình đa phương thức Flux 3

Black Forest Labs đã công bố Flux 3, một mô hình đa phương thức thống nhất có khả năng tạo video, âm thanh, hình ảnh và dự đoán hành động. Công ty có kế hoạch phát hành phiên bản mở trọng số (open-weight) mang tên "FLUX 3 Dev" trong vài tuần và vài tháng tới. Việc phát hành Flux 3 đánh dấu một bước tiến quan trọng trong lĩnh vực AI đa phương thức thống nhất, kết hợp khả năng sáng tạo nội dung trên nhiều phương tiện với dự đoán hành động trong một kiến trúc duy nhất. Việc cung cấp quyền truy cập mở trọng số (open-weight) qua FLUX 3 Dev sẽ cho phép các nhà phát triển và nghiên cứu chạy, tùy chỉnh và phát triển trực tiếp trên mô hình tiên tiến này tại máy cục bộ. Flux 3 cùng lúc học hỏi từ hình ảnh, video và âm thanh trong một kiến trúc thống nhất, thay vì xử lý riêng lẻ các phương thức này. Mặc dù mô hình hứa hẹn các khả năng như tạo video dài 20 giây, các tài liệu quảng bá ban đầu đã vấp phải sự hoài nghi do sử dụng các cảnh cắt (jumpcut) thay vì tạo video liên tục.

## KIẾN THỨC NỀN

Black Forest Labs trước đây đã trở nên nổi tiếng với bộ mô hình chuyển văn bản thành hình ảnh FLUX.1, thiết lập các tiêu chuẩn mới về độ chi tiết của ảnh và khả năng tuân thủ câu lệnh (prompt). Các mô hình mở trọng số (open-weight) khác với các API đóng hoàn toàn ở chỗ chúng công bố công khai các trọng số mạng thần kinh cốt lõi, cho phép người dùng tải xuống và chạy trên phần cứng của riêng họ.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Generative AI#Multimodal Models#Machine Learning#Artificial Intelligence

$ subscribe --daily