Google ra mắt mô hình AI tạo video Gemini Omni 1.1 Flash hỗ trợ độ phân giải 4K
Google đã ra mắt Gemini Omni 1.1 Flash, một mô hình AI tạo video sẵn sàng cho môi trường sản xuất, hỗ trợ độ phân giải lên tới 4K, mở rộng phân cảnh và tạo video dựa trên tham chiếu. Mô hình này cung cấp cho các nhà phát triển khả năng kiểm soát nâng cao đối với việc tạo video, bao gồm cả việc chỉ định khung hình đầu và cuối để tạo hiệu ứng chuyển cảnh mượt mà. Bản cập nhật này làm tăng tính cạnh tranh trong lĩnh vực AI tạo video bằng cách cung cấp cho các nhà phát triển một công cụ có khả năng kiểm soát cao và tiết kiệm chi phí. Các tính năng như tạo bản xem trước 360p với chi phí chỉ bằng một phần ba so với chuẩn 720p cho phép tạo nguyên mẫu và kịch bản phân cảnh nhanh chóng trước khi tiến hành kết xuất độ phân giải cao. Mô hình cho phép người dùng mở rộng video theo các bước tăng dần 10 giây với tổng thời lượng lên đến 40 giây, đồng thời hỗ trợ video tham chiếu dài tối đa 3 giây để duy trì tính nhất quán của nhân vật và bối cảnh. Mức giá dao động từ 0,03 USD mỗi giây cho bản xem trước 360p đến 0,30 USD mỗi giây cho đầu ra 4K hoàn chỉnh.
## KIẾN THỨC NỀN
AI tạo video đã phát triển nhanh chóng, nhưng các nhà phát triển thường gặp khó khăn trong việc duy trì tính nhất quán về mặt hình ảnh giữa các khung hình và quản lý chi phí kết xuất cao. Việc tạo video dựa trên khung hình khóa (keyframe) và các mô hình video dựa trên tham chiếu giải quyết những vấn đề này bằng cách cho phép người sáng tạo định hướng AI bằng các hình ảnh bắt đầu/kết thúc cụ thể hoặc các đoạn clip tham chiếu ngắn nhằm đảm bảo nhân vật và bối cảnh luôn ổn định.