BAAI và Đại học Bắc Kinh phát triển công nghệ chỉnh sửa đồng thời âm thanh-video
Các nhà nghiên cứu từ Viện Trí tuệ Nhân tạo Bắc Kinh (BAAI) và Đại học Bắc Kinh đã phát triển "InstructAV2AV", một phương pháp cho phép chỉnh sửa đồng thời cả âm thanh và video chỉ bằng một câu lệnh ngôn ngữ tự nhiên duy nhất. Nghiên cứu này đã được chấp nhận tại hội thảo SIGGRAPH Asia, cho phép cả hình ảnh và âm thanh cùng phản hồi câu lệnh trong một quy trình tạo lập end-to-end duy nhất. Phương pháp này loại bỏ nhu cầu chỉnh sửa video và âm thanh riêng biệt hoặc vẽ mặt nạ (mask) thủ công, đảm bảo đầu ra đa phương thức được đồng bộ hóa. Đây là một bước tiến lớn trong lĩnh vực truyền thông tạo sinh (generative media), giúp việc sáng tạo nội dung trở nên trực quan, gắn kết và hiệu quả hơn. Để giải quyết tình trạng cực kỳ khan hiếm dữ liệu chỉnh sửa âm thanh-video đi kèm, nhóm nghiên cứu đã xây dựng một quy trình tự động và phát hành "InsAVE-80K", bộ dữ liệu quy mô lớn đầu tiên dành cho việc chỉnh sửa đồng thời âm thanh-video theo hướng dẫn. Mô hình này tự động chỉnh sửa các đối tượng hình ảnh được chỉ định và âm thanh tương ứng của chúng mà không cần người dùng vẽ khung giới hạn (bounding box).
## KIẾN THỨC NỀN
Các công cụ chỉnh sửa video truyền thống thường xử lý luồng hình ảnh và âm thanh như các thực thể riêng biệt, yêu cầu người chỉnh sửa phải sửa đổi độc lập và căn chỉnh thủ công. Mặc dù công nghệ chỉnh sửa hình ảnh và video bằng AI đã phát triển nhanh chóng, việc chỉnh sửa đồng thời âm thanh-video vẫn còn tụt hậu do chi phí cao trong việc tạo ra các bộ dữ liệu chứa các cặp âm thanh-video đã chỉnh sửa và đồng bộ hóa.