Google DeepMind ra mắt GenCeption, tái sử dụng mô hình tạo video cho thị giác máy tính
Google DeepMind đã giới thiệu GenCeption, một mô hình dựa trên trình tạo video mã nguồn mở Wan2.1 của Alibaba, có thể thực hiện nhiều tác vụ thị giác máy tính cổ điển trong một khung làm việc duy nhất. Khác với các mô hình chuyên biệt truyền thống, GenCeption tái sử dụng mô hình tạo video để xử lý ước tính độ sâu, phân vùng hình ảnh và ước tính tư thế. Phương pháp này thách thức mô hình truyền thống sử dụng các mô hình chuyên biệt riêng biệt cho từng tác vụ thị giác máy tính khác nhau bằng cách chứng minh rằng các mô hình tạo video đã chứa đựng các biểu diễn phong phú về thế giới vật lý. Điều này có thể mở đường cho các mô hình thị giác đa dụng, thống nhất hơn, hoạt động nhanh hơn và linh hoạt hơn. GenCeption xử lý các tác vụ trong một lượt truyền xuôi duy nhất thay vì khử nhiễu nhiều bước, cho phép phiên bản 14 tỷ tham số xử lý video 81 khung hình trong khoảng 10 giây. Mặc dù được huấn luyện chủ yếu trên dữ liệu tổng hợp về một người đơn lẻ, mô hình này vẫn có khả năng tổng quát hóa cực tốt đối với các cảnh quay thực tế, nhiều người và động vật.
## KIẾN THỨC NỀN
Các tác vụ thị giác máy tính cổ điển như ước tính độ sâu và phân vùng hình ảnh từ trước đến nay vẫn phụ thuộc vào các mô hình chuyên dụng như Depth Anything hoặc Segment Anything. Trong khi đó, các mô hình tạo video như Wan2.1 của Alibaba được huấn luyện để dự đoán các khung hình video, điều này gián tiếp yêu cầu chúng phải học các thuộc tính vật lý, hình học và mối quan hệ không gian của thế giới.