Nvidia ra mắt SVD giúp phát hiện video do AI tạo chính xác tới 92%
Nvidia đã ra mắt dịch vụ Phát hiện Video Tổng hợp (SVD), được tích hợp dưới dạng một vi dịch vụ NIM, có khả năng nhận diện các video do AI tạo ra với độ chính xác lên tới 92%. Công cụ này phân tích video theo từng khung hình bằng cách sử dụng các mô hình vision transformer DINOv2 và DINOv3 của Meta. Trong bối cảnh deepfake và các phương tiện truyền thông do AI tạo ra ngày càng trở nên chân thực và phổ biến, công cụ này cung cấp một giải pháp độ trễ thấp và độ chính xác cao để các nền tảng và nhà phát triển xác minh tính xác thực của video. Việc tích hợp vào hệ sinh thái NIM của Nvidia giúp công cụ này dễ dàng được triển khai trong các ứng dụng thời gian thực. Dịch vụ SVD cắt các khung hình video về độ phân giải 504x504 và chấm điểm từ 0 đến 1 trước khi tính trung bình kết quả. Mặc dù đạt độ chính xác 92% trên các video không nén, hiệu suất giảm xuống còn 87% ở tỷ lệ nén 15% và 82% ở tỷ lệ nén 50%, nhưng vẫn duy trì độ trễ thấp chỉ 22 mili giây cho video 1080p trên GPU Nvidia RTX.
## KIẾN THỨC NỀN
Nvidia NIM (Nvidia Inference Microservices) là một tập hợp các vi dịch vụ dễ sử dụng được thiết kế để tăng tốc độ triển khai các mô hình AI tạo sinh trên môi trường đám mây, trung tâm dữ liệu và máy trạm. DINOv2 và DINOv3 của Meta là các mô hình vision transformer tự giám sát được huấn luyện trên các tập dữ liệu hình ảnh khổng lồ để học các biểu diễn thị giác mà không cần nhãn do con người gắn.