Scenema Audio Ra Mắt Dưới Dạng Node ComfyUI Chạy Trên VRAM 8GB
Scenema Audio đã được phát hành dưới dạng một node tùy chỉnh gốc trên ComfyUI, được lượng tử hóa để chạy cục bộ trên các GPU tiêu dùng có VRAM tối thiểu 8GB. Bản cập nhật này hỗ trợ chuyển đổi văn bản thành giọng nói biểu cảm, sao chép giọng nói zero-shot và các chỉ dẫn sân khấu trực tiếp bằng dấu ngoặc vuông thay vì định dạng XML trước đây. Bản phát hành này giúp bình dân hóa công nghệ tạo âm thanh tiên tiến bằng cách cho phép các nhà sáng tạo chạy các mô hình tổng hợp giọng nói dựa trên transformer nặng ngay trên phần cứng tiêu dùng cục bộ. Việc tích hợp vào ComfyUI giúp kết hợp liền mạch công cụ này với các quy trình AI tạo sinh khác như tạo hình ảnh và video. Mô hình này sử dụng Gemma 3 12B làm bộ mã hóa văn bản, yêu cầu người dùng chấp nhận giấy phép trên HuggingFace và thiết lập `HF_TOKEN` trước lần chạy đầu tiên để tải xuống khoảng 30GB trọng số. Do là một mô hình khuếch tán (diffusion), đôi khi nó có thể tạo ra các đoạn lặp lại hoặc vô nghĩa, vì vậy phù hợp nhất cho quy trình hậu kỳ tạo-và-cắt-lọc.
## KIẾN THỨC NỀN
ComfyUI là một giao diện đồ họa dạng node phổ biến được sử dụng để xây dựng các quy trình làm việc mô-đun cho các mô hình AI tạo sinh. Lượng tử hóa mô hình (quantization) là kỹ thuật giảm độ chính xác của các tham số mô hình nhằm thu nhỏ dung lượng bộ nhớ, cho phép các mô hình lớn chạy trên các GPU nhỏ hơn. Sao chép giọng nói zero-shot cho phép hệ thống tái tạo một giọng nói cụ thể chỉ bằng một đoạn âm thanh mẫu ngắn mà không cần huấn luyện thêm.