Breeze-TTS-2: Mô hình chuyển văn bản thành giọng nói cục bộ chất lượng vượt trội mới
Breeze-TTS-2, một mô hình chuyển văn bản thành giọng nói (TTS) trọng số mở mới do BreezeBlue phát triển, đã được phát hành với kích thước mô hình khoảng 7GB. Người dùng có thể tự triển khai cục bộ hoặc trải nghiệm bản thử nghiệm tương tác trên Hugging Face. Mô hình này mang lại chất lượng tạo giọng nói ở cấp độ hàng đầu cho phần cứng cục bộ, giúp giảm sự phụ thuộc vào các API đám mây độc quyền. Nó được xếp hạng cao trong số các mô hình TTS trọng số mở, cung cấp các tính năng nâng cao như hỗ trợ song ngữ, sao chép giọng nói và định hướng giọng nói. Breeze-TTS-2 xếp thứ ba trong số các mô hình TTS trọng số mở với điểm Elo tương đương với Fish Audio S2 Pro. Mô hình này hỗ trợ chuyển văn bản thành giọng nói song ngữ, sao chép giọng nói và định hướng giọng nói, đồng thời có thể chạy cục bộ với dung lượng khoảng 7GB.
## KIẾN THỨC NỀN
Công nghệ chuyển văn bản thành giọng nói (TTS) đã chuyển dịch từ tổng hợp giọng nói cơ học sang sao chép giọng nói biểu cảm, chân thực cao bằng học sâu. Trong khi các mô hình hàng đầu thường bị khóa sau các API thương mại, cộng đồng mã nguồn mở đang tích cực phát triển các mô hình "trọng số mở" mà người dùng có thể tự chạy riêng tư trên phần cứng của họ.