NeuTTS-2E: Mô Hình TTS Cục Bộ Nguồn Mở Hỗ Trợ Kiểm Soát Cảm Xúc
Neuphonic đã phát hành phiên bản alpha của NeuTTS-2E, một mô hình chuyển văn bản thành giọng nói (TTS) chạy cục bộ trên thiết bị với 125 triệu tham số. Mô hình nguồn mở này cho phép người dùng kiểm soát rõ ràng bảy loại cảm xúc khác nhau trong khi vẫn duy trì tính nhất quán của giọng người nói. Bản phát hành này cho phép các nhà phát triển triển khai hệ thống tổng hợp giọng nói có tính biểu cảm cao, riêng tư và cục bộ trên phần cứng của người dùng mà không cần phụ thuộc vào API đám mây. Bằng cách cho phép kiểm soát cảm xúc trực tiếp, mô hình giải quyết vấn đề các mô hình TTS thông thường chỉ tự suy luận cảm xúc từ ngữ nghĩa của văn bản đầu vào. NeuTTS-2E hỗ trợ bốn giọng nói tích hợp sẵn, chạy hoàn toàn cục bộ và được phát hành theo Giấy phép Mở NeuTTS (NeuTTS Open License). Để đạt được điều này, các nhà phát triển đã phải vượt qua những thách thức như dữ liệu huấn luyện giọng nói cảm xúc hạn chế và khó khăn trong việc tách biệt cảm xúc nói ra khỏi ngữ nghĩa của văn bản.
## KIẾN THỨC NỀN
Tổng hợp văn bản thành giọng nói (TTS) là quá trình tạo ra giọng nói nhân tạo của con người từ văn bản viết. Một thách thức lớn trong tổng hợp giọng nói biểu cảm là việc tách biệt đặc trưng người nói và ngữ nghĩa văn bản khỏi biểu hiện cảm xúc, điều thường khiến giọng nói mất tự nhiên hoặc mất đi bản sắc giọng nói khi thay đổi tông điệu. Các mô hình TTS chạy trên thiết bị ngày càng phổ biến vì chúng đảm bảo quyền riêng tư của người dùng và hoạt động không bị trễ do mạng Internet.