ItoTTS mang công nghệ chuyển văn bản thành giọng nói chất lượng cao lên vi điều khiển ESP32-S3 giá 5 USD
Nhóm Lokutor đã ra mắt ItoTTS, một công cụ chuyển văn bản thành giọng nói (TTS) dạng luồng nhỏ gọn có khả năng tổng hợp âm thanh tiếng Anh tự nhiên 24 kHz trên vi điều khiển ESP32-S3 giá 5 USD. Công cụ cung cấp hai giọng nói riêng biệt chỉ yêu cầu 4,89 MB trọng số mô hình cho mỗi giọng, đạt 4,46 điểm độ tự nhiên UTMOS, tiệm cận với mô hình giáo viên StyleTTS 2. Bằng cách mang khả năng tổng hợp giọng nói chất lượng cao lên các vi điều khiển giá siêu rẻ và hạn chế tài nguyên, ItoTTS cho phép xây dựng giao diện giọng nói hoàn toàn cục bộ và riêng tư cho thiết bị nhà thông minh và phần cứng AI nhúng. Nó giảm rào cản phần cứng cho các mô hình ngôn ngữ lớn (LLM) cục bộ có hỗ trợ giọng nói mà không cần phụ thuộc vào API đám mây. Mã nguồn được cấp phép theo GPLv3 trong khi trọng số mô hình được phát hành theo giấy phép CC BY-NC-SA 4.0 cho mục đích phi thương mại nhằm ngăn các tập đoàn lớn thương mại hóa công trình mà không có sự đồng ý. Các hạn chế hiện tại bao gồm việc phụ thuộc vào máy chủ để chuyển đổi văn bản thành âm tiết (phoneme) và chưa đo lường tốc độ xử lý thực tế trên phần cứng vật lý.
## KIẾN THỨC NỀN
Chuyển văn bản thành giọng nói (TTS) trên các vi điều khiển nhúng như ESP32-S3 trước đây thường cho âm thanh thô cứng như rô-bốt do giới hạn nghiêm ngặt về bộ nhớ và năng lực tính toán. UTMOS là một chỉ số dựa trên mạng thần kinh để dự đoán điểm độ tự nhiên của giọng nói, trong khi StyleTTS 2 là mô hình chuyển văn bản thành giọng nói tiên tiến đóng vai trò mô hình giáo viên để huấn luyện các mô hình nhỏ hơn như ItoTTS.