sanoTTS: Bộ mô hình chuyển văn bản thành giọng nói cực nhẹ cho vi điều khiển và Web
Nhà phát triển ampixa đã ra mắt sanoTTS, một họ mô hình chuyển văn bản thành giọng nói (TTS) bằng mạng thần kinh nguồn mở với quy mô từ 294k đến 2.2 triệu tham số. Mô hình nhỏ nhất chỉ chiếm 337 KB khi lượng hóa sang INT8, cho phép tạo giọng nói ngoại tuyến trên các vi điều khiển trị giá 3 USD như ESP32 mà không cần NPU. Bằng cách thu nhỏ đáng kể các mô hình TTS—nhỏ hơn tới 1.000 lần so với các mô hình mã nguồn mở như Kokoro—sanoTTS cho phép tổng hợp giọng nói thời gian thực chất lượng cao trên các thiết bị IoT và trình duyệt web hạn chế tài nguyên. Đột phá này mở ra khả năng phát triển các thiết bị gia dụng thông minh ngoại tuyến, ứng dụng nhúng và ứng dụng web mà không cần phụ thuộc vào API đám mây. Biến thể 1.51M tham số (sanoTTS-Amy) đạt điểm SCOREQ là 4.13 và UTMOS là 4.10, vượt trội hơn các mô hình lớn hơn nhiều như KittenTTS (15M tham số). Trên vi điều khiển ESP32 với 512 KB SRAM, mô hình đạt hệ số thời gian thực (RTF) là 0.225 (tạo 4 giây âm thanh trong 1 giây) với tỷ lệ lỗi từ (WER) khoảng 2% khi đánh giá bằng Whisper.
## KIẾN THỨC NỀN
Các mô hình Chuyển văn bản thành giọng nói (TTS) sử dụng mạng thần kinh để chuyển đổi văn bản viết thành giọng nói tự nhiên, nhưng các mô hình TTS học sâu truyền thống thường yêu cầu GPU đắt tiền hoặc hàng gigabyte bộ nhớ. UTMOS và SCOREQ là các chỉ số thần kinh khách quan được sử dụng để đánh giá chất lượng âm thanh, trong đó điểm số cao hơn thể hiện chất lượng âm thanh tốt hơn. Hệ số thời gian thực (RTF) đo tốc độ xử lý so với thời lượng âm thanh; RTF dưới 1.0 có nghĩa là tốc độ tạo giọng nói nhanh hơn thời gian phát thực tế.