Nhà phát triển học sinh ra mắt Inflect v2 - các mô hình chuyển văn bản thành giọng nói siêu nhỏ
Một nhà phát triển học sinh trung học đã phát hành Inflect v2, bao gồm hai mô hình chuyển văn bản thành giọng nói (TTS) cục bộ siêu nhỏ: Inflect-Nano-v2 (3,96 triệu tham số) và Inflect-Micro-v2 (9,36 triệu tham số). Các mô hình này tạo ra âm thanh 24 kHz trực tiếp từ văn bản mà không cần bộ giải mã giọng nói (vocoder) bên ngoài hay API lưu trữ. Bản phát hành này chứng minh rằng hệ thống TTS hoàn chỉnh, có thể sử dụng được có thể chạy cục bộ trên các thiết bị biên với dung lượng bộ nhớ cực kỳ nhỏ (dưới 16 MB đối với phiên bản Nano). Điều này giúp giảm rào cản khi triển khai tổng hợp giọng nói trong môi trường hạn chế tài nguyên mà không cần phụ thuộc vào dịch vụ đám mây. Các mô hình này hiện chỉ hỗ trợ tiếng Anh, sử dụng một giọng nam cố định duy nhất và không hỗ trợ sao chép giọng nói. Bất chấp kích thước nhỏ, chúng đạt tốc độ suy luận thời gian thực cao trên CPU (10,72 lần đối với Nano và 6,28 lần đối với Micro) và hoạt động tốt trong các so sánh chất lượng của cộng đồng.
## KIẾN THỨC NỀN
Các hệ thống chuyển văn bản thành giọng nói truyền thống thường chia quy trình thành hai giai đoạn: một mô hình âm học chuyển văn bản thành các đặc trưng trung gian (như spectrogram) và một bộ giải mã giọng nói (vocoder) để giải mã các đặc trưng đó thành dạng sóng âm thanh có thể phát được. Inflect v2 tích hợp cả hai bước này vào một quy trình thống nhất duy nhất, loại bỏ nhu cầu về một mô hình vocoder riêng biệt.