Dự án AI giọng nói mã nguồn mở VibeVoice của Microsoft thịnh hành trên GitHub
Dự án AI giọng nói mã nguồn mở VibeVoice của Microsoft đang tăng trưởng nhanh chóng trên GitHub với hơn 2.700 lượt gắn sao và gần 6.000 lượt fork. Khung làm việc này bao gồm các khả năng tạo âm thanh hội thoại nhiều người nói và nhận dạng giọng nói có cấu trúc dạng dài. Dự án này giải quyết các hạn chế lớn của hệ thống giọng nói truyền thống bằng cách cho phép tạo ra âm thanh hội thoại tự nhiên, dạng dài như podcast, cũng như dịch mã tối đa 60 phút âm thanh liên tục trong một lượt chạy. Việc phát hành mã nguồn mở này thúc đẩy sự phát triển trong lĩnh vực tổng hợp giọng nói và dịch mã tự động cho các kịch bản phức tạp có nhiều người nói. Được viết bằng ngôn ngữ Python, VibeVoice sở hữu một khung làm việc mới để tạo văn bản thành giọng nói biểu cảm với tính nhất quán của người nói và lượt lời tự nhiên, đi kèm với "VibeVoice ASR" để chuyển giọng nói thành văn bản có cấu trúc giúp xác định danh tính người nói và thời gian.
## KIẾN THỨC NỀN
Các hệ thống chuyển văn bản thành giọng nói (TTS) truyền thống thường gặp khó khăn trong việc duy trì giọng nói nhất quán của người nói và lượt lời thực tế trong các cuộc hội thoại dài, nhiều người nói. Tương tự, các công cụ nhận dạng giọng nói tự động (ASR) tiêu chuẩn thường yêu cầu phân đoạn các tệp âm thanh dài, điều này có thể làm mất ngữ cảnh và chi tiết phân đoạn người nói.