audio.cpp 0.4 Ra Mắt Hỗ Trợ Higgs Audio v3, Fish Audio S2 Pro và Định Dạng GGUF
Phiên bản audio.cpp 0.4 vừa được phát hành, mang đến các bản triển khai C++/GGML cho Higgs Audio v3 TTS 4B, Fish Audio S2 Pro và Voxtral Realtime ASR, đồng thời hỗ trợ đầy đủ định dạng GGUF cho toàn bộ 35 họ mô hình. Phiên bản này cũng giới thiệu lượng tử hóa Q8 giúp tăng tốc độ xử lý và tiết kiệm bộ nhớ đáng kể. Bản cập nhật này thúc đẩy đáng kể AI âm thanh chạy cục bộ bằng cách cho phép chuyển văn bản thành giọng nói và nhận dạng giọng nói hiệu năng cao, độ trễ thấp trên phần cứng tiêu dùng mà không cần phụ thuộc vào các framework Python nặng nề. Việc tích hợp các mô hình tiên tiến như Higgs Audio v3 và Fish Audio S2 Pro giúp việc tạo giọng nói biểu cảm theo thời gian thực trở nên dễ tiếp cận hơn. Thử nghiệm trên RTX 5090 cho thấy lượng tử hóa Q8 giúp giảm tới 37% dung lượng VRAM đỉnh và tăng tốc độ lên tới 1,5 lần so với GGUF 16-bit. Higgs Audio TTS đạt hiệu suất nhanh hơn thời gian thực tới 10,1 lần, trong khi Fish Audio S2 Pro chạy nhanh hơn tới 3,4 lần.
## KIẾN THỨC NỀN
GGML là một thư viện tensor dành cho học máy được thiết kế để đạt hiệu năng cao trên phần cứng thông thường, trong khi GGUF là định dạng tệp nhị phân kế nhiệm được tối ưu hóa để tải và lưu mô hình nhanh chóng. Higgs Audio v3 và Fish Audio S2 Pro là các mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở tiên tiến, nổi tiếng với khả năng biểu cảm, hỗ trợ đa ngôn ngữ và độ trễ thấp.