~/TEXT TO SPEE/audio-cpp-updates-lower-higgs-audio-tts-vram-by-48-and-accelerate

Cập nhật audio.cpp giúp giảm 48% VRAM cho Higgs Audio TTS và tăng tốc nhiều mô hình âm thanh

Dự án mã nguồn mở audio.cpp đã phát hành các tối ưu hóa quan trọng ở cấp thời gian chạy, giúp giảm 48% mức sử dụng VRAM tối đa của Higgs Audio TTS xuống còn khoảng 6 GB mà không làm giảm chất lượng. Bản cập nhật cũng tăng tốc độ phân tách âm thanh của HTDemucs lên tới 2,21 lần trên CUDA và tăng tốc PocketTTS thêm 2,23 lần trên CPU. Bằng cách giảm đáng kể yêu cầu bộ nhớ và tăng tốc độ xử lý trên các nền tảng phần cứng như CUDA, Vulkan và CPU, audio.cpp giúp việc vận hành các mô hình âm thanh tiên tiến trở nên khả thi trên phần cứng thương mại phổ thông. Điều này mở rộng hệ sinh thái AI cục bộ và bảo mật vượt ra ngoài việc tạo văn bản sang các mảng chuyển văn bản thành giọng nói và phân tách nhạc nền. Các tối ưu hóa vẫn duy trì sự đồng bộ hoàn toàn về đầu ra của mô hình trên hơn 110 họ mô hình âm thanh và 190 biến thể được hỗ trợ trên CUDA, Vulkan, Metal, AMD/HIP và CPU. Ngoài ra, bản cập nhật bổ sung tính năng lịch sử tạo âm thanh thử nghiệm vào giao diện WebUI, cho phép người dùng xem lại kết quả cũ và khôi phục lại các cài đặt tạo trước đó.

## KIẾN THỨC NỀN

audio.cpp là một khung làm việc mã nguồn mở để chạy cục bộ các mô hình âm thanh với hiệu năng cao, lấy cảm hứng từ các công cụ như llama.cpp cho mô hình ngôn ngữ. Dự án hỗ trợ nhiều tác vụ âm thanh khác nhau, bao gồm các mô hình nền tảng chuyển văn bản thành giọng nói như Higgs Audio của Boson AI, công cụ giọng nói ngoại tuyến nhỏ gọn như PocketTTS, và các mô hình phân tách thành phần nhạc nền như Hybrid Transformer Demucs (HTDemucs).

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#text-to-speech#model-optimization#local-ai#audio-processing#open-source

$ subscribe --daily

Cập nhật audio.cpp giúp giảm 48% VRAM cho Higgs Audio TTS và tăng tốc nhiều mô hình âm thanh | Daily News