NVIDIA phát hành toàn bộ bộ công cụ giọng nói chạy cục bộ qua NeMo-Speech.cpp dưới định dạng GGUF
NVIDIA đã cho phép chạy cục bộ toàn bộ bộ công cụ xử lý giọng nói của mình—bao gồm nhận dạng giọng nói (ASR), chuyển văn bản thành giọng nói (TTS) và codec âm thanh—trên thiết bị bằng cách lượng tử hóa các mô hình sang định dạng GGUF. Các mô hình này, chẳng hạn như Magpie-TTS, Nemotron Speech và NanoCodec, hiện có thể chạy trực tiếp thông qua thư viện C++ NeMo-Speech.cpp. Bản phát hành này giúp giảm đáng kể rào cản trong việc triển khai các ứng dụng giọng nói chất lượng cao, độ trễ thấp trên các thiết bị biên mà không cần phụ thuộc vào API đám mây. Điều này cho phép các nhà phát triển xây dựng các trợ lý giọng nói và hệ thống chuyển giọng nói thành văn bản có tính bảo mật cao, hoạt động ngoại tuyến và phản hồi nhanh. Bộ công cụ này bao gồm các mô hình như Magpie-TTS Multilingual với 357 triệu tham số, Nemotron Speech Streaming EN 0.6B và NanoCodec siêu nhẹ. Việc tích hợp sử dụng định dạng lượng tử hóa GGUF giúp đóng gói trọng số mô hình và siêu dữ liệu vào một tệp duy nhất để suy luận hiệu quả và tiết kiệm bộ nhớ.
## KIẾN THỨC NỀN
ASR (Nhận dạng giọng nói tự động) chuyển đổi ngôn ngữ nói thành văn bản, trong khi TTS (Chuyển văn bản thành giọng nói) thực hiện quy trình ngược lại, và codec âm thanh nén dữ liệu âm thanh để xử lý hiệu quả. GGUF là một định dạng tệp nhị phân phổ biến được thiết kế để triển khai nhanh chóng các mô hình lượng tử hóa dưới dạng một tệp duy nhất trên phần cứng người dùng thông qua các trình thực thi dựa trên GGML.