~/SPEECH TO TE/cactus-compute-releases-whistle-a-16-9mb-ultra-compact-speech-to-text

Cactus Compute ra mắt Whistle: Mô hình chuyển giọng nói thành văn bản 16,9MB siêu nhỏ gọn

Cactus Compute đã giới thiệu Cactus Whistle, mô hình chuyển giọng nói thành văn bản mã nguồn mở với 55 triệu tham số (36 triệu tham số hoạt động) được nén còn 16,9MB nhờ định dạng lượng tử hóa CQ2bit. Dù nhỏ hơn 9 lần và nhanh hơn 6 lần so với bản Whisper base của OpenAI, Whistle vẫn đạt hiệu suất vượt trội trên các bộ thử nghiệm tiêu chuẩn như LibriSpeech và FLEURS. Phát triển này cho phép nhận dạng giọng nói tự động đa ngôn ngữ với độ chính xác cao ngay trên các thiết bị biên như vi điều khiển, thiết bị đeo và điện thoại giá rẻ mà không cần đến xử lý đám mây. Điều này chứng minh rằng những cải tiến kiến trúc mục tiêu cùng lượng tử hóa sâu có thể mang năng lực AI mạnh mẽ lên các phần cứng bị hạn chế tài nguyên. Whistle kết hợp bộ mã hóa âm thanh log-mel với bộ giải mã Simple Attention và Hadamard MLP có cơ chế chú ý chéo có cổng (gated cross-attention). Mô hình hỗ trợ tính năng định hướng từ khóa trong quá trình tìm kiếm chùm (beam search) để phiên âm chính xác các tên riêng hiếm gặp, cung cấp mốc thời gian theo từng từ và có thể triển khai trên 17 nền tảng bao gồm RISC-V, ARM64 và WebAssembly.

## KIẾN THỨC NỀN

Các mô hình nhận dạng giọng nói tự động (ASR) như Whisper của OpenAI chuyển đổi âm thanh nói thành văn bản, nhưng các mô hình tiêu chuẩn thường đòi hỏi hàng trăm megabyte bộ nhớ và tài nguyên tính toán lớn. Lượng tử hóa mô hình giúp giảm dung lượng bộ nhớ bằng cách chuyển đổi trọng số mô hình sang định dạng độ chính xác thấp hơn, cho phép các mạng thần kinh phức tạp chạy trực tiếp trên phần cứng công suất thấp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Speech-to-Text#ASR#Edge AI#Model Quantization#Machine Learning

$ subscribe --daily

Cactus Compute ra mắt Whistle: Mô hình chuyển giọng nói thành văn bản 16,9MB siêu nhỏ gọn | Daily News