Chạy mô hình ASR Conformer 13 triệu tham số trên vi điều khiển dưới 10 USD
Một nhà phát triển đã tối ưu hóa và chuyển đổi thành công mô hình ASR Conformer 13,1 triệu tham số để chạy trên vi điều khiển ESP32-S3 giá rẻ. Thành tựu này đạt được bằng cách chưng cất và lượng tử hóa mô hình Conformer nhỏ của Nvidia để phù hợp với bộ nhớ hạn chế của thiết bị. Dự án này cho thấy tiềm năng của TinyML, chứng minh rằng các mô hình nhận dạng giọng nói phức tạp có thể chạy trên phần cứng biên giá rẻ thay vì phụ thuộc vào điện toán đám mây đắt đỏ. Nó mở ra một hướng đi thực tế giúp AI dễ tiếp cận và bảo mật hơn bằng cách chạy các mô hình cục bộ trên vi điều khiển. Mô hình tối ưu hóa vừa vặn trong 14MB bộ nhớ flash, yêu cầu 256KB SRAM và 4MB PSRAM để dịch mã 8 giây âm thanh, đồng thời tận dụng khả năng tăng tốc phần cứng cho phép toán 8-bit của ESP32-S3. Mặc dù quá trình chưng cất và lượng tử hóa làm tăng tỷ lệ lỗi từ (WER) khoảng 3%, nó mang lại tốc độ cải thiện vượt trội so với các thử nghiệm chưa tối ưu hóa và các mô hình lớn hơn như Whisper Tiny.
## KIẾN THỨC NỀN
Các mô hình nhận dạng giọng nói tự động (ASR) như Conformer kết hợp mạng thần kinh tích chập (CNN) và kiến trúc transformer để xử lý âm thanh. Để chạy các mô hình tốn tài nguyên này trên các vi điều khiển bị giới hạn phần cứng (TinyML), các nhà phát triển sử dụng phương pháp chưng cất tri thức (knowledge distillation) để chuyển giao tri thức từ mô hình lớn sang mô hình nhỏ hơn, và lượng tử hóa (quantization) để giảm độ chính xác của các giá trị số trong mô hình (ví dụ: xuống số nguyên 8-bit).