Chạy mô hình AI 28,9 triệu tham số trên vi điều khiển ESP32-S3
Nhà phát triển Slava S đã triển khai thành công một mô hình AI cục bộ với 28,9 triệu tham số trên vi điều khiển ESP32-S3. Thành tựu này đạt được nhờ sử dụng kỹ thuật lượng tử hóa 4-bit và lưu trữ bảng nhúng của mô hình trong bộ nhớ flash 16MB của thiết bị. Đây là một cột mốc quan trọng đối với TinyML, giúp tăng đáng kể giới hạn kích thước mô hình trên phần cứng hạn chế tài nguyên so với giới hạn trước đó là 260.000 tham số. Nó mở ra những khả năng mới cho việc chạy các ứng dụng AI ngoại tuyến chuyên biệt trực tiếp trên các thiết bị biên chi phí thấp. Dự án sử dụng kỹ thuật Nhúng theo từng lớp (Per-Layer Embeddings - PLE) của Google Gemma để chỉ đọc một lượng nhỏ dữ liệu từ bộ nhớ flash cho mỗi token được tạo ra. Mặc dù mô hình không thể hỗ trợ các tác vụ phức tạp như trò chuyện hay lập trình, nó được thiết kế cho các tác vụ điều khiển ngoại tuyến, chẳng hạn như tối ưu hóa các thông số pha cà phê.
## KIẾN THỨC NỀN
TinyML tập trung vào việc chạy các mô hình học máy trên các vi điều khiển năng lượng thấp như ESP32-S3, vốn thường có bộ nhớ rất hạn chế (ví dụ: 8MB PSRAM và 512KB SRAM). Lượng tử hóa mô hình giúp giảm độ chính xác của các trọng số (ví dụ: xuống 4-bit) để thu nhỏ dung lượng bộ nhớ, trong khi kỹ thuật Nhúng theo từng lớp (PLE) cho phép các lớp truy cập các bản nhúng cụ thể mà không cần tải toàn bộ bảng vào RAM hoạt động.