Nhà phát triển chạy thành công LLM 28 triệu tham số cục bộ trên Amazon Echo Dot 2
Một nhà phát triển đã cổng thành công llama.cpp và Sherpa-ONNX lên Amazon Echo Dot 2, cho phép chạy một quy trình xử lý giọng nói hoàn toàn cục bộ với LLM 28 triệu tham số. Hệ thống này thực hiện chuyển đổi giọng nói thành văn bản và phân tích ý định ngoại tuyến trực tiếp trên phần cứng hạn chế của chiếc loa thông minh đời cũ. Dự án này chứng minh tính khả thi của việc tái sử dụng các thiết bị nhà thông minh đời cũ, cấu hình thấp thành các trợ lý giọng nói riêng tư và không cần đám mây. Nó cho thấy các kỹ thuật AI biên (edge AI) có thể hồi sinh phần cứng lỗi thời, giúp giảm thiểu rác thải điện tử và tăng cường quyền riêng tư của người dùng. Chạy trên bộ xử lý ARMv7 với RAM chỉ 512MB, hệ thống đạt tốc độ tạo khoảng 4 token/giây nhờ duy trì llama-server thường trú trong bộ nhớ và sử dụng bộ đệm prompt (prompt caching) để giảm độ trễ từ 17 giây xuống còn 2,3 giây. Mô hình được giới hạn để chỉ xuất ra các hành động JSON đơn giản thay vì văn bản hội thoại nhằm duy trì khả năng sử dụng thực tế.
## KIẾN THỨC NỀN
llama.cpp là một thư viện mã nguồn mở viết bằng C/C++ phổ biến, được thiết kế để suy luận LLM hiệu quả trên phần cứng tiêu dùng và phần cứng bị giới hạn tài nguyên. Các loa thông minh như Amazon Echo Dot thường phụ thuộc vào máy chủ đám mây để xử lý lệnh thoại, điều này gây ra lo ngại về quyền riêng tư và khiến các mẫu loa cũ trở nên lỗi thời khi không còn được hỗ trợ chính thức.