~/EDGE AI/cactus-releases-needle-2-a-14mb-agentic-llm-for-edge-devices

Cactus phát hành Needle 2, mô hình LLM tự trị 14MB cho thiết bị biên

Cactus đã phát hành Needle 2, một mô hình LLM tự trị (agentic LLM) với 45 triệu tham số được nén xuống 2-bit, nằm gọn trong một tệp nhị phân 14MB và chạy trong phạm vi 28MB RAM. Mô hình này được tối ưu hóa cho việc gọi công cụ (tool calling), điều khiển thiết bị và trích xuất cấu trúc trên các phần cứng hạn chế tài nguyên như điện thoại giá rẻ và vi điều khiển. Mô hình này cho phép thực thi AI cục bộ tốc độ cao trên hàng tỷ thiết bị IoT và thiết bị biên cấu hình thấp không có NPU, mang lại một giải pháp thay thế tiết kiệm năng lượng vượt trội so với các mô hình lớn hơn. Bằng cách giảm đáng kể yêu cầu về bộ nhớ và tính toán, nó giúp các tính năng tự trị luôn bật trên thiết bị trở nên thực tế và tiết kiệm chi phí. Needle 2 đạt tốc độ lên tới 500 token/giây trên Raspberry Pi 5 và chỉ tiêu thụ 70 MFLOPs mỗi token nhờ sử dụng Mạng chú ý đơn giản (Simple Attention Networks) loại bỏ hoàn toàn các bộ cảm biến đa lớp (MLP). Nó cũng tích hợp hệ thống chấm điểm độ tin cậy để chuyển tiếp các truy vấn phức tạp lên các mô hình đám mây lớn hơn khi cần thiết.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn (LLM) truyền thống yêu cầu hàng gigabyte bộ nhớ và sức mạnh tính toán lớn, khiến chúng khó chạy cục bộ trên các thiết bị biên như thiết bị gia dụng thông minh hoặc điện thoại giá rẻ. Các LLM tự trị (agentic LLM) tập trung vào việc gọi công cụ và ánh xạ hàm, cho phép chúng thực hiện các tác vụ cụ thể bằng cách tương tác với các API bên ngoài thay vì phụ thuộc vào tri thức thế giới được lưu trữ bên trong mô hình.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Edge AI#TinyML#Local LLMs#Model Compression#Embedded Systems

$ subscribe --daily

Cactus phát hành Needle 2, mô hình LLM tự trị 14MB cho thiết bị biên | Daily News