Cactus Compute ra mắt Needle 3: Mô hình siêu nhỏ gọn để tự động hóa trên thiết bị
Cactus Compute đã phát hành Needle 3, một mô hình nền tảng 121 triệu tham số có thể cắt nhỏ với dung lượng từ 8–29MB, được tối ưu hóa riêng cho việc gọi hàm và trích xuất dữ liệu có cấu trúc trên thiết bị. Bằng cách loại bỏ hoàn toàn khả năng trò chuyện thông thường, mô hình đạt hiệu suất ấn tượng trên các tác vụ điều khiển thiết bị, tương đương hoặc vượt trội so với các mô hình lớn hơn gấp 10 lần như DeepSeek V4 Flash. Needle 3 chứng minh rằng các kiến trúc siêu nhẹ và chuyên biệt hóa cao có thể thực thi tự động hóa và gọi công cụ hoàn toàn ngoại tuyến mà không cần API đám mây đắt đỏ hay thiết bị yêu cầu RAM lớn. Hướng đi này giúp giảm đáng kể độ trễ, chi phí tính toán và mức tiêu thụ bộ nhớ cho các ứng dụng AI trên di động và thiết bị biên trong khi vẫn bảo vệ quyền riêng tư. Mô hình thay thế các lớp feed-forward dày đặc bằng Monarch Hadamard MLP và lưu trữ 70,8 triệu tham số trong các bảng n-gram băm (engram), cho phép mô hình 121 triệu tham số hoạt động với khối lượng tính toán chỉ bằng mô hình 50 triệu tham số (100 MFLOPs mỗi token). Ngoài ra, nó đảm bảo đầu ra JSON luôn hợp lệ nhờ sử dụng ngữ pháp mức byte được biên dịch trực tiếp từ định nghĩa của công cụ.
## KIẾN THỨC NỀN
Gọi hàm (function calling) cho phép các mô hình ngôn ngữ dịch các yêu cầu bằng ngôn ngữ tự nhiên thành các dữ liệu có cấu trúc mà ứng dụng hoặc API hệ thống có thể thực thi trực tiếp. Các mô hình nền tảng thông thường thường cần hàng tỷ tham số để vừa duy trì khả năng trò chuyện vừa gọi hàm, khiến chúng trở nên quá nặng và chậm khi triển khai trực tiếp trên thiết bị cá nhân.