Công cụ nguồn mở smolbenchmark giúp chọn mô hình LLM nhỏ tối ưu cho thiết bị edge và tiêu dùng
Nhà phát triển East-Muffin-6472 đã phát hành smolbenchmark, một công cụ và tập dữ liệu nguồn mở được thiết kế để đánh giá các mô hình ngôn ngữ nhỏ (dưới 8GB) trên thiết bị edge và phần cứng cá nhân. Công cụ hiện đánh giá 13 dòng mô hình với khoảng 1.000 cấu hình trên NVIDIA Jetson Orin Nano, đo lường các chỉ số như tốc độ giải mã, hiệu suất năng lượng, độ trễ giữa các token (ITL), mức tiêu thụ điện năng và nhiệt độ. Các bảng xếp hạng LLM truyền thống hầu như chỉ tập trung vào GPU máy chủ cao cấp, khiến người dùng LLM cục bộ và AI trên thiết bị edge thiếu thông tin định hướng phù hợp với phần cứng cụ thể. Bằng cách tập trung vào chỉ số token trên mỗi joule và tác động nhiệt bên cạnh tốc độ, smolbenchmark giúp các nhà phát triển lựa chọn các mô hình tối ưu cho thiết bị dùng pin hoặc tản nhiệt thụ động như điện thoại, Raspberry Pi và máy tính nhúng. Các kết quả thử nghiệm hiện công khai dữ liệu thô và báo cáo chi tiết cho NVIDIA Jetson Orin Nano Super 8GB, trong khi hỗ trợ cho Mac mini, Raspberry Pi và điện thoại thông minh đang được tích cực hoàn thiện. Các chỉ số được đánh giá bao gồm tốc độ giải mã (tok/s), hiệu suất năng lượng (tok/J), mức tiêu thụ điện, nhiệt độ và độ trễ giữa các token (ITL).
## KIẾN THỨC NỀN
Edge AI là việc chạy các mô hình máy học trực tiếp trên phần cứng cục bộ như điện thoại thông minh, vi điều khiển hoặc máy tính nhúng như dòng NVIDIA Jetson, thay vì phụ thuộc vào máy chủ đám mây. Độ trễ giữa các token (Inter-Token Latency - ITL) đo khoảng thời gian giữa các token liên tiếp được tạo ra trong quá trình suy luận dòng của LLM, đóng vai trò là chỉ số quan trọng phản ánh phản hồi thời gian thực.