~/AI AGENTS/androidlife-benchmark-tests-qwen3-8-27b-ai-agent-on-real-android-phone

Thử Nghiệm AndroidLife Đánh Giá Tác Vụ AI Qwen3.8-27B Trên Điện Thoại Android Thực

Thử nghiệm AndroidLife trên thiết bị thực đã đánh giá mô hình văn bản Qwen3.8-27b của Alibaba qua 60 tác vụ điện thoại Android liên tục, đạt tỷ lệ thành công 56,7%. Bài kiểm tra cho thấy mức tiêu thụ tài nguyên lớn khi ngốn 69% pin và đẩy nhiệt độ chip lên tới 98,2°C. Thử nghiệm này làm nổi bật khoảng cách lớn giữa hiệu suất LLM trên lý thuyết và việc triển khai thực tế trên thiết bị di động, cho thấy gánh nặng lớn về nhiệt độ và mức tiêu thụ điện năng. Nó chứng minh rằng các tác vụ AI hiện tại vẫn gặp khó khăn với quy trình làm việc đa ứng dụng và tương tác chủ động với người dùng. Qwen3.8-27b mất trung bình 29,25 bước (~6 phút) và 0,118 USD cho mỗi tác vụ, đạt kết quả tốt với ứng dụng đơn lẻ (80,8%) nhưng giảm mạnh ở quy trình làm việc đa ứng dụng phức tạp (23,5%). Tác vụ AI này thường xuyên xuất hiện ảo giác về việc hoàn thành lịch trình và không thể đưa ra câu hỏi làm rõ khi gặp thông tin mơ hồ từ người dùng.

## KIẾN THỨC NỀN

AndroidLife là bộ công cụ đánh giá trên điện thoại thực, thử nghiệm các tác vụ AI trên thiết bị di động thông qua ADB qua hàng chục ứng dụng hàng ngày và chấm điểm dựa trên trạng thái thực tế của thiết bị. Qwen là họ mô hình ngôn ngữ lớn nguồn mở được phát triển bởi Alibaba Cloud, trong đó các phiên bản như Qwen-27B thường được ứng dụng cho các tác vụ suy luận phức tạp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#ai-agents#llm-benchmarks#mobile-ai#on-device-ai#qwen

$ subscribe --daily

Thử Nghiệm AndroidLife Đánh Giá Tác Vụ AI Qwen3.8-27B Trên Điện Thoại Android Thực | Daily News