Thử nghiệm Agent thực tế so sánh hiệu năng giữa MiniCPM5-2B và Spark-X2.5-4B
Một bài thử nghiệm thực tế đã so sánh MiniCPM5-2B và Spark-X2.5-4B trong nhiệm vụ agent chăm sóc khách hàng đa bước, yêu cầu xác thực cơ sở dữ liệu thực tế và gọi hàm. MiniCPM5-2B đã hoàn thành toàn bộ quy trình một cách hoàn hảo trong 8,35 giây với điểm số 100/100, trong khi Spark-X2.5-4B đạt 84/100 trong 12,60 giây do tự động dừng lại hỏi câu hỏi không cần thiết thay vì hoàn tất lịch nhận hàng. Các bài đánh giá tiêu chuẩn thường không đo lường được khả năng tự chủ hoàn thành 'chặng cuối' của mô hình—tức khả năng tự thực thi quy trình mà không chuyển giao quyết định thừa thãi cho người dùng. Thử nghiệm này chứng minh một mô hình 2B nhỏ hơn có thể vượt trội hơn mô hình 4B cả về tốc độ lẫn tính tự chủ thực thi trong các tác vụ thực tế. Bài thử nghiệm yêu cầu các mô hình xác thực thông tin đơn hàng, quy tắc kinh doanh, kiểm tra tồn kho tại kho thay thế, tính toán ngày nhận hàng chính xác và ghi dữ liệu trực tiếp vào cơ sở dữ liệu. MiniCPM5-2B giải quyết tác vụ chỉ với 527 token, trong khi Spark-X2.5-4B tiêu tốn 1.460 token và thất bại ở bước thực hiện gọi công cụ lên lịch nhận hàng.
## KIẾN THỨC NỀN
Các AI agent sử dụng tính năng gọi hàm (function calling / tool use) để truy vấn cơ sở dữ liệu và gọi API bên ngoài nhằm tự động xử lý các yêu cầu phức tạp của người dùng. MiniCPM là dòng mô hình ngôn ngữ nhỏ mã nguồn mở hiệu quả do OpenBMB phát triển cho việc triển khai cục bộ, trong khi Spark-X2.5 là mô hình ngôn ngữ nhỏ đa năng được thiết kế cho việc lập trình, sử dụng công cụ và quy trình làm việc tự động.