Kimi K3 của Moonshot AI xếp thứ hai trên bảng xếp hạng AI Agent AA-Briefcase
Mô hình Kimi K3 của Moonshot AI đạt 1543 điểm trên công cụ đánh giá AI agent AA-Briefcase, vượt qua GPT-5.6 Sol (1501 điểm) và xếp thứ hai toàn cầu sau Claude Fable 5 (1574 điểm). Đây là bước tiến lớn so với phiên bản tiền nhiệm Kimi K2.6 vốn chỉ đạt 816 điểm trong cùng bài kiểm tra. Kết quả thử nghiệm chứng minh khả năng mạnh mẽ của Kimi K3 trong việc xử lý các quy trình công việc kinh doanh phức tạp và dài hạn, đưa các mô hình AI của Trung Quốc lên vị trí hàng đầu trong bối cảnh AI agent toàn cầu. Ngoài ra, việc Microsoft thử nghiệm Kimi K3 cho Copilot cho thấy tiềm năng cung cấp khả năng suy luận hiệu quả với chi phí tối ưu của mô hình này. Kimi K3 sở hữu 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, với mức giá 2 nhân dân tệ cho mỗi triệu token đầu vào khi khớp bộ nhớ đệm (20 nhân dân tệ khi không khớp) và 100 nhân dân tệ cho đầu ra. Công cụ đánh giá AA-Briefcase kiểm tra các mô hình qua những tác vụ doanh nghiệp thực tế phức tạp, bao gồm xử lý hàng nghìn email và tin nhắn Slack để tạo ra các mô hình Excel và bài thuyết trình PPT.
## KIẾN THỨC NỀN
AA-Briefcase là một công cụ đánh giá AI agent tiên tiến được Artificial Analysis ra mắt vào tháng 6 năm 2026. Khác với các bài kiểm tra hỏi đáp ngắn truyền thống, nó mô phỏng các dự án kinh doanh phức tạp kéo dài nhiều tuần để đánh giá khả năng xử lý công việc tri thức dài hạn của AI agent. Moonshot AI là một startup AI nổi tiếng của Trung Quốc với dòng mô hình ngôn ngữ lớn Kimi tập trung vào khả năng xử lý ngữ cảnh dài.