DeepSeek-V4-Flash-0731 vượt qua Fable-5 và Kimi-K3 trên bảng xếp hạng cờ vua LLM
Một biến thể mô hình mới có tên DeepSeek-V4-Flash-0731 được báo cáo là đã vượt qua các mô hình hàng đầu như Claude Fable 5 của Anthropic, Sol và Kimi-K3 của Moonshot AI trên một bài kiểm tra đánh giá năng lực chơi cờ vua. Các bài kiểm tra cờ vua đóng vai trò như một thước đo để đánh giá khả năng suy luận phức tạp, lập kế hoạch dài hạn và tuân thủ hướng dẫn của các LLM. Việc vượt qua các mô hình khổng lồ như Kimi-K3 với 2,8 nghìn tỷ tham số làm nổi bật tính hiệu quả và khả năng suy luận tiên tiến của mô hình tối ưu hóa tốc độ từ DeepSeek. Bài kiểm tra này đánh giá các LLM thông qua các ván cờ giả lập nhiều lượt, đo lường các chỉ số như tính hợp lệ của nước đi, chất lượng nước đi và tỷ lệ thắng. Mặc dù kiến trúc chính xác của DeepSeek-V4-Flash-0731 chưa được tiết lộ, hiệu suất của nó cho thấy khả năng hoạt động độc lập (agentic) mạnh mẽ trong các môi trường có cấu trúc và quy tắc nghiêm ngặt.
## KIẾN THỨC NỀN
LLM Chess là một khung đánh giá được thiết kế để kiểm tra khả năng suy luận và tuân thủ hướng dẫn của các mô hình ngôn ngữ lớn thông qua tương tác dạng tác tử (agentic) kéo dài. Các mô hình như Claude Fable 5 và Kimi-K3 đại diện cho các mô hình tiên phong hiện đại nhất, trong đó Kimi-K3 sở hữu cơ chế chú ý tuyến tính lai và quy mô lên tới 2,8 nghìn tỷ tham số.