DeepSeek v4 Flash Vượt Trội Về Tốc Độ và Chi Phí Trong Các Tác Vụ Agentic
Một thử nghiệm thực tế đối với ba mô hình trọng số mở nổi bật gồm DeepSeek v4 flash, GLM 5.2 và Kimi K3 cho thấy DeepSeek v4 flash nhanh và tiết kiệm chi phí hơn đáng kể trong các quy trình làm việc agentic phức tạp, đa ứng dụng. Mặc dù tiêu thụ nhiều token hơn trung bình, DeepSeek hoàn thành tác vụ trong 164 giây với chi phí chỉ khoảng 0,08 USD cho mỗi tác vụ, trong khi vẫn duy trì tỷ lệ thành công tương đương với các đối thủ. So sánh này làm nổi bật rằng các mô hình nhẹ, nhanh và tối ưu chi phí có thể thực hiện các quy trình agentic với tỷ lệ thành công gần bằng các mô hình hàng đầu (frontier models) nhưng với chi phí cực kỳ thấp. Điều này báo hiệu một xu hướng mới nơi các nhà phát triển có thể xây dựng các AI agent hiệu quả cao bằng cách sử dụng các mô hình trọng số mở mà không cần đánh đổi hiệu năng. Đánh giá này đã sử dụng Pi Agent làm khung vận hành kết hợp với Composio MCP để truy cập các ứng dụng bên ngoài như Slack, Gmail và HubSpot, yêu cầu tất cả các kiểm tra xác định phải vượt qua để được tính là thành công. Mặc dù DeepSeek v4 flash có chi phí thấp nhất (0,08 USD) và thời gian nhanh nhất (164 giây), đây lại là mô hình tiêu tốn nhiều token nhất với trung bình 569k token mỗi tác vụ so với 409k token của GLM 5.2.
## KIẾN THỨC NỀN
Quy trình làm việc agentic (agentic workflows) liên quan đến việc các AI agent thực hiện các tác vụ tự động, nhiều bước trên nhiều ứng dụng phần mềm khác nhau thay vì chỉ tạo văn bản. Để tương tác với các công cụ và nguồn dữ liệu bên ngoài này, các nhà phát triển sử dụng các khung như Composio và các tiêu chuẩn mở như Model Context Protocol (MCP), một giao thức do Anthropic giới thiệu nhằm chuẩn hóa cách các LLM kết nối với các hệ thống bên ngoài.