Alibaba ra mắt Qwen3.8-Flash cho Qwen Office, tăng tốc độ và giảm chi phí Token
Alibaba đã tích hợp mô hình Qwen3.8-Flash mới ra mắt vào trợ lý Qwen Office, đồng thời giới thiệu "Chế độ Tiêu chuẩn" được thiết kế để xử lý 95% tác vụ hàng ngày. Bản cập nhật này giúp tăng 100% tốc độ tạo tác vụ đơn lẻ và giảm trung bình 75% lượng tiêu thụ token. Sự kiện này làm nổi bật xu hướng tối ưu hóa các mô hình ngôn ngữ lớn (LLM) và tác nhân AI (AI Agent) để phục vụ các quy trình làm việc thực tế với chi phí tối ưu. Bằng cách cải thiện hiệu suất và giảm chi phí, giải pháp này giúp vượt qua thế tiến thoái lưỡng nan giữa hiệu năng, tốc độ và chi phí vận hành trong các ứng dụng agent. Phiên bản Qwen3.8-Flash dành riêng cho văn phòng sở hữu hàng trăm tỷ tham số và được tối ưu hóa đặc biệt cho việc lập kế hoạch nhiều bước, lựa chọn công cụ và nén ngữ cảnh. Mô hình này tận dụng kiến trúc Harness tùy chỉnh và tối ưu hóa suy luận để đạt được thông lượng cao cùng hiệu năng được cho là vượt qua Claude Opus 4.6.
## KIẾN THỨC NỀN
Trong quy trình làm việc của tác nhân AI, "agent harness" đóng vai trò là môi trường thực thi bao bọc mô hình ngôn ngữ, quản lý cách mô hình tương tác với các công cụ bên ngoài, xử lý gợi ý (prompt) và kết quả. Việc tối ưu hóa sự phối hợp giữa LLM và harness là rất quan trọng để xây dựng các trợ lý AI nhanh chóng, đáng tin cậy và tiết kiệm chi phí, có khả năng thực hiện các tác vụ phức tạp gồm nhiều bước.