Tencent Hunyuan cập nhật mô hình Hy4 preview giúp giảm lượng token tiêu thụ và số lượt suy luận
Tencent Hunyuan cùng đội ngũ WorkBuddy đã phát hành bản cập nhật tối ưu hóa cho mô hình Hy4 preview nhằm giải quyết tình trạng tự xác minh quá đà và chu kỳ suy nghĩ kéo dài khi xử lý tác vụ phức tạp. Đánh giá qua bộ kiểm thử benchmark và thử nghiệm thực tế xác nhận bản nâng cấp giảm đáng kể số lượt thực thi tác vụ lẫn lượng token đầu vào/đầu ra mà không làm giảm hiệu quả công việc. Lượng token tiêu thụ lớn và các vòng lặp suy luận thừa là điểm nghẽn chi phí và độ trễ chính đối với các hệ thống AI agent cũng như mô hình suy luận nâng cao. Bằng cách tinh chỉnh hiệu suất tính toán khi suy luận, Tencent giúp giảm chi phí vận hành và tăng tốc độ xử lý cho các quy trình làm việc đa bước của AI agent. Mô hình Hy4 preview có tổng cộng 770 tỷ tham số, 49 tỷ tham số kích hoạt và cửa sổ ngữ cảnh lên tới 1 triệu token. Đợt tối ưu hóa gần đây tập trung đặc biệt vào các kịch bản tác vụ văn phòng hằng ngày và hệ thống đa agent trên nền tảng WorkBuddy của Tencent.
## KIẾN THỨC NỀN
Tencent Hunyuan là bộ mô hình ngôn ngữ lớn chủ lực của Tencent, trong khi WorkBuddy là nền tảng AI agent do Tencent Cloud phát triển nhằm tự động hóa các quy trình công việc đa bước. Các mô hình LLM nâng cao thường sử dụng cơ chế tự kiểm tra khi suy luận để tăng độ chính xác, nhưng nếu không được tối ưu, quá trình này dễ phát sinh các vòng lặp kiểm tra dư thừa làm tiêu tốn nhiều token.