Terminal Bench 4.0 Ra Mắt: GLM-5.3 Đạt Hiệu Năng Ngang Ngửa Fable 5
Terminal Bench 4.0 đã chính thức ra mắt, cho thấy mô hình GLM-5.3 đạt hiệu năng ngang ngửa với Fable 5 trong phạm vi sai số cho phép. Bản cập nhật này tập trung vào việc cải tiến nhanh chóng nhằm đối phó với tình trạng bão hòa của các bài đánh giá dành cho tác nhân lập trình AI. Sự kiện này làm nổi bật sự tiến bộ nhanh chóng của các mô hình trọng số mở như GLM-5.3 trong việc xử lý các tác vụ terminal phức tạp. Đồng thời, nó cũng chỉ ra thách thức thực tế về chi phí token cực kỳ lớn khi vận hành các bài đánh giá tác nhân quy mô lớn. Terminal Bench kiểm tra các mô hình AI thông qua các tác vụ terminal phức tạp được chạy trong môi trường container hóa, bao gồm lệnh shell, gỡ lỗi và quy trình CLI nhiều bước. Tuy nhiên, việc chạy các bài đánh giá này đòi hỏi từ 5 đến 10 tỷ token, gây khó khăn về mặt chi phí và tài nguyên đối với phần lớn các nhà phát triển.
## KIẾN THỨC NỀN
Terminal Bench là một hệ thống đánh giá hiệu năng được thiết kế để đo lường khả năng của các tác nhân AI trong môi trường dòng lệnh. Trong khi đó, GLM-5.3 là mô hình ngôn ngữ lớn hàng đầu do công ty Z.ai của Trung Quốc phát triển, hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token và luôn hoạt động ở chế độ kích hoạt khả năng lập luận.