Zhipu AI ra mắt API GLM-5.3-FlashX với tốc độ lên tới 200 token/giây
Zhipu AI đã chính thức phát hành API cho GLM-5.3-FlashX, phiên bản mô hình được tối ưu hóa mang lại tốc độ suy luận tăng cường lên tới 200 token mỗi giây. Tốc độ này đạt được nhờ tối ưu hóa hạ tầng của Zhipu trên cụm 100.000 chip AI nội địa. Tốc độ suy luận siêu nhanh đóng vai trò cốt lõi cho các ứng dụng tương tác thời gian thực, lập trình agent và xử lý quy trình sản xuất quy mô lớn. Bằng cách tăng tốc độ tạo văn bản trên nền tảng phần cứng nội địa, Zhipu AI củng cố sức cạnh tranh trên cả ba phương diện: trí tuệ, chi phí và độ trễ. GLM-5.3-Flash trước đây từng gây chú ý trong cộng đồng lập trình viên dưới mật danh thử nghiệm 'Ox Alpha' trên các nền tảng như OpenRouter. Các nhà phát triển hiện có thể gọi phiên bản tăng tốc này qua nền tảng mở của Zhipu bằng mã mô hình `GLM-5.3-FlashX`.
## KIẾN THỨC NỀN
GLM (General Language Model) là dòng mô hình ngôn ngữ lớn chủ lực do công ty AI Trung Quốc Zhipu AI (Z.ai) phát triển. GLM-5.3-Flash đã đưa vào các cải tiến kiến trúc như cơ chế chú ý kết hợp thưa và tuyến tính (hybrid sparse/linear attention) nhằm giảm đáng kể chi phí xử lý ngữ cảnh dài nhưng vẫn giữ được khả năng suy luận cao.