~/LLM/open-weight-release-of-glm-5-3-flash-with-hybrid-sparse-linear

Phát hành mã nguồn mở GLM-5.3-Flash với kiến trúc chú ý lai Sparse-Linear

Z.ai đã phát hành GLM-5.3-Flash (trước đây gọi là ox-alpha), một mô hình đa phương thức bản địa mã nguồn mở với 320 tỷ tham số, sở hữu kiến trúc chú ý lai sparse-linear mới. Mô hình này được huấn luyện trên tập dữ liệu đa phương thức 30 nghìn tỷ token và được cho là vượt trội hơn GLM-5.2 với chi phí vận hành chỉ bằng một phần mười. Bản phát hành này giới thiệu các cải tiến kiến trúc tiên tiến như Kimi Delta Attention (KDA) và Manifold-Constrained Hyper-Connections (mHC) tới cộng đồng mã nguồn mở, giúp giảm đáng kể chi phí vận hành ngữ cảnh dài và dung lượng KV cache. Nó chứng minh rằng các mô hình đa phương thức quy mô lớn, hiệu quả cao có thể hoạt động tiết kiệm chi phí trong khi vẫn đạt hiệu năng tiệm cận các mô hình thương mại trong các tác vụ lập trình và tác nhân (agentic). Mô hình sử dụng cấu trúc 45 lớp lặp lại các khối gồm ba lớp chú ý tuyến tính KDA tiếp nối bởi một lớp chú ý thưa kiểu DeepSeek, kích hoạt 18 tỷ trong tổng số 320 tỷ tham số thông qua thiết kế hỗn hợp chuyên gia (MoE). Nó hỗ trợ chiều dài ngữ cảnh lên tới 1.048.576 token, đi kèm đầu dự đoán đa token (MTP) để giải mã suy đoán và được tối ưu hóa cho suy luận FP8.

## KIẾN THỨC NỀN

Các mô hình Transformer truyền thống gặp phải gánh nặng lớn về tính toán và bộ nhớ, đặc biệt là sự phình to của KV cache, khi xử lý ngữ cảnh dài. Để giải quyết vấn đề này, Kimi Delta Attention (KDA) cung cấp cơ chế chú ý tuyến tính tối ưu hóa phần cứng với cổng kiểm soát chi tiết, trong khi Manifold-Constrained Hyper-Connections (mHC) giúp ổn định quá trình huấn luyện mạng sâu bằng cách giới hạn các kết nối dư (residual connections) vào một đa tạp cụ thể.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLM#Open-Source AI#Model Architecture#Deep Learning

$ subscribe --daily

Phát hành mã nguồn mở GLM-5.3-Flash với kiến trúc chú ý lai Sparse-Linear | Daily News