~/MACHINE LEAR/agnes-3-0-flash-a-33b-multimodal-hybrid-llm-with-262k-context

Agnes-3.0-Flash: Mô hình đa thức 33B lai kiến trúc với cửa sổ ngữ cảnh 262K

Agnes-AI đã ra mắt Agnes-3.0-Flash, một mô hình AI đa thức mở 33 tỷ tham số có khả năng xử lý văn bản, hình ảnh và video với cửa sổ ngữ cảnh lên tới 262.144 token. Mô hình áp dụng kiến trúc lai theo tỷ lệ 3:1, luân phiên giữa 54 lớp lặp lại quy tắc delta có cổng và 18 lớp chú ý toàn cục tiêu chuẩn. Các mô hình chú ý toàn cục tiêu chuẩn gặp phải gánh nặng bộ nhớ KV cache rất lớn khi xử lý các cửa sổ ngữ cảnh dài. Bằng cách chuyển giao việc theo dõi chuỗi cho các lớp quy tắc delta có cổng ở 75% cấu trúc, Agnes-3.0-Flash giảm đáng kể mức tiêu thụ bộ nhớ trong khi mở rộng dung lượng ngữ cảnh hiệu quả. Chỉ 18 trong số 72 lớp giải mã của mô hình yêu cầu bộ nhớ KV cache động, vì 54 lớp quy tắc delta có cổng sử dụng các trạng thái lặp lại có kích thước cố định không phụ thuộc vào độ dài chuỗi. Mô hình cũng tích hợp tháp thị giác 27 lớp được chiếu sang không gian 5120 chiều và sử dụng nhúng vị trí mROPE 3 trục (văn bản, chiều cao, chiều rộng) cho dữ liệu đa thức.

## KIẾN THỨC NỀN

Kiến trúc Transformer truyền thống dựa vào cơ chế tự chú ý toàn cục, trong đó dung lượng bộ nhớ tăng tuyến tính theo độ dài văn bản nhập vào, tạo ra nghẽn cổ chai phần cứng khi tạo nội dung dài. Kiến trúc lai giải quyết vấn đề này bằng cách kết hợp cơ chế chú ý toàn cục với chú ý tuyến tính hoặc các cơ chế lặp lại (như quy tắc delta có cổng), giúp duy trì mức sử dụng bộ nhớ ổn định trên phần lớn các lớp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Machine Learning#LLM#Model Architecture#Multimodal AI#Open Source AI

$ subscribe --daily

Agnes-3.0-Flash: Mô hình đa thức 33B lai kiến trúc với cửa sổ ngữ cảnh 262K | Daily News