~/LLM/yandex-releases-aliceai-foundation-80b-a3b-an-open-weights-80b-base-model

Yandex Ra Mắt AliceAI-Foundation-80B-A3B, Mô Hình Cơ Sở 80B Mã Nguồn Mở

Công ty công nghệ Yandex đã mở nguồn mô hình AliceAI-Foundation-80B-A3B-Base theo giấy phép Apache 2.0 trên Hugging Face. Được huấn luyện hoàn toàn từ đầu, mô hình cơ sở 80 tỷ tham số này sử dụng kiến trúc Mixture-of-Experts (MoE) tùy chỉnh với chỉ khoảng 3 tỷ tham số kích hoạt trên mỗi token. Việc phát hành này bổ sung cho hệ sinh thái mã nguồn mở một họ mô hình lớn mới không phụ thuộc vào kiến trúc Llama tiêu chuẩn. Số lượng tham số tổng thể lớn kết hợp với lượng tham số kích hoạt thấp giúp mô hình suy luận hiệu quả mà vẫn mang lại hiệu suất cạnh tranh cao cho các tác vụ đa ngôn ngữ. Mô hình có cửa sổ ngữ cảnh 256K token và được phát hành dưới dạng mô hình cơ sở thuần túy chưa qua giai đoạn hậu huấn luyện hay tinh chỉnh chỉ dẫn. Do sử dụng kiến trúc tùy chỉnh hoàn toàn, các khung suy luận phổ biến như llama.cpp hiện chưa hỗ trợ sẵn mô hình này.

## KIẾN THỨC NỀN

Trong kiến trúc Mixture-of-Experts (MoE), tổng số tham số đại diện cho dung lượng chung của mô hình, còn tham số kích hoạt (ký hiệu là 'A3B') là phần tham số thực sự được tính toán cho mỗi token trong quá trình suy luận. Mô hình cơ sở (base model) được tiền huấn luyện trên tập dữ liệu văn bản khổng lồ để dự đoán token tiếp theo và thường cần qua tinh chỉnh hoặc căn chỉnh trước khi dùng làm trợ lý trò chuyện.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llm#open-weights#ai-models#machine-learning

$ subscribe --daily

Yandex Ra Mắt AliceAI-Foundation-80B-A3B, Mô Hình Cơ Sở 80B Mã Nguồn Mở | Daily News