~/LLMS/aleph-alpha-releases-kolibri-1-open-source-78b-moe-model-with-1m

Aleph Alpha ra mắt Kolibri-1: Mô hình MoE 78B mã nguồn mở với cửa sổ ngữ cảnh 1M token

Phòng nghiên cứu AI Aleph Alpha của Đức đã phát hành Kolibri-1, một mô hình ngôn ngữ mã nguồn mở sử dụng kiến trúc Mixture-of-Experts (MoE) với tổng cộng 78 tỷ tham số và 3,46 tỷ tham số kích hoạt cho mỗi token. Mô hình được phân phối theo giấy phép tự do Apache 2.0 và hỗ trợ độ dài ngữ cảnh lên tới 1 triệu token. Bằng cách chỉ kích hoạt 3,46 tỷ tham số trong quá trình suy luận, Kolibri-1 giảm đáng kể yêu cầu bộ nhớ và chi phí phần cứng trong khi vẫn xử lý được ngữ cảnh cực dài. Mô hình cung cấp cho các nhà phát triển một lựa chọn trọng số mở mạnh mẽ, được tối ưu hóa cho các ứng dụng tiếng Anh và tiếng Đức. Kolibri-1 tích hợp các chế độ suy luận rõ ràng và khả năng gọi công cụ (tool calling) bên cạnh kiến trúc định tuyến thưa. Dung lượng tham số kích hoạt nhỏ giúp tốc độ sinh văn bản nhanh hơn đáng kể và đạt băng thông xử lý cao hơn trên mỗi GPU so với các mô hình dày (dense) thông thường có cùng tổng số tham số.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là một kiến trúc điều hướng các token đầu vào đến các tập hợp tham số con được gọi là chuyên gia (experts), thay vì tính toán trên toàn bộ mạng lưới cho từng token. Phương pháp này giúp các mô hình ngôn ngữ mở rộng dung lượng tri thức mà không làm tăng tương ứng chi phí tính toán cần thiết trong quá trình suy luận.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#LLMs#Open Source AI#Mixture of Experts#Aleph Alpha#Machine Learning

$ subscribe --daily

Aleph Alpha ra mắt Kolibri-1: Mô hình MoE 78B mã nguồn mở với cửa sổ ngữ cảnh 1M token | Daily News