~/LARGE LANGUA/inclusionai-releases-ling-3-0-flash-weights-under-mit-license-on-hugging

inclusionAI Phát Hành Trọng Số Ling-3.0-flash Theo Giấy Phép MIT Trên Hugging Face

inclusionAI đã phát hành các trọng số cho Ling-3.0-flash, một mô hình Mixture of Experts (MoE) với 127,5 tỷ tham số, trên Hugging Face theo giấy phép mã nguồn mở MIT. Mô hình này hiện có sẵn ở cả định dạng BF16 (~255GB) và định dạng FP8 chính thức (~128GB). Bản phát hành này cung cấp cho cộng đồng mã nguồn mở một mô hình MoE phân mảnh mịn dưới một giấy phép thông thoáng, giúp hạ thấp rào cản triển khai cục bộ. Phiên bản FP8 chính thức cho phép người dùng có hệ thống đa GPU hoặc phần cứng bộ nhớ thống nhất chạy một mô hình lớn với yêu cầu bộ nhớ giảm đáng kể. Ling-3.0-flash sử dụng kiến trúc BailingMoeV3 với tổng cộng 512 expert (chuyên gia), trong đó chỉ có 8 expert hoạt động trên mỗi token, tương đương 5,1 tỷ tham số hoạt động. Mô hình yêu cầu thực thi mã tùy chỉnh (custom code) và hiện đang đặt ra câu hỏi về khả năng tương thích với các công cụ suy luận như llama.cpp so với vLLM và SGLang.

## KIẾN THỨC NỀN

Mixture of Experts (MoE) là một kiến trúc chỉ kích hoạt một tập hợp con các tham số (expert) của mô hình cho mỗi đầu vào, giúp cải thiện hiệu suất tính toán. Định lượng FP8 (FP8 quantization) là một kỹ thuật giảm độ chính xác của các trọng số mô hình xuống số dấu phẩy động 8-bit, giúp giảm một nửa dung lượng bộ nhớ so với độ chính xác 16-bit (BF16) và tăng tốc độ suy luận. SGLang và vLLM là các khung phục vụ (serving framework) hiệu năng cao được thiết kế để tối ưu hóa quá trình suy luận LLM.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Large Language Models#Mixture of Experts#Open Source AI#Model Release

$ subscribe --daily

inclusionAI Phát Hành Trọng Số Ling-3.0-flash Theo Giấy Phép MIT Trên Hugging Face | Daily News