Mistral AI công bố Mistral Large 4 'Le Chonk' sắp phát hành trọng số mở
Mistral AI vừa công bố Mistral Large 4 với tên mã 'Le Chonk', sở hữu kiến trúc đồ sộ 1 nghìn tỷ tham số. Mô hình này sử dụng cơ chế Mixture-of-Experts với 49 tỷ tham số kích hoạt, và dự kiến sẽ phát hành trọng số mở vào cuối tháng. Đợt phát hành này củng cố vị thế của Châu Âu trong lĩnh vực phát triển AI tiên tiến và mang lại quy mô tham số chưa từng có cho cộng đồng mã nguồn mở. Bằng cách công bố trọng số mở cho một mô hình MoE 1 nghìn tỷ tham số, Mistral AI giúp các nhà phát triển và nghiên cứu tiếp cận mô hình đẳng cấp hàng đầu với chi phí suy luận hợp lý. Dù dung lượng tổng thể đạt 1 nghìn tỷ tham số, mô hình chỉ kích hoạt 49 tỷ tham số cho mỗi token trong quá trình suy luận. Thiết kế này giúp lưu trữ tri thức sâu rộng trên nhiều phần mạng chuyên biệt trong khi giữ mức sử dụng tài nguyên và độ trễ tính toán thấp hơn nhiều so với một mô hình dạng dày (dense) có cùng quy mô.
## KIẾN THỨC NỀN
Kiến trúc Mixture-of-Experts (MoE) chia mạng nơ-ron thành nhiều mạng con chuyên biệt gọi là các chuyên gia (experts), sử dụng một bộ định tuyến để chỉ gửi dữ liệu đến các chuyên gia phù hợp. Phương pháp này phân biệt giữa tổng số tham số (dung lượng lưu trữ trên bộ nhớ) và số tham số kích hoạt (số tham số thực sự xử lý mỗi lượt dữ liệu). Nhờ đó, các mô hình MoE đạt được năng lực vượt trội mà không đòi hỏi chi phí tính toán khổng lồ như các mô hình dạng dày (dense) thông thường.