Mistral AI ra mắt bản xem trước Mistral Large 4 với 1 nghìn tỷ tham số
Mistral AI đã công bố phiên bản xem trước qua API cho Mistral Large 4, một mô hình suy luận theo kiến trúc Hỗn hợp chuyên gia (MoE) với tổng cộng 1 nghìn tỷ tham số được huấn luyện trên 3.800 GPU NVIDIA Grace Blackwell. Công ty có kế hoạch phát hành phiên bản trọng số mở vào cuối tháng. Đợt phát hành này đánh dấu bước tiến lớn của Mistral AI, thu hẹp khoảng cách với các mô hình hàng đầu thế giới đồng thời tái khẳng định cam kết với các mô hình nền tảng trọng số mở. Nó mang đến cho các nhà phát triển và nghiên cứu cơ hội tiếp cận năng lực suy luận quy mô lớn mà không bị phụ thuộc vào các hệ sinh thái khép kín. Mặc dù sở hữu tổng cộng 1 nghìn tỷ tham số, mô hình chỉ kích hoạt 49 tỷ tham số cho mỗi token trong quá trình xử lý, và API hiện hỗ trợ hai mức độ suy luận ('none' và 'high'). Trên hệ thống đánh giá Artificial Analysis, Mistral Large 4 đạt 38 điểm, vượt trội hoàn toàn so với con số 9 điểm của Mistral Large 3.
## KIẾN THỨC NỀN
Hỗn hợp chuyên gia (MoE) là kiến trúc mạng nơ-ron chia các tham số thành nhiều mạng con chuyên biệt, chỉ kích hoạt một tập hợp nhỏ cho mỗi token nhằm giảm chi phí tính toán khi suy luận trong khi vẫn duy trì dung lượng mô hình cực lớn. Các mô hình suy luận phát triển từ mô hình ngôn ngữ tiêu chuẩn bằng cách tích hợp quá trình tư duy từng bước (như chuỗi tư duy) để giải quyết các tác vụ phân tích hoặc lập trình phức tạp trước khi đưa ra kết quả cuối cùng.