~/ARTIFICIAL I/deepseek-reportedly-training-2-trillion-parameter-model-with-plans-for-8-trillion

DeepSeek Rò Rỉ Thông Tin Đang Huấn Luyện Mô Hình 2 Nghìn Tỷ Tham Số Và Kế Hoạch Cho Mô Hình 8 Nghìn Tỷ

Các báo cáo chưa được xác minh trên mạng xã hội cho biết DeepSeek hiện đang huấn luyện một mô hình ngôn ngữ lớn 2 nghìn tỷ tham số, với tham vọng dài hạn là mở rộng lên mô hình 8 nghìn tỷ tham số. Sau những đột phá gần đây của DeepSeek về hiệu quả chi phí huấn luyện AI, việc tiến lên quy mô hàng nghìn tỷ tham số cho thấy tham vọng cạnh tranh trực tiếp với các phòng thí nghiệm AI hàng đầu thế giới. Nếu trở thành hiện thực, việc mở rộng quy mô này có thể nâng cao đáng kể năng lực của các kiến trúc AI mã nguồn mở. Các báo cáo này dựa trên thiết kế Mixture-of-Experts (MoE) hiện có của DeepSeek, nơi tổng số lượng tham số rất cao nhưng số tham số kích hoạt trên mỗi token vẫn ở mức thấp hơn nhiều để duy trì hiệu suất suy luận. Tuy nhiên, những thông tin này xuất phát từ tin đồn chưa được xác minh và hiện thiếu tài liệu kỹ thuật hoặc kết quả thử nghiệm chính thức từ DeepSeek.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn thường sử dụng kiến trúc Mixture-of-Experts (MoE), thay thế các mạng lan truyền tiến tiêu chuẩn bằng nhiều mạng con chuyên biệt gọi là các 'chuyên gia'. Trong quá trình suy luận, bộ định tuyến chỉ kích hoạt một tập hợp nhỏ các chuyên gia này cho mỗi token, cho phép mô hình sở hữu hàng nghìn tỷ tổng tham số nhưng vẫn vận hành với tốc độ và chi phí bộ nhớ của một mô hình nhỏ hơn nhiều.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#artificial-intelligence#large-language-models#deepseek#ai-scaling

$ subscribe --daily

DeepSeek Rò Rỉ Thông Tin Đang Huấn Luyện Mô Hình 2 Nghìn Tỷ Tham Số Và Kế Hoạch Cho Mô Hình 8 Nghìn Tỷ | Daily News