NVIDIA phát hành mô hình Nemotron-3.5-Lightning-30B trên Hugging Face
NVIDIA đã phát hành mô hình NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 trên Hugging Face. Mô hình này được tối ưu hóa cho tốc độ suy luận nhanh, sở hữu tổng cộng 30 tỷ tham số nhưng chỉ có 3 tỷ tham số hoạt động. Sự ra mắt này đánh dấu một bước tiến quan trọng trong các mô hình Hỗn hợp Chuyên gia (MoE) thưa thớt, cho phép cộng đồng chạy LLM cục bộ vận hành một mô hình mạnh mẽ với chi phí tính toán tối thiểu. Nó mang lại sự cân bằng giữa dung lượng lớn và yêu cầu tài nguyên thấp cho phần cứng tiêu dùng. Mô hình sử dụng định dạng dữ liệu BF16 (bfloat16) để tăng tốc hiệu suất suy luận trong khi vẫn duy trì tính ổn định số học. Với chỉ 3 tỷ tham số hoạt động (A3B) trên mỗi token, mô hình giảm đáng kể băng thông bộ nhớ và năng lượng tính toán cần thiết trong quá trình tạo văn bản.
## KIẾN THỨC NỀN
Nemotron của NVIDIA là một dòng mô hình AI mã nguồn mở được thiết kế cho các tác vụ suy luận, lập trình và ứng dụng tác tử (agentic). Kiến trúc Hỗn hợp Chuyên gia (MoE) mở rộng quy mô mô hình bằng cách định tuyến đầu vào đến các mạng con "chuyên gia" cụ thể, nghĩa là chỉ một phần nhỏ trong tổng số tham số (tham số hoạt động) được tính toán cho mỗi đầu vào. BF16 là định dạng dấu phẩy động 16-bit cung cấp dải động rộng hơn so với FP16 tiêu chuẩn, giúp nó trở nên lý tưởng cho học sâu.