Inspur Ra Mắt Siêu Nút Yuanbrain SD200 Ultra Cho Mô Hình LLM 2,8 Nghìn Tỷ Tham Số
Inspur Information đã công bố siêu nút AI Yuanbrain SD200 Ultra, tích hợp 128 chip AI nội địa cùng 8TB VRAM dùng chung để vận hành các mô hình 2,8 nghìn tỷ tham số như Kimi K3 trên một máy duy nhất. Hệ thống đạt độ trễ tạo token dưới 5,85 miligiây, mang lại tốc độ 170 token/giây cho một người dùng. Khi các mô hình AI tiên phong mở rộng lên quy mô hàng nghìn tỷ tham số và quy trình công việc của Agent ngày càng phức tạp, điểm nghẽn bộ nhớ và độ trễ tích lũy trở thành thách thức cốt lõi. Việc đạt độ trễ token dưới 6ms trên phần cứng nội địa Trung Quốc thể hiện bước tiến lớn trong kết nối siêu máy tính mật độ cao và sự tự chủ phần cứng AI. SD200 Ultra sử dụng kiến trúc 3D Hyper Mesh với 64TB bộ nhớ hệ thống, đạt độ trễ giao tiếp ngữ nghĩa bộ nhớ nguyên bản chỉ 0,69 microgiây và giảm 3,5 lần thời gian giao tiếp AllReduce nhờ truy cập VRAM GPU trực tiếp qua các miền máy chủ. Ngoài ra, tối ưu hóa phần mềm dành riêng cho Kimi K3 giúp hợp nhất các toán tử cơ bản, giảm 10 lần số lượng toán tử và tăng hiệu suất suy luận hơn 3 lần.
## KIẾN THỨC NỀN
Suy luận mô hình ngôn ngữ lớn đòi hỏi dung lượng bộ nhớ đồ họa khổng lồ để lưu trữ cả trọng số mô hình lẫn KV Cache, vốn chứa các trạng thái chú ý trung gian nhằm tránh tính toán lại không cần thiết. Khi kích thước mô hình tăng lên hàng nghìn tỷ tham số, mạng đa nút truyền thống tạo ra độ trễ liên máy chủ nghiêm trọng, khiến các kiến trúc đơn nút hợp nhất với liên kết độ trễ cực thấp trở nên thiết yếu.