~/AI INFRASTRU/china-announces-domestic-gpu-and-neuromorphic-chip-hybrid-llm-inference-system

Trung Quốc ra mắt hệ thống suy luận LLM hỗn hợp kết hợp GPU và chip mô phỏng não

Các nhà nghiên cứu và doanh nghiệp Trung Quốc đã ra mắt hệ thống suy luận LLM hỗn hợp đầu tiên kết hợp GPU nội địa và chip mô phỏng não. Thử nghiệm trên mô hình DeepSeek cho thấy hệ thống giúp tăng gấp đôi hiệu quả chi phí và giảm hơn 40% chi phí vận hành so với các cụm GPU nội địa thông thường. Phương pháp tính toán hỗn hợp này giải quyết điểm nghẽn băng thông bộ nhớ trong suy luận LLM bằng cách chuyển các mô-đun tốn bộ nhớ sang phần cứng lưu trữ tích hợp tính toán chuyên dụng. Hệ thống cung cấp một nền tảng phần cứng hoàn toàn nội địa cho các ứng dụng AI nhạy cảm với độ trễ như hệ thống đa tác tử và tạo mã thời gian thực. Hệ thống phân bổ các lớp Attention nặng về tính toán cho GPU nội địa, đồng thời chuyển các lớp Feed-Forward Network (FFN/MoE) giới hạn bởi bộ nhớ sang chip mô phỏng não có bộ nhớ SRAM dung lượng lớn trên chip. Việc phân tách tác vụ, điều phối và hợp nhất kết quả được quản lý bởi trình biên dịch mô hình tự phát triển, giao thức kết nối tốc độ cao và động cơ suy luận hợp nhất.

## KIẾN THỨC NỀN

Suy luận LLM bao gồm hai dạng tính toán chính: cơ chế Attention đòi hỏi năng lực xử lý dấu phẩy động cao, trong khi các mạng Feed-Forward (FFN) phụ thuộc lớn vào băng thông bộ nhớ để tải tham số trọng số. Chip mô phỏng não với kiến trúc lưu trữ tích hợp tính toán (processing-in-memory) kết hợp đơn vị tính toán và lưu trữ dữ liệu trên cùng một vi mạch, giúp loại bỏ năng lượng tiêu hao và độ trễ phát sinh từ việc truyền dữ liệu giữa bộ xử lý và bộ nhớ ngoài.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Infrastructure#LLM Inference#Heterogeneous Computing#Neuromorphic Computing#Hardware Acceleration

$ subscribe --daily

Trung Quốc ra mắt hệ thống suy luận LLM hỗn hợp kết hợp GPU và chip mô phỏng não | Daily News