~/AI HARDWARE/cerebras-unveils-wse-3-turbo-chip-and-cs-4-system-with-10x

Cerebras ra mắt chip WSE-3 Turbo và hệ thống CS-4 với dung lượng token gấp 10 lần

Cerebras đã công bố chip WSE-3 Turbo và hệ thống CS-4, mang lại dung lượng token tăng gấp 10 lần và hiệu suất tính toán cũng như băng thông tăng gấp đôi so với thế hệ trước. Hệ thống CS-4 có thể tích hợp ba chip WSE-3 Turbo và đạt tốc độ phân phối token là 4.465 token/giây trên mô hình OpenAI GPT-OSS. Sự ra mắt này thúc đẩy đáng kể phần cứng AI quy mô wafer (wafer-scale), mang lại tốc độ vượt trội so với các giải pháp GPU truyền thống cho việc suy luận mô hình ngôn ngữ lớn (LLM). Nó cho phép kết nối liên kết giữa các wafer với độ trễ cực thấp, giúp các mô hình siêu lớn quy mô 10 nghìn tỷ tham số chạy ở tốc độ cao. Trong khi vẫn duy trì 900.000 lõi và 44GB SRAM, WSE-3 Turbo tăng gấp đôi hiệu suất tính toán AI thưa (sparse AI compute) FP16, băng thông bộ nhớ và băng thông I/O. Hệ thống CS-4 hỗ trợ phân chia khối lượng công việc một cách tự nhiên, cho phép nó hoạt động như một đơn vị giải mã kết hợp với phần cứng prefill dị thể.

## KIẾN THỨC NỀN

Tích hợp quy mô wafer (WSI) liên quan đến việc chế tạo các mạch tích hợp cực lớn từ toàn bộ một tấm wafer silicon để tạo ra một "siêu chip" duy nhất, lớn hơn nhiều so với GPU truyền thống. Ngoài ra, việc tận dụng tính thưa (sparsity) trong phần cứng AI cho phép các hệ thống bỏ qua các phép tính có giá trị bằng không, giúp tăng tốc đáng kể quá trình suy luận và huấn luyện học sâu.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Hardware#Wafer-Scale Engine#LLM Inference#Cerebras#Deep Learning

$ subscribe --daily

Cerebras ra mắt chip WSE-3 Turbo và hệ thống CS-4 với dung lượng token gấp 10 lần | Daily News