~/AI HARDWARE/amd-and-cerebras-partner-on-low-latency-ai-inference-architecture

AMD và Cerebras hợp tác phát triển kiến trúc suy luận AI độ trễ thấp

AMD đã hợp tác với Cerebras để phát triển giải pháp suy luận AI độ trễ thấp, kết hợp hệ thống rack-scale Helios của AMD với Wafer-Scale Engine của Cerebras. Kiến trúc lai này hướng tới việc tăng hiệu suất xử lý token trên mỗi watt lên gấp 5 lần. Bằng cách tách biệt các giai đoạn prefill và decoding trong quá trình suy luận LLM, sự hợp tác này giải quyết nút thắt cổ chai về băng thông bộ nhớ trong các tác vụ AI. Giải pháp này mang lại một lựa chọn thay thế hiệu quả cao so với các đối thủ cạnh tranh từ NVIDIA và Groq. Trong thiết lập này, các tủ rack Helios của AMD sẽ xử lý giai đoạn prefill (xử lý prompt) nặng về tính toán và các cửa sổ ngữ cảnh lớn, trong khi Wafer-Scale Engine của Cerebras với bộ nhớ SRAM tích hợp sẽ đảm nhận giai đoạn tạo token (decoding) vốn bị giới hạn bởi băng thông bộ nhớ.

## KIẾN THỨC NỀN

Quá trình suy luận mô hình ngôn ngữ lớn (LLM) được chia làm hai giai đoạn: prefill (xử lý song song prompt đầu vào) và decoding (tạo tuần tự các token đầu ra). Do prefill bị giới hạn bởi năng lực tính toán (compute-bound) còn decoding bị giới hạn bởi băng thông bộ nhớ (memory-bound), việc chạy cả hai trên cùng một phần cứng có thể gây tranh chấp tài nguyên. Kỹ thuật phân tách prefill-decode giúp chia nhỏ các tác vụ này sang các phần cứng chuyên biệt để tối ưu hóa độ trễ và hiệu suất.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Hardware#LLM Inference#AMD#Cerebras#Computer Architecture

$ subscribe --daily