Nvidia được cho là đã khởi động lại và tái thiết kế GPU Rubin CPX cho AI
Nvidia được cho là đã tái khởi động dự án GPU Rubin CPX với thiết kế cải tiến lớn nhằm tăng tốc giai đoạn prefill trong suy luận AI, hướng tới sản xuất hàng loạt vào quý 1 năm 2027. Kiến trúc mới được chuyển đổi từ 128GB GDDR7 sang 168GB HBM4, đồng thời nâng hiệu năng tính toán tiệm cận các GPU Rubin tiêu chuẩn với công suất tối đa 2.300W. Khi xử lý LLM ngữ cảnh dài ngày càng phát triển, giai đoạn prefill prompt và tạo bộ đệm KV cache chiếm hơn 50% tài nguyên suy luận. Việc triển khai phần cứng chuyên dụng cho prefill như Rubin CPX giúp các trung tâm dữ liệu mở rộng hạ tầng suy luận linh hoạt và tối ưu chi phí hơn bằng cách tách biệt tải công việc prefill khỏi các tác vụ decode. Tám chip Rubin CPX hợp thành một khay tính toán cung cấp 1,34TB bộ nhớ HBM, kết nối qua Ethernet Spectrum-6 và liên kết RDMA tới các giá máy chủ Vera Rubin NVL72 tiêu chuẩn theo tỷ lệ đề xuất 1:1. Việc chuyển từ GDDR7 sang HBM4 thể hiện rõ nhu cầu cao về băng thông bộ nhớ để xử lý hiệu quả khối lượng công việc prefill ngữ cảnh dài.
## KIẾN THỨC NỀN
Quá trình suy luận mô hình ngôn ngữ lớn (LLM) được chia làm hai giai đoạn: giai đoạn prefill xử lý prompt đầu vào theo phương thức song song để tính toán bộ đệm KV cache, và giai đoạn decode sinh từng token đầu ra theo tuần tự. Vì prefill đòi hỏi cao về tính toán lẫn băng thông còn decode bị giới hạn bởi bộ nhớ, việc tách hai giai đoạn này lên các kiến trúc phần cứng chuyên dụng sẽ giúp cải thiện hiệu suất sử dụng phần cứng và giảm độ trễ.