OpenAI Ra Mắt Chip Suy Luận Tự Phát Triển Jalapeño, Vượt Trội Hơn NVIDIA GB300 Về Hiệu Suất
OpenAI đã công bố Jalapeño, chip suy luận AI tự phát triển đầu tiên hợp tác cùng Broadcom, đạt hiệu suất xử lý trên mỗi watt điện cao gấp 1,5 đến 1,9 lần so với hệ thống GB200 và GB300 của NVIDIA. Được thử nghiệm bằng công cụ InferenceX của SemiAnalysis, con chip này cũng giảm độ trễ đầu-cuối xuống chỉ còn khoảng 28% đến 59% so với các hệ thống của NVIDIA. Cột mốc tự thiết kế chip này giúp OpenAI giảm bớt sự phụ thuộc lớn vào GPU của NVIDIA và hạ thấp chi phí vận hành khổng lồ khi chạy các mô hình ngôn ngữ lớn. Điều này báo hiệu một xu hướng lớn trong ngành khi các phòng nghiên cứu AI hàng đầu tự thiết kế phần cứng chuyên dụng tối ưu riêng cho khối lượng công việc của họ. Jalapeño là một chip ASIC công suất 700W sử dụng kiến trúc mảng xung nhịp (systolic array) và bộ nhớ băng thông cao HBM, được sản xuất trên tiến trình 3nm của TSMC và chỉ dùng nội bộ cho các tác vụ suy luận chứ không bán thương mại. Con chip này được phát triển thần tốc trong vòng 9 tháng với sự hỗ trợ từ chính các mô hình AI của OpenAI, duy trì mức tiêu thụ điện năng thực tế từ 550W trở xuống trong quá trình thử nghiệm.
## KIẾN THỨC NỀN
Suy luận AI (inference), quá trình chạy các mô hình đã được huấn luyện để đưa ra dự đoán hoặc câu trả lời, đòi hỏi sức mạnh tính toán và năng lượng khổng lồ. Mặc dù các GPU đa dụng của NVIDIA hiện đang thống trị lĩnh vực này, các chip ASIC (Vi mạch tích hợp chuyên dụng) tự thiết kế có thể được tối ưu hóa cho các phép toán cụ thể để đạt hiệu quả năng lượng vượt trội và độ trễ thấp hơn.