OpenAI và Broadcom công bố chip AI Jalapeño thách thức Nvidia
OpenAI đã công bố kết quả thử nghiệm hiệu năng của chip xử lý suy luận AI tự phát triển mang tên Jalapeño, được hợp tác thiết kế cùng Broadcom. Thử nghiệm trên nền tảng InferenceX của SemiAnalysis cho thấy chip này đạt hiệu quả năng lượng cao gấp 1,5 đến 1,9 lần và độ trễ thấp hơn đáng kể so với các hệ thống GB200 và GB300 của Nvidia. Việc OpenAI tham gia vào thị trường chip tự thiết kế đánh dấu một bước chuyển dịch lớn trong ngành phần cứng AI, giúp giảm bớt sự phụ thuộc vào các dòng GPU thống trị của Nvidia. Bằng cách đồng thiết kế cả phần cứng lẫn phần mềm, OpenAI có thể tối ưu hóa chi phí và tốc độ suy luận, vốn là các yếu tố then chốt để mở rộng quy mô các tác vụ AI dạng tác tử (agentic AI). Chip Jalapeño tập trung giải quyết các điểm nghẽn trong giai đoạn nạp trước (prefill) và truyền thông tin của quá trình suy luận bằng cách giảm thiểu di chuyển dữ liệu và lưu trữ cục bộ các trạng thái mô hình như bộ nhớ đệm KV (KV cache). OpenAI có kế hoạch triển khai thử nghiệm chip này ở quy mô nhỏ vào cuối năm 2025 trước khi mở rộng quy mô vào năm 2027.
## KIẾN THỨC NỀN
Suy luận AI (AI inference) là quá trình chạy một mô hình đã được huấn luyện để đưa ra phản hồi hoặc thực hiện tác vụ, khác với giai đoạn huấn luyện vốn tiêu tốn nhiều tài nguyên. Nvidia hiện đang thống trị lĩnh vực này với các hệ thống như GB300 NVL72 tích hợp GPU Blackwell Ultra và CPU Grace. Trong khi đó, InferenceX của SemiAnalysis là một nền tảng đo điểm chuẩn (benchmark) mã nguồn mở dùng để đánh giá hiệu năng thực tế của các chip và khung phần mềm suy luận.