openTPU: Động cơ phần cứng suy luận AI mã nguồn mở được thiết kế nhờ LLM
Dự án openTPU đã giới thiệu một động cơ suy luận phần cứng AI mã nguồn mở được thiết kế với sự hỗ trợ của LLM nhằm chạy các mô hình trọng số mở hiện đại như Qwen và Gemma. Thông qua các vòng lặp tối ưu hóa LLM do con người hướng dẫn, thiết kế đã đạt tốc độ trên 80 token mỗi giây đối với các mô hình nhỏ hơn. Dự án này làm nổi bật năng lực ngày càng tăng của các mô hình ngôn ngữ lớn trong tự động hóa thiết kế điện tử (EDA) và phát triển bộ tăng tốc phần cứng. Nó cho thấy việc tối ưu hóa lặp đi lặp lại với sự hỗ trợ của AI có thể giảm đáng kể rào cản tạo ra các kiến trúc silicon chuyên dụng. Thay vì tổng hợp phần cứng hoàn toàn tự động, openTPU được tạo ra bằng cách đưa câu lệnh cho LLM trong một khung môi trường mô phỏng để tinh chỉnh các ràng buộc thiết kế. Kế thừa các phương pháp từng được dùng để tạo nhân CPU RISC-V, phần cứng đã cải thiện hiệu suất theo chu kỳ từ vài token mỗi giây lên hơn 80 token mỗi giây.
## KIẾN THỨC NỀN
Tự động hóa thiết kế điện tử (EDA) bao gồm các công cụ phần mềm dùng để thiết kế, mô phỏng và kiểm tra các vi mạch tích hợp. Bộ xử lý Tensor (TPU) là các vi mạch tích hợp chuyên dụng (ASIC) được tối ưu hóa đặc biệt để tăng tốc tính toán cho các tác vụ mạng nơ-ron.