Bài Viết Của Kỹ Sư DeepSeek Về AI Tự Động Hóa Tối Ưu Toán Tử GPU Gây Sốt
Liu Shengyu, kỹ sư chủ trì phát triển toán tử Attention cho DeepSeek v4.1, đã đăng bài viết gây sốt suy ngẫm về việc các mô hình AI đang tiến bộ nhanh chóng trong việc đọc mã CUDA, PTX và SASS để tự động tối ưu hóa toán tử GPU. Anh dự đoán rằng các toán tử do AI tạo ra sẽ sánh ngang hoặc vượt qua trình độ của các kỹ sư tối ưu hóa nhân GPU hàng đầu trong 6 đến 12 tháng tới. Bài suy ngẫm này cho thấy một sự dịch chuyển lớn trong ngành công nghệ, nơi kỹ thuật tối ưu hóa hiệu năng cấp thấp chuyên sâu—vốn là công việc thủ công đòi hỏi trình độ rất cao—đang dần bị AI tự động hóa. Điều này nhấn mạnh vòng lặp phản hồi ngày càng nhanh, khi các mô hình AI ngày càng mạnh hơn lại tiếp tục đẩy nhanh tốc độ phát triển hạ tầng của chính chúng. Liu chi tiết hóa cách AI đã tiến bộ chỉ trong một năm từ hỗ trợ đọc tài liệu đến tự phân tích thời gian tạm dừng của chỉ thị và viết toán tử GPU hiệu năng cao. Anh làm rõ bài viết chỉ là lời chia tay cá nhân với công việc lập trình toán tử thủ công chứ không phải sự lo âu về việc làm hay tuyên bố chính thức từ DeepSeek.
## KIẾN THỨC NỀN
Các toán tử GPU (GPU operators) là các hàm tính toán chuyên dụng, như cơ chế Attention hoặc nhân ma trận, được thiết kế để chạy tối ưu trên kiến trúc GPU song song. Việc tối ưu hóa các toán tử này đòi hỏi phải lập trình cấp thấp bằng CUDA và phân tích các mã lắp ráp trung gian như PTX cũng như mã máy SASS của phần cứng để giảm thiểu nghẽn bộ nhớ và độ trễ.