Nhà phát triển vận hành Qwen 27B tự động trong 21 ngày để tự viết nhân CUDA
Một nhà phát triển đã chạy vòng lặp agent LLM Qwen 27B tự động trên một GPU RTX 3090 duy nhất trong 21 ngày để xây dựng bộ công cụ suy luận CUDA được tối ưu hóa cho chính nó. Mặc dù tốc độ prefill thấp hơn llama.cpp (khoảng 250 so với 700 token/giây) và cần 12 lần can thiệp từ con người, agent đã tạo thành công các nhân (kernel) hoạt động được. Thử nghiệm này chứng minh rằng các mô hình LLM mã nguồn mở tầm trung chạy trên phần cứng cá nhân có thể duy trì các mục tiêu dài hạn qua hàng trăm chu kỳ subagent và hàng trăm triệu token. Nó thể hiện tính khả thi ngày càng cao của việc tự động hóa kỹ thuật phần mềm, đồng thời làm nổi bật các điểm nghẽn thực tế như quản lý giao thức và chi phí thời gian nén ngữ cảnh. Hệ thống đã sử dụng 180 subagent và xử lý hơn 230 triệu token, thực hiện 699 lần nén ngữ cảnh tiêu tốn khoảng 83 giờ (17% tổng thời gian). Thử nghiệm cũng phải xử lý kiến trúc 'vòng lặp tự sát', trong đó vLLM chạy agent phải tắt và khởi động lại an toàn trên cùng một GPU để mã CUDA thử nghiệm có thể đo hiệu năng mà không làm tràn bộ nhớ VRAM.
## KIẾN THỨC NỀN
CUDA là nền tảng tính toán song song của NVIDIA cho phép nhà phát triển viết mã cấp thấp (kernel) để tăng tốc các tác vụ nặng như suy luận LLM. Trong quá trình vận hành LLM, giai đoạn prefill sẽ xử lý các token đầu vào trước khi bắt đầu tạo văn bản, trong khi nén ngữ cảnh (context compaction) giúp tóm tắt lịch sử tương tác cũ để giữ cuộc hội thoại trong giới hạn bộ nhớ.