Latent Space đánh giá kỹ sư AI tự động GPT-6 Astra qua hơn 20 tỷ token
Latent Space đã công bố bài phân tích chuyên sâu dựa trên việc tiêu tốn hơn 20 tỷ token để thử nghiệm kỹ sư phần mềm AI tự động GPT-6 Astra. Đánh giá này khám phá khả năng thực tế của một lập trình viên tự động hoạt động với chi phí vận hành dưới 6 USD mỗi giờ. Đợt kiểm thử quy mô lớn này mang lại cái nhìn thực nghiệm quý giá về cách các agent lập trình tự động hoạt động ở quy mô cực lớn và hiệu quả chi phí. Nó làm nổi bật tính khả thi ngày càng cao của việc triển khai agent AI chi phí thấp cho các nhiệm vụ kỹ thuật phần mềm liên tục. Nghiên cứu đã kiểm thử sức chịu đựng của agent AI qua khối lượng công việc ngữ cảnh dài để quan sát sự suy giảm hiệu suất, giới hạn suy luận và cấu trúc chi phí qua 20 tỷ token. Agent được thiết kế để tự thực hiện các quy trình kỹ thuật phức tạp với mức chi phí theo giờ dưới 6 USD.
## KIẾN THỨC NỀN
Các kỹ sư phần mềm AI tự động đại diện cho bước tiến vượt xa các công cụ tự động gợi ý mã nguồn như GitHub Copilot. Các hệ thống như Devin hay những agent LLM tiên tiến có thể tự duyệt kho mã nguồn, thực thi mã, chạy thử nghiệm và sửa lỗi mà cần rất ít sự can thiệp của con người. Việc đánh giá các mô hình này đòi hỏi kiểm thử token quy mô lớn để đo lường độ tin cậy và tính kinh tế thực tế.