Andrej Karpathy đề xuất phương pháp đánh giá LLM mới bằng cách tạo cảnh 3D
Nhà đồng sáng lập OpenAI Andrej Karpathy đã đề xuất một phương pháp đánh giá AI mới, yêu cầu các mô hình ngôn ngữ lớn (LLM) tạo ra các cảnh 3D tương tác từ văn bản văn học bằng thư viện three.js. Trong một thử nghiệm, mô hình Claude đã tạo ra một cảnh trong phim "Chúa tể những chiếc nhẫn" với ngân sách 1 triệu token, tạo ra khoảng 5.500 dòng mã trong khoảng hai giờ. Khi các LLM nhanh chóng làm chủ các tác vụ đơn giản hơn như tạo ảnh SVG 2D, phương pháp đánh giá này nâng cao tiêu chuẩn bằng cách thử nghiệm khả năng tạo mã phức tạp, tư duy không gian và thiết kế cảnh quan. Nó làm nổi bật khả năng ngày càng tăng của AI trong việc xử lý các tác vụ kỹ thuật sáng tạo nhiều bước với ngữ cảnh dài. Hoạt ảnh 3D được tạo ra mô tả bữa tiệc chia tay của Bilbo và một hang động đầy kho báu, mặc dù chưa thể so sánh với chất lượng do con người thiết kế chuyên nghiệp, nhưng độ hoàn thiện của nó rất ấn tượng đối với một lượt chạy tự động trong hai giờ với chi phí khoảng 10 USD. Hiện tại, đây vẫn là một đề xuất không chính thức chứ chưa phải là một bài kiểm tra tiêu chuẩn hóa.
## KIẾN THỨC NỀN
Trước đây, các nhà phát triển thường sử dụng các bài kiểm tra không chính thức như yêu cầu LLM tạo mã SVG cho hình ảnh "con bồ nông đi xe đạp" để đánh giá tư duy không gian và khả năng lập trình của chúng. Three.js là một thư viện JavaScript mã nguồn mở phổ biến được sử dụng để tạo và hiển thị đồ họa máy tính 3D động trong trình duyệt web bằng WebGL.