Nghiên cứu cho thấy AI tạo sinh chưa thể chấm điểm bài luận đáng tin cậy
Một nghiên cứu từ Đại học Cardiff và Đại học Melbourne phát hiện ra rằng ChatGPT chưa thể chấm điểm các bài luận đại học một cách đáng tin cậy, với nhiều sai lệch lớn so với giảng viên con người. AI này có xu hướng nâng điểm thấp và hạ điểm cao, khiến điểm số bị kéo về mức trung bình một cách hệ thống. Mặc dù các tổ chức giáo dục kỳ vọng AI sẽ giúp giảm tải khối lượng công việc cho giáo viên và tăng hiệu suất chấm bài, nghiên cứu này chỉ ra rằng các mô hình ngôn ngữ lớn (LLM) hiện tại vẫn chưa sẵn sàng để thay thế con người trong việc đánh giá các bài viết mang tính chủ quan. Các nhà nghiên cứu đã thử nghiệm hai phiên bản ChatGPT trên 50 bài luận ngành khoa học sinh học bằng cách sử dụng bảy tiêu chí và bốn phương pháp gợi ý (prompting), phát hiện ra mức chênh lệch điểm số lớn nhất lên tới 40 điểm trên một bài luận so với điểm do con người chấm.
## KIẾN THỨC NỀN
Chấm điểm bài luận tự động (AES) là một ứng dụng của xử lý ngôn ngữ tự nhiên sử dụng các chương trình máy tính để đánh giá và cho điểm các bài viết. Trong khi các hệ thống AES truyền thống dựa trên phân loại thống kê, việc tích hợp các mô hình ngôn ngữ lớn (LLM) mang lại những khả năng cũng như thách thức mới trong việc đánh giá các bài làm phức tạp và mang tính chủ quan của học sinh.