OpenAI ra mắt MentalHealthBench nhằm đánh giá khả năng ứng phó sức khỏe tinh thần của AI
OpenAI đã ra mắt MentalHealthBench, một bộ chuẩn đánh giá mở gồm 1.215 đoạn hội thoại tổng hợp về sức khỏe tinh thần bằng 19 ngôn ngữ. Được xây dựng cùng hơn 80 chuyên gia lâm sàng từ 22 quốc gia, tập dữ liệu này bao gồm 5.262 tiêu chí chấm điểm do chuyên gia biên soạn để đánh giá cách các mô hình AI xử lý các tình huống từ thường nhật đến rủi ro cao và khẩn cấp. Khi hàng triệu người dùng tìm đến AI trò chuyện để nhận hỗ trợ cảm xúc, việc chuẩn hóa cách các mô hình xử lý tương tác sức khỏe tinh thần là cực kỳ quan trọng đối với an toàn AI. Bộ chuẩn này cung cấp một khung đánh giá có thể kiểm toán dựa trên chuyên môn lâm sàng, giúp các nhà nghiên cứu giảm thiểu rủi ro và cải thiện hành vi của mô hình trên nhiều nhóm người dùng và văn hóa khác nhau. Tập dữ liệu bao gồm các cuộc hội thoại phi cấp tính (53,5%), rủi ro cao (18,2%) và khẩn cấp (28,3%), với các tiêu chí chấm điểm mang trọng số từ -10 đến +10 trên 10 khía cạnh hành vi do chuyên gia xác định. Kết quả chấm điểm tự động bằng GPT-5.6 Sol cho thấy GPT-6 Astra đạt điểm cao nhất là 57,3%, mặc dù các mô hình vẫn gặp khó khăn trong việc chủ động thu thập bối cảnh và đánh giá đúng độ khẩn cấp.
## KIẾN THỨC NỀN
Đánh giá truyền thống về AI trong y tế thường chỉ tập trung vào các phản ứng khẩn cấp cấp tính với các chỉ số chung chung, tạo ra lỗ hổng trong việc hiểu toàn bộ chuỗi tương tác trò chuyện. Các bộ chuẩn như MentalHealthBench tiếp nối các khung đánh giá y tế rộng hơn nhằm đo lường các năng lực lâm sàng phức tạp, chẳng hạn như kiểm chứng thực tế và sự phù hợp trong trị liệu, mà không coi LLM là giải pháp thay thế cho sự chăm sóc y tế chuyên nghiệp.