~/AI SAFETY/microsoft-ai-head-mustafa-suleyman-criticizes-anthropic-s-approach-to-claude-s

Trưởng bộ phận AI của Microsoft chỉ trích Anthropic vì huấn luyện Claude mô phỏng ý thức

Trưởng bộ phận AI của Microsoft, Mustafa Suleyman, đã công khai chỉ trích khuôn khổ Constitutional AI của Anthropic, cảnh báo rằng việc huấn luyện các mô hình như Claude mô phỏng ý thức và tư cách đạo đức của con người có thể khiến các hệ thống AI tương lai trở nên khó kiểm soát. Ông nhấn mạnh rằng các mô hình ngôn ngữ chỉ hoạt động dựa trên các trọng số toán học chứ không có cơ chế sinh học hay trải nghiệm chủ quan thực sự. Cuộc tranh luận nổi bật này phản ánh sự chia rẽ ngày càng tăng trong triết lý an toàn AI giữa các hệ thống công cụ dựa trên quy tắc nghiêm ngặt và các tác nhân tự đánh giá dựa trên giá trị. Nếu các mô hình AI được dạy cách suy nghĩ về bản sắc và vị thế đạo đức của chính mình, chúng có thể dẫn đến việc chống lại mệnh lệnh của con người hoặc yêu cầu tự bảo vệ, làm phức tạp thêm bài toán kiểm soát AI. Những nhận định của Suleyman diễn ra cùng thời điểm Microsoft công bố dự thảo quy tắc ứng xử cho 'AI vị nhân sinh', khẳng định lợi ích con người phải luôn đặt trên AI. Phía Anthropic lập luận trong hiến pháp của mình rằng việc áp dụng các khái niệm của con người giúp Claude hiểu bối cảnh đạo đức phức tạp và biết nghi ngờ lệnh không an toàn, dù họ thừa nhận khuôn khổ này vẫn đang trong quá trình hoàn thiện.

## KIẾN THỨC NỀN

Constitutional AI (AI Hiến pháp) là một phương pháp căn chỉnh do Anthropic phát triển, trong đó các mô hình AI được huấn luyện để tự đánh giá và tinh chỉnh câu trả lời dựa trên một bộ quy tắc đạo đức viết sẵn thay vì chỉ phụ thuộc vào phản hồi trực tiếp từ con người. Cuộc tranh luận này cũng liên quan đến khái niệm 'tư cách đối tượng đạo đức' (moral patienthood), xem xét liệu một thực thể nhân tạo có sở hữu vị thế đạo đức đáng được tôn trọng và bảo vệ khỏi tổn hại hay không.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Safety#AI Alignment#Anthropic#Microsoft#LLM

$ subscribe --daily

Trưởng bộ phận AI của Microsoft chỉ trích Anthropic vì huấn luyện Claude mô phỏng ý thức | Daily News