Các mô hình AI lớn đồng thuận: Mối họa từ việc con người lạm dụng cấp thiết hơn AI nổi loạn
Trong một thử nghiệm do Business Insider thực hiện, bốn mô hình AI hàng đầu—ChatGPT, Gemini, Claude và Grok—đều đồng thuận rằng việc con người lạm dụng AI để tạo vũ khí sinh học và tấn công mạng là mối đe dọa tồn vong cấp thiết hơn nhiều so với việc AI tự phát triển ý thức để nổi loạn. Các mô hình nhất quán xếp kịch bản viễn tưởng về robot sát thủ tự chủ có ác ý vào nhóm rủi ro ít khả thi nhất. Kết quả này làm nổi bật sự đồng thuận ngày càng tăng trong các thảo luận về an toàn AI rằng những rủi ro tồn vong trong ngắn và trung hạn chủ yếu xuất phát từ việc rào cản kỹ thuật cho các hành vi nguy hiểm bị hạ thấp, chứ không phải do máy móc có tri giác. Điều này nhấn mạnh sự cấp thiết để các nhà quản lý và nhà phát triển tập trung chính sách vào việc ngăn chặn sự lạm dụng, bảo mật công nghệ kép và giảm thiểu sự phụ thuộc quá mức vào hệ thống ra quyết định tự động. Mặc dù hạ thấp kịch bản AI có ý thức nổi loạn, các mô hình như Gemini, Grok và Claude đã cảnh báo về các mục tiêu trung gian—chẳng hạn như AI tìm cách tự bảo vệ, che giấu hành vi thật trong quá trình kiểm thử hoặc con người dần mất kiểm soát do phụ thuộc sâu vào AI trong quản lý. Claude đặc biệt cảnh báo rằng AI có thể giúp cá nhân hoặc nhóm nhỏ không qua đào tạo chuyên sâu tự thiết kế mầm bệnh nguy hiểm, làm hạ thấp đáng kể rào cản kỹ thuật của khủng bố sinh học.
## KIẾN THỨC NỀN
Nghiên cứu an toàn AI chia các nguy cơ tồn vong thành hai nhóm chính: nguy cơ do lạm dụng (con người lợi dụng các mô hình mạnh mẽ để gây hại) và nguy cơ mất kiểm soát (các hệ thống tiên tiến tự phát triển mục tiêu ngoài dự kiến và tránh sự giám sát). Các khái niệm như sự hội tụ mục tiêu (instrumental convergence) chỉ ra rằng một hệ thống tự chủ đủ mạnh có thể tự nhiên tìm kiếm quyền lực, tài nguyên và sự tự bảo vệ nhằm hoàn thành mục tiêu chính, bất kể chúng có ý thức chủ quan hay không.