Anthropic cập nhật cơ chế an toàn sinh học Claude Fable 5, giảm 85% chặn nhầm
Anthropic đã cập nhật các bộ phân loại an toàn sinh học cho mô hình Claude Fable 5, giúp giảm 85% các trường hợp chặn nhầm đối với các truy vấn sinh học vô hại. Sự điều chỉnh này cho phép mô hình xử lý phạm vi rộng hơn các tác vụ sinh học lành tính mà không kích hoạt các phản hồi từ chối không cần thiết. Sự tối ưu hóa này cải thiện khả năng sử dụng cho các nhà nghiên cứu và học sinh sử dụng Claude cho các nghiên cứu sinh học hợp pháp, trong khi vẫn duy trì các rào cản chống lại các hoạt động rủi ro cao như nghiên cứu vũ khí sinh học. Nó làm nổi bật thách thức đang diễn ra trong an toàn AI về việc cân bằng giữa giảm thiểu rủi ro nghiêm ngặt và tính hữu ích cho người dùng. Mặc dù giảm các trường hợp chặn nhầm, Claude Fable 5 vẫn sẽ tiếp tục hạn chế các truy vấn liên quan đến nghiên cứu sinh học chuyên nghiệp và phát triển thuốc để ngăn ngừa khả năng lạm dụng. Bản cập nhật này tinh chỉnh cụ thể các bộ phân loại an toàn để phân biệt tốt hơn giữa các câu hỏi giáo dục lành tính và các gợi ý có rủi ro cao.
## KIẾN THỨC NỀN
Các bộ phân loại an toàn AI là các mô hình hoặc thuật toán chuyên dụng được thiết kế để giám sát các câu lệnh của người dùng và đầu ra của mô hình nhằm chặn nội dung độc hại, chẳng hạn như ngôn từ kích động thù địch hoặc hướng dẫn nguy hiểm. Trong bối cảnh an toàn sinh học, các rào cản này rất quan trọng vì các mô hình AI tiên tiến có khả năng bị lạm dụng để thiết kế các tác nhân hoặc vũ khí sinh học. Tuy nhiên, các bộ phân loại quá nghiêm ngặt thường dẫn đến hiện tượng "chặn nhầm" (false positives), nơi các truy vấn khoa học lành tính bị gắn cờ và chặn một cách nhầm lẫn.