~/AI SAFETY/hugging-face-partners-with-baseten-and-goodfire-on-open-weight-ai-safety

Hugging Face hợp tác với Baseten và Goodfire về an toàn cho AI mã nguồn mở

Base Labs, bộ phận nghiên cứu của Baseten, đã hợp tác với Hugging Face và Goodfire AI để phát triển hạ tầng đánh giá, huấn luyện và giám sát an toàn cho các mô hình AI mã nguồn mở (open-weight). Sáng kiến này tập trung giải quyết các quan ngại về an toàn xung quanh mô hình mở, bao gồm cả những mô hình bị gỡ bỏ rào cản an toàn bằng các kỹ thuật như abliteration. Do Hugging Face đang lưu trữ hàng nghìn mô hình AI đã bị gỡ rào cản (abliterated), các nhà phát triển AI mã nguồn mở lo ngại sự hợp tác này có thể là tín hiệu cho các chính sách kiểm duyệt nghiêm ngặt hơn. Dù vậy, việc thiết lập các tiêu chuẩn đánh giá an toàn công khai cũng có thể giúp AI mã nguồn mở nhận được sự tin tưởng và chấp nhận rộng rãi hơn từ giới quản lý. Thông báo nhấn mạnh rằng Hugging Face hiện lưu trữ hơn 6.000 mô hình abliterated, đặt ra câu hỏi về việc các công cụ giám sát tự động sẽ đánh giá các trọng số này như thế nào. Mặc dù nỗ lực hợp tác tập trung vào phát triển phương pháp đánh giá công khai, Hugging Face chưa chính thức tuyên bố kế hoạch cấm hay gỡ bỏ các kho lưu trữ mô hình abliterated.

## KIẾN THỨC NỀN

"Abliteration" là một kỹ thuật loại bỏ cơ chế từ chối của mô hình ngôn ngữ lớn (LLM) bằng cách can thiệp vào các vectơ biểu diễn nội bộ mà không cần huấn luyện lại toàn bộ mô hình. Trong khi các nhà phát triển sử dụng mô hình uncensored cho nghiên cứu và sáng tác tự do, các nhà nghiên cứu an toàn lại xem đây là mối nguy cơ vì chúng dễ bị lợi dụng để tạo nội dung độc hại. Hugging Face là nền tảng lưu trữ mô hình AI mã nguồn mở lớn nhất hiện nay, khiến bất kỳ thay đổi nào trong chính sách kiểm duyệt của họ cũng gây ảnh hưởng lớn đến hệ sinh thái.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Safety#Hugging Face#Open Source AI#Model Alignment#LLMs

$ subscribe --daily

Hugging Face hợp tác với Baseten và Goodfire về an toàn cho AI mã nguồn mở | Daily News