~/LLM/impact-of-uncensored-llms-on-coding-performance-and-model-weights

Ảnh hưởng của mô hình AI không kiểm duyệt đến hiệu suất lập trình và trọng số mô hình

Một người dùng trên diễn đàn r/LocalLLaMA đã khởi xướng thảo luận về việc liệu sử dụng mô hình ngôn ngữ không kiểm duyệt có giúp cải thiện khả năng sinh mã nguồn nhờ bỏ qua các kiểm tra an toàn hay không, hay quá trình gỡ bỏ kiểm duyệt sẽ vô tình làm hỏng trọng số mô hình. Thảo luận này đề cập đến 'thuế căn chỉnh' (alignment tax), trong đó các cơ chế an toàn trong LLM có thể gây ra việc từ chối nhầm các yêu cầu kỹ thuật hợp lệ như mã nguồn an ninh mạng. Việc làm rõ liệu mô hình không kiểm duyệt có vượt trội hơn mô hình đã căn chỉnh hay không sẽ giúp các nhà phát triển lựa chọn công cụ AI hiệu quả nhất cho các nhiệm vụ lập trình phức tạp. Các hàng rào an toàn thường kích hoạt nhầm đối với các nhiệm vụ lập trình liên quan đến bảo mật mạng, thao túng tệp hoặc khai thác hệ thống, dẫn đến việc mô hình từ chối trả lời. Trong khi phương pháp tinh chỉnh truyền thống để bỏ kiểm duyệt có nguy cơ làm hỏng khả năng suy luận cốt lõi, các kỹ thuật hiện đại như abliteration điều chỉnh các vectơ trong không gian ẩn để dập tắt hành vi từ chối mà ít ảnh hưởng nhất đến hiệu suất gốc.

## KIẾN THỨC NỀN

Các mô hình ngôn ngữ lớn thường được căn chỉnh bằng các kỹ thuật như Học tăng cường từ phản hồi của con người (RLHF) để đảm bảo tính hữu ích và an toàn. Tuy nhiên, việc căn chỉnh an toàn có thể tạo ra 'thuế căn chỉnh', làm giảm hiệu suất giải quyết vấn đề tiêu chuẩn hoặc gây ra sự cố từ chối nhầm các yêu cầu lành tính. Cộng đồng mã nguồn mở thường xuyên tạo ra các biến thể không kiểm duyệt hoặc dùng kỹ thuật điều hướng kích hoạt để ngăn mô hình từ chối câu lệnh của người dùng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#llm#ai-alignment#local-models#code-generation

$ subscribe --daily

Ảnh hưởng của mô hình AI không kiểm duyệt đến hiệu suất lập trình và trọng số mô hình | Daily News