Phantom-KV giúp bỏ chặn LLM bằng cách chèn bộ đệm KV-Cache dung lượng nhẹ
Nhà phát triển lordx64 đã phát hành Phantom-KV, một hệ thống mã nguồn mở cho phép bỏ chặn LLM linh hoạt theo từng yêu cầu bằng cách chèn một cụm bộ đệm KV-cache huấn luyện khoảng 18MB vào cơ chế chú ý ngữ cảnh. Khác với các phương pháp truyền thống, công cụ này hoạt động mà không cần can thiệp vào trọng số gốc của mô hình hay chỉnh sửa các móc kích hoạt thời gian thực. Phương pháp này chuyển đổi việc tinh chỉnh an toàn mô hình từ việc chỉnh sửa vĩnh viễn trọng số thành các chế độ năng lượng có thể bật/tắt linh hoạt. Điều này cho phép các doanh nghiệp và đội ngũ an ninh mạng chuyển đổi các chế độ vận hành chuyên biệt (như phân tích mã độc) trên cùng một mô hình nền tảng mà không làm hỏng rào chắn an toàn vĩnh viễn hay phải tải lại checkpoint. Phantom-KV được huấn luyện ngoại tuyến để xử lý các câu lệnh bị từ chối mà vẫn giữ nguyên phản hồi thông thường, xuất hiện trong cơ chế chú ý ngữ cảnh như một lịch sử trò chuyện có sẵn. Tuy nhiên, kiểm thử của tác giả cho thấy hiệu ứng của bộ đệm chèn vào sẽ giảm dần sau chu kỳ 2.000–4.000 token, đòi hỏi phải tái chèn định kỳ trong các phiên làm việc dài.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ lớn sử dụng bộ đệm Key-Value (KV cache) để lưu trữ các trạng thái chú ý trung gian của các token đã xử lý trước đó nhằm tăng tốc độ tạo văn bản. Việc loại bỏ phản hồi từ chối an toàn ("abliteration") theo cách truyền thống đòi hỏi phải thay đổi vĩnh viễn ma trận trọng số hoặc can thiệp luồng kích hoạt thời gian thực, cả hai cách này đều có thể làm giảm khả năng suy luận hoặc bị lỗi khi mô hình được lượng hóa (quantization).