EngramEdit cho phép cập nhật tri thức trong LLM thông qua bộ nhớ điều kiện tách biệt
Các nhà nghiên cứu đã giới thiệu EngramEdit, một khung chỉnh sửa tri thức mới giúp cập nhật kiến thức thực tế trong các mô hình ngôn ngữ lớn bằng cách chỉnh sửa các nhúng bộ nhớ n-gram tách biệt thay vì thay đổi khung Transformer chính. Phương pháp này đạt được tỷ lệ chỉnh sửa thành công gần như hoàn hảo trong khi vẫn giữ nguyên các năng lực không liên quan của mô hình ngay cả khi tích lũy nhiều lần cập nhật. Sửa đổi các sai sót thực tế trong LLM truyền thống thường đòi hỏi huấn luyện lại tốn kém hoặc có nguy cơ làm suy giảm hiệu suất mô hình do hiện tượng quên thảm họa. Bằng cách biến kiến trúc bộ nhớ điều kiện thành một giao diện tri thức có thể chỉnh sửa, EngramEdit cho phép cập nhật tri thức hiệu quả và cải thiện hiệu suất suy luận nhiều bước với gợi ý chuỗi tư duy (CoT) gấp gần ba lần so với các phương pháp cơ sở hiện tại. EngramEdit tính toán các biểu diễn bộ nhớ mục tiêu cho một sự thật mới trên nhiều cách diễn đạt khác nhau, sau đó cập nhật đồng thời các nhúng n-gram dùng chung để khớp với các mục tiêu đó. Để bảo vệ các sự thật không liên quan, thuật toán phạt nặng các thay đổi đối với những nhúng được tái sử dụng thường xuyên trong nhiều bối cảnh khác nhau.
## KIẾN THỨC NỀN
Các kiến trúc bộ nhớ điều kiện, chẳng hạn như DeepSeek Engram, mở rộng mô hình Transformer bằng các bảng tra cứu n-gram để tách biệt việc lưu trữ tri thức thực tế cố định khỏi quá trình tính toán của mạng thần kinh. Chỉnh sửa tri thức trong LLM tập trung vào việc sửa đổi các thông tin sai lệch cụ thể mà không cần huấn luyện lại toàn bộ mô hình, giúp giải quyết hiện tượng ảo giác và thông tin đã lỗi thời.