Intern-S2-Mobius: Mô hình nền tảng tách biệt tri thức và suy luận
Các nhà nghiên cứu đã giới thiệu Mobius-v0, một kiến trúc mô hình mới giúp tách biệt việc lưu trữ tri thức (sử dụng bộ nhớ mạng truyền thẳng FFN chia sẻ toàn cục) khỏi khả năng suy luận (sử dụng nhiều bộ suy luận tự chú ý Self-Attention). Mô hình Intern-S2-Mobius được tiếp tục tiền huấn luyện từ Qwen3.5-35B dựa trên kiến trúc này đạt tốc độ suy luận nhanh gấp gần 4 lần trong khi vẫn duy trì hiệu suất tương đương. Bằng cách tách biệt tri thức khỏi suy luận, kiến trúc này cải thiện đáng kể hiệu quả sử dụng dữ liệu huấn luyện và tốc độ suy luận, giải quyết các nút thắt cổ chai chính trong việc mở rộng quy mô các mô hình ngôn ngữ lớn. Nó mở ra một hướng đi đầy hứa hẹn cho các hệ thống AI tiết kiệm tài nguyên hơn mà không làm giảm khả năng suy luận. Kiến trúc này sử dụng các trạng thái ẩn (hidden states) làm bộ đệm và vật mang, cho phép các bộ suy luận liên tục truy vấn bộ nhớ chia sẻ để lấy các vectơ tri thức. Một mô hình 7B được huấn luyện từ đầu bằng Mobius-v0 đã đạt hiệu suất tương đương với mô hình Transformer 7B tiêu chuẩn nhưng chỉ cần 62,6% dữ liệu huấn luyện.
## KIẾN THỨC NỀN
Trong các kiến trúc Transformer truyền thống, các lớp tự chú ý (xử lý ngữ cảnh và suy luận) và mạng truyền thẳng (FFN, lưu trữ tri thức thực tế dưới dạng bộ nhớ key-value) được liên kết chặt chẽ và xen kẽ với nhau. Sự ràng buộc này thường dẫn đến sự kém hiệu quả, vì việc mở rộng cơ sở tri thức của mô hình đòi hỏi phải mở rộng toàn bộ mạng lưới, bao gồm cả các thành phần suy luận tốn kém tài nguyên tính toán.