MiniMax M3.1 Sử Dụng 'Chế Độ Người Hang Động' Trong Chuỗi Suy Luận Để Tiết Kiệm Token
Người dùng phát hiện ra mô hình MiniMax M3.1 (xuất hiện trên OpenRouter dưới tên "Space Bunny Alpha") tự động viết chuỗi suy luận nội bộ (Chain of Thought) theo phong cách "người hang động" siêu ngắn gọn. Kỹ thuật này giúp giảm đáng kể lượng token tiêu thụ trong các bước suy luận nội bộ mà không làm giảm chất lượng của câu trả lời cuối cùng. Các mô hình suy luận thường tốn nhiều chi phí API và độ trễ cao do quy trình suy luận nội bộ dài dòng trước khi trả lời. Việc tích hợp lối suy luận ngắn gọn kiểu người hang động trực tiếp vào mô hình cho thấy các nhà cung cấp AI có thể cắt giảm chi phí token và độ trễ mà không làm ảnh hưởng đến độ chính xác của kết quả. Thử nghiệm xác nhận rằng cú pháp siêu ngắn này là hành vi tự nhiên trong dấu vết suy luận của mô hình chứ không phải do ảnh hưởng từ các tiện ích bên ngoài như `pi-caveman`. Kỹ thuật nén caveman thường loại bỏ từ nối ngữ pháp không cần thiết trong khi vẫn giữ nguyên các đối tượng cốt lõi và logic, giúp giảm tới 50% lượng token suy luận.
## KIẾN THỨC NỀN
Chuỗi suy luận (Chain of Thought - CoT) cho phép các mô hình ngôn ngữ lớn chia nhỏ các bài toán phức tạp thành từng bước logic trước khi đưa ra câu trả lời. "Chế độ người hang động" (caveman mode) là một kỹ thuật nén ngữ nghĩa giúp loại bỏ ngữ pháp thừa và từ nối, từ đó giảm mạnh số lượng token đầu ra mà vẫn duy trì tính chính xác của suy luận.