MindControl: Bản Fork llama.cpp Giúp Định Hướng Suy Nghĩ Của LLM Qua Injection Khi Sampling
MindControl là một bản fork mới của llama.cpp giúp chèn các câu lệnh gợi ý về giới hạn tài nguyên (budget-awareness prompts) một cách động vào quá trình suy nghĩ của LLM cục bộ trong giai đoạn sampling. Công cụ này định hướng tư duy của mô hình bằng cách điền trước các câu tự nhận thức khi mô hình bắt đầu và tiến triển trong thẻ <think>. Các mô hình suy luận cục bộ cỡ nhỏ thường gặp lỗi lặp suy luận vô hạn hoặc tạo ra đầu ra kém chất lượng khi quá trình tư duy không bị ràng buộc. Bằng cách áp dụng giới hạn token một cách động, MindControl ngăn chặn các vòng lặp này và cải thiện hiệu suất cũng như độ tin cậy của việc suy luận LLM cục bộ. Công cụ này chèn các câu lệnh gợi ý tại các ngưỡng quan trọng, chẳng hạn như khi bắt đầu suy nghĩ, khi đạt 70% giới hạn token, và tại giới hạn cuối cùng kèm theo một khoảng thời gian chờ ngắn để đợi xuống dòng mới. Kho mã nguồn này được mở công khai và đi kèm một image Docker dựng sẵn hỗ trợ AMD64 và CUDA.
## KIẾN THỨC NỀN
Các LLM suy luận hiện đại sử dụng chuỗi suy nghĩ (chain-of-thought), thường được đặt trong thẻ <think>, để xử lý các câu hỏi phức tạp trước khi đưa ra câu trả lời cuối cùng. Tuy nhiên, việc quản lý độ dài và chất lượng của các suy nghĩ này—được gọi là suy luận nhận biết giới hạn token (token-budget-aware reasoning)—vẫn là một thách thức đối với các mô hình nhỏ chạy cục bộ.