UkisAI ra mắt chuỗi mô hình Swift giúp giảm tới 63% token suy luận
UkisAI đã phát hành dòng mô hình Swift dựa trên Qwen—bao gồm Swift1.5 27B, Swift Flash Next và Swift Bonsai 2—giúp cắt giảm tới 63,4% lượng token suy luận dư thừa và tăng tốc độ tạo văn bản lên đến 1,95 lần. Các mô hình này được huấn luyện bằng cách phạt các mô hình tư duy không cần thiết thông qua Tối ưu hóa Chính sách Chuỗi Nhóm (GSPO) và Chưng cất Trên Chính sách (OPD) mà không làm giảm độ chính xác trên các bài kiểm tra chuẩn. Các mô hình suy luận LLM hiện đại thường tạo ra quá nhiều token tư duy trung gian, làm tăng độ trễ, chi phí tính toán và rủi ro rơi vào các vòng lặp lỗi lặp đi lặp lại. Bằng cách giảm mạnh hiện tượng phình token nhưng vẫn giữ nguyên chất lượng đầu ra, dòng mô hình Swift giúp việc triển khai cục bộ các mô hình suy luận hiệu năng cao trở nên nhanh hơn và tiết kiệm chi phí hơn nhiều. Đợt phát hành bao gồm Swift Flash Next (giảm 63,4% token suy luận, tăng tốc 1,8 lần) và Swift1.5 27B (giảm 58,5% token suy luận), đi kèm nhiều định dạng định lượng như GSQ-RCO, GGUF, NVFP4, MLX và W4A16. Trong các bài đánh giá tác tử như Terminal Bench 2.1, các mô hình Swift tránh được tình trạng bị mắc kẹt trong vòng lặp suy luận quá đà, giúp chúng kiên trì thực hiện nhiệm vụ cho đến khi hoàn thành thay vì thất bại sớm.
## KIẾN THỨC NỀN
Các mô hình ngôn ngữ suy luận tạo ra các token trung gian theo từng bước ('quy trình tư duy') trước khi đưa ra câu trả lời cuối cùng để giải quyết các bài toán logic, toán học và lập trình phức tạp. Tuy nhiên, các mô hình này thường gặp hiện tượng phình token, tạo ra hàng trăm token dư thừa gây lãng phí tài nguyên tính toán. Tối ưu hóa Chính sách Chuỗi Nhóm (GSPO) và Chưng cất Trên Chính sách (OPD) là các kỹ thuật RL và truyền tri thức tiên tiến được sử dụng để kiểm soát độ dài chuỗi trong khi vẫn giữ nguyên chất lượng suy luận, trong khi kỹ thuật định lượng GSQ-RCO giúp tối ưu hóa việc nén mô hình để chạy cục bộ hiệu quả trên phần cứng.