Đánh giá hiệu năng hai bản tinh chỉnh ThinkingCap và Swift của Qwen 3.8-27B
Một thử nghiệm độc lập đã kiểm chứng hai bản tinh chỉnh ThinkingCap-Qwen3.8-27B và Swift-Qwen3.8-27B bằng bộ công cụ Aider để đánh giá khả năng cắt giảm token suy luận dư thừa. Kết quả xác nhận cả hai mô hình đều giảm gần 40% số token hoàn thành trung vị so với Qwen3.8-27B gốc mà vẫn giữ nguyên độ chính xác khi giải toán lập trình. Các mô hình ngôn ngữ lớn chuyên suy luận thường tạo ra quá nhiều token suy luận không cần thiết, làm tăng độ trễ và chi phí tính toán. Việc chứng minh các bản tinh chỉnh có thể hạn chế tình trạng suy luận dư thừa mà không làm suy giảm chất lượng mã nguồn mang lại giải pháp tối ưu hóa thiết thực cho cộng đồng AI mã nguồn mở. Được đánh giá ở định dạng lượng hóa Q8_0 trên llama.cpp, cả hai mô hình tinh chỉnh đều đạt tỉ lệ vượt qua bài thử nghiệm khoảng 77% tương tự bản gốc, đồng thời giảm lượng token trung vị cho mỗi lời giải từ 19.3K xuống còn 12.1K–12.8K. ThinkingCap đạt điểm tuyệt đối 100% về định dạng diff chuẩn và vượt trội ở ngôn ngữ JavaScript và Python, trong khi Swift giảm token đồng đều hơn và thể hiện tốt hơn ở ngôn ngữ C++.
## KIẾN THỨC NỀN
Các mô hình suy luận mã nguồn mở hiện đại thường sinh ra các bước suy luận nội bộ trước khi đưa ra kết quả để xử lý các bài toán logic phức tạp. Những bộ thử nghiệm như Aider giúp đánh giá khả năng của mô hình trong việc đọc hiểu mã nguồn sẵn có và tạo ra các bản sửa đổi mã chính xác, đúng định dạng trên nhiều ngôn ngữ lập trình mà không cần sự can thiệp của con người.