Người dùng so sánh hiệu năng lập trình của Inkling-Small-276B-12B và Qwen3.6-27B
Một người dùng Reddit đã so sánh hiệu năng lập trình và suy luận của mô hình Inkling-Small-276B-12B từ Thinking Machines với Qwen3.6-27B bằng một câu lệnh phức tạp. Thử nghiệm cho thấy Qwen3.6-27B hoàn thành việc lập kế hoạch cấu trúc và tự sửa lỗi trong 38 giây, trong khi Inkling-Small (được lượng tử hóa ở định dạng UD-Q2_K_XL) mất tới 6 phút suy nghĩ và tạo ra mã nguồn kém tối ưu hơn. So sánh này làm nổi bật sự đánh đổi thực tế giữa các kiến trúc LLM chạy cục bộ, cho thấy mức độ lượng tử hóa và thiết lập mức độ suy luận ảnh hưởng thế nào đến hiệu năng lập trình thực tế và thời gian tạo phản hồi. Nó cũng chứng minh khả năng ngày càng tăng của các mô hình nhỏ hơn như Qwen3.6-27B trong việc thực hiện hiệu quả các tác vụ kỹ thuật phần mềm phức tạp, nhiều bước. Inkling-Small được chạy bằng bản lượng tử hóa 2-bit UD-Q2_K_XL của Unsloth trên hệ thống DGX Spark GB10, mất 6 phút suy nghĩ ở chế độ "max" trước khi xuất mã nguồn. Ngược lại, Qwen3.6-27B hoàn thành tác vụ nhanh hơn nhiều, thực hiện nhiều chu kỳ tự đánh giá, kiểm tra cú pháp và xác minh tính năng trước khi hoàn thiện kết quả.
## KIẾN THỨC NỀN
Inkling-Small là một mô hình đa phương thức trọng số mở được phát triển bởi Thinking Machines Labs, sở hữu tổng cộng 276 tỷ tham số nhưng chỉ có 12 tỷ tham số hoạt động. Các phương pháp lượng tử hóa như UD-Q2_K_XL nén các mô hình lớn xuống độ chính xác 2-bit để chạy vừa trên phần cứng tiêu dùng hoặc doanh nghiệp nhỏ, mặc dù điều này đôi khi có thể làm giảm chất lượng suy luận so với các mô hình có độ chính xác đầy đủ hoặc có nhiều tham số hoạt động hơn.