Người dùng gặp lỗi khi sử dụng Qwen 3.8 27B để lập trình tự động trong VSCode
Một lập trình viên đã chia sẻ khó khăn khi sử dụng phiên bản lượng tử hóa (Q6_K) của mô hình Qwen 3.8 27B cho các tác vụ lập trình tự động (agentic coding) trong VSCode. Dù sở hữu phần cứng mạnh mẽ (2 card RTX 3090 Ti) và sử dụng các công cụ như Cline và MCP, mô hình này vẫn gặp hiện tượng lặp vô hạn và không hoàn thành chính xác công việc so với DeepSeek hay Claude. Sự việc này cho thấy ngay cả khi có phần cứng cục bộ mạnh mẽ và các mô hình lượng tử hóa chất lượng cao, việc chạy các quy trình tự động phức tạp tại máy cục bộ vẫn là một thách thức so với các API đám mây. Nó nhấn mạnh khoảng cách hiện tại về khả năng suy luận và độ tin cậy khi sử dụng công cụ giữa các mô hình mã nguồn mở cục bộ và các giải pháp độc quyền như Claude. Người dùng đã chạy bản lượng tử hóa Q6_K của mô hình thông qua LM Studio trên Windows 11 với cửa sổ ngữ cảnh 50k token, được chuyển hoàn toàn sang hai GPU xử lý. Dù đã điều chỉnh các mẫu gợi ý (prompt template) để giảm bớt nỗ lực suy luận, mô hình vẫn liên tục tiêu tốn lượng lớn token và cố gắng sửa các lỗi không hề tồn tại.
## KIẾN THỨC NỀN
Lập trình tự động (agentic coding) liên quan đến việc các mô hình AI hoạt động như các tác nhân có thể tự động sử dụng công cụ, đọc tệp và viết mã thông qua các tiện ích mở rộng như Cline và Giao thức ngữ cảnh mô hình (MCP). Lượng tử hóa (như Q6_K) là một kỹ thuật được sử dụng để nén các mô hình ngôn ngữ lớn nhằm giúp chúng vừa với bộ nhớ GPU cục bộ, mặc dù đôi khi nó có thể làm giảm hiệu suất suy luận.