Ra mắt mô hình lập trình TielCoder 35B-A3B MoE với lượng tử hóa 4-bit tối ưu
Một mô hình lập trình Mixture of Experts (MoE) 35B-A3B mới mang tên TielCoder đã được phát hành, được xây dựng dựa trên bản tinh chỉnh Ornith-1.5. Phiên bản lượng tử hóa 4-bit dung lượng 22 GB của mô hình này được cho là đạt hiệu năng ngang ngửa với các mô hình lớn hơn như Opus4.6 medium trên các tác vụ lập trình thực tế trong khi vẫn chạy hiệu quả trên phần cứng tiêu dùng. Bản phát hành này cung cấp cho người dùng LLM cục bộ một trợ lý lập trình hiệu quả, nhanh chóng và mạnh mẽ có thể chạy trên phần cứng cấp tiêu dùng. Bằng cách tận dụng kiến trúc MoE và lượng tử hóa tiên tiến, nó thu hẹp khoảng cách giữa các mô hình độc quyền khổng lồ và các thiết lập cục bộ bị giới hạn tài nguyên. TielCoder sử dụng ma trận tầm quan trọng (imatrix) được tối ưu trọng số theo mã nguồn để lượng tử hóa động, đồng thời tích hợp mẫu trò chuyện tối ưu hóa hiệu quả sử dụng token cho lập trình dạng agent. Mô hình hiện có sẵn ở cả định dạng GGUF và Apple MLX, giúp dễ dàng tiếp cận trên macOS cũng như các thiết lập CPU/GPU.
## KIẾN THỨC NỀN
Các mô hình Mixture of Experts (MoE) chứa một lượng lớn tổng số tham số nhưng chỉ kích hoạt một phần nhỏ (tham số hoạt động, ví dụ 3B trong mô hình 35B) cho mỗi token, giúp giảm chi phí tính toán khi suy luận. Lượng tử hóa ma trận tầm quan trọng (imatrix) sử dụng dữ liệu hiệu chuẩn để giảm thiểu suy giảm chất lượng khi nén mô hình xuống số bit thấp hơn, trong khi khung MLX của Apple tối ưu hóa việc thực thi học máy dành riêng cho Apple Silicon.