~/GITHUB COPIL/github-copilot-adds-local-ai-model-inference-support-with-on-device-orchestration

GitHub Copilot bổ sung khả năng suy luận mô hình AI cục bộ trên thiết bị

Microsoft đã thông báo rằng GitHub Copilot sẽ hỗ trợ suy luận mô hình AI cục bộ vào cuối tháng 10, cho phép chuyển đổi tự động hoặc thủ công giữa đám mây và thiết bị. Lập trình viên có thể chạy các mô hình cục bộ như MAI Code 1.1 Flash mới của Microsoft hoặc kết nối các điểm đầu cuối tương thích với OpenAI. Cập nhật này giúp giảm sự phụ thuộc vào kết nối đám mây, mang lại thời gian phản hồi nhanh hơn, khả năng lập trình ngoại tuyến và tăng cường tính bảo mật mã nguồn cho lập trình viên. Điều này đánh dấu một bước tiến lớn hướng tới điều phối AI hỗn hợp trong các công cụ phát triển phổ biến. Microsoft đã giới thiệu mô hình Mixture-of-Experts MAI Code 1.1 Flash với tổng cộng 137 tỷ tham số nhưng chỉ có 6,8 tỷ tham số hoạt động, được tối ưu hóa qua kỹ thuật lượng hóa và giải mã đầu cơ. Thử nghiệm trên Surface Laptop Ultra cho thấy mô hình đạt tốc độ giải mã cục bộ từ 40 đến 63 token/giây với chiều dài ngữ cảnh từ 2K đến 256K token.

## KIẾN THỨC NỀN

Trước đây, các công cụ hỗ trợ lập trình như GitHub Copilot phụ thuộc hoàn toàn vào các mô hình ngôn ngữ lớn (LLM) lưu trữ trên đám mây do yêu cầu năng lượng tính toán cao để suy luận AI. Suy luận trên thiết bị dựa vào các kỹ thuật như lượng hóa mô hình để chạy LLM cục bộ trên phần cứng người dùng, triệt tiêu độ trễ mạng và cho phép làm việc ngoại tuyến. Điều phối AI hỗn hợp cho phép ứng dụng tự động định tuyến tác vụ giữa phần cứng cục bộ và hạ tầng đám mây dựa trên độ trễ, chi phí và độ phức tạp.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#GitHub Copilot#AI Coding#Local Inference#Microsoft#Developer Tools

$ subscribe --daily

GitHub Copilot bổ sung khả năng suy luận mô hình AI cục bộ trên thiết bị | Daily News