~/AI/inclusion-ai-introduces-ling-3-0-flash-vl-with-visual-understanding-and

Inclusion AI ra mắt Ling-3.0-flash-VL với khả năng hiểu thị giác và đại lý AI

Inclusion AI đã giới thiệu Ling-3.0-flash-VL, một phiên bản mở rộng thị giác - ngôn ngữ được xây dựng trên mô hình nền tảng Ling-3.0-flash. Mô hình cập nhật này bổ sung nhận thức thị giác và khả năng thực thi tác vụ đại lý đa phương thức trong các lĩnh vực như lý luận STEM, xử lý tài liệu thông minh, lập trình giao diện và đọc báo cáo y tế. Bổ sung khả năng hiểu thị giác vào các mô hình ngôn ngữ hiệu suất cao giúp các nhà phát triển triển khai quy trình đại lý thị giác một cách tiết kiệm chi phí hơn. Điều này mang lại các khả năng như phân tích màn hình giao diện và đọc tài liệu phức tạp vào môi trường triển khai thực tế. Mô hình Ling-3.0-flash nền tảng sử dụng kiến trúc Mixture-of-Experts (MoE) với tổng cộng 124 tỷ tham số, nhưng chỉ kích hoạt 5,1 tỷ tham số mỗi token để đạt tốc độ xử lý nhanh. Ling-3.0-flash-VL tận dụng kiến trúc này để thêm khả năng xử lý đa phương thức mà không làm giảm hiệu suất tính toán.

## KIẾN THỨC NỀN

Mixture-of-Experts (MoE) là một kỹ thuật học máy, trong đó chỉ một tập hợp con các tham số (các chuyên gia) được kích hoạt cho mỗi token, giúp giảm chi phí tính toán trong khi vẫn duy trì dung lượng mô hình lớn. Mô hình ngôn ngữ - thị giác (VLM) kết hợp đầu vào hình ảnh với xử lý văn bản, cho phép hệ thống AI hiểu được hình ảnh, sơ đồ và giao diện người dùng cùng với văn bản hướng dẫn.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI#Multimodal#Vision-Language Models#LocalLLaMA#Machine Learning

$ subscribe --daily

Inclusion AI ra mắt Ling-3.0-flash-VL với khả năng hiểu thị giác và đại lý AI | Daily News