~/AI MODELS/microsoft-releases-fara1-5-27b-a-vision-only-multimodal-browser-automation-agent

Microsoft ra mắt Fara1.5-27B: Mô hình đa phương thức chỉ dùng thị giác để tự động hóa trình duyệt

Microsoft Research đã phát hành Fara1.5-27B, một tác nhân sử dụng máy tính đa phương thức chỉ dùng thị giác được tinh chỉnh từ Qwen3.5-27B nhằm tự động hóa các tác vụ trên trình duyệt web. Mô hình này hoạt động bằng cách phân tích ảnh chụp màn hình và đưa ra các lệnh gọi công cụ có cấu trúc, chẳng hạn như nhấp chuột và cuộn trang, để hoàn thành các tác vụ từ đầu đến cuối. Bản phát hành này thúc đẩy lĩnh vực tác nhân sử dụng máy tính bằng cách chứng minh rằng việc tự động hóa trình duyệt hiệu quả có thể đạt được hoàn toàn thông qua nhận thức thị giác mà không cần phụ thuộc vào DOM hay cây hỗ trợ tiếp cận. Nó cung cấp một tùy chọn trọng số mở chuyên biệt cho các nhà phát triển muốn xây dựng các quy trình tự động hóa web cục bộ và hiệu quả. Fara1.5-27B được huấn luyện trên dữ liệu tổng hợp do đường ống FaraGen1.5 tạo ra và được thiết kế đồng bộ để chạy với MagenticLite, một ứng dụng tác nhân nhẹ. Tuy nhiên, mô hình này bị giới hạn ở tiếng Anh, dễ bị tấn công chèn prompt qua hình ảnh và dễ tích tụ lỗi trong các chuỗi hành động nhiều bước.

## KIẾN THỨC NỀN

Các tác nhân sử dụng máy tính (CUA) là các hệ thống AI được thiết kế để tương tác với giao diện kỹ thuật số giống như con người, chẳng hạn như điều khiển con trỏ hoặc gõ phím. Trong khi nhiều tác nhân web truyền thống dựa vào việc phân tích Mô hình Đối tượng Tài liệu (DOM) hoặc cây hỗ trợ tiếp cận của trang web, các tác nhân chỉ dùng thị giác tương tác với giao diện hoàn toàn bằng cách xử lý các pixel hình ảnh, giúp chúng dễ thích ứng hơn với các bố cục khác nhau nhưng cũng dễ bị ảnh hưởng bởi các lỗi hiển thị hình ảnh.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Models#Computer Use Agents#Multimodal AI#Open Source

$ subscribe --daily

Microsoft ra mắt Fara1.5-27B: Mô hình đa phương thức chỉ dùng thị giác để tự động hóa trình duyệt | Daily News