~/MULTIMODAL A/cloudflare-releases-clef-omni-an-open-weight-multimodal-decision-ai-model

Cloudflare ra mắt Clef-omni, mô hình AI ra quyết định đa thức hỗ trợ âm thanh và video

Cloudflare đã ra mắt Clef-omni, một mô hình AI ra quyết định đa thức mở trọng số có khả năng xử lý trực tiếp văn bản, hình ảnh, âm thanh và video chỉ trong một lời gọi API duy nhất. Được xây dựng dựa trên Qwen3-Omni-30B-A3B-Instruct, trọng số của mô hình hiện đã được phát hành miễn phí trên Hugging Face cùng với dịch vụ lưu trữ trên Cloudflare Workers AI. Bằng cách tiếp nhận trực tiếp các định dạng âm thanh và video mà không cần đến các quy trình chuyển đổi giọng nói hay bóc tách khung hình riêng biệt, Clef-omni đơn giản hóa đáng kể quy trình ra quyết định đa thức tốc độ cao. Việc công khai trọng số mô hình cho phép các nhà phát triển tự lưu trữ hoặc tinh chỉnh hệ thống ra quyết định có cấu trúc với chi phí tối ưu. Clef-omni hoạt động trên kiến trúc Mixture-of-Experts (MoE) gồm tổng cộng 30 tỷ tham số và 3 tỷ tham số hoạt động cho mỗi token, đạt thời gian phản hồi trung vị khoảng 130 ms cho văn bản, 150 ms cho hình ảnh và 1,5 giây cho tệp video 21 giây kèm âm thanh. Được thiết kế chuyên biệt để đưa ra quyết định có cấu trúc thay vì tạo văn bản thông thường, mô hình có mức giá 0,15 USD cho mỗi triệu token đầu vào trên Cloudflare Workers AI.

## KIẾN THỨC NỀN

Các mô hình AI ra quyết định khác với mô hình ngôn ngữ trò chuyện thông thường ở chỗ chúng tập trung vào thực thi tác vụ có cấu trúc và đánh giá theo lược đồ thay vì đối thoại tự do. Trong lĩnh vực AI, các mô hình mở trọng số (open-weight) cho phép người dùng tải về tham số để tự triển khai, trong khi kiến trúc đa thức nguyên bản xử lý trực tiếp video và âm thanh gốc mà không cần chuyển đổi thành văn bản hay hình ảnh tĩnh trước.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Multimodal AI#Cloudflare#Open Source AI#AI Models#Machine Learning

$ subscribe --daily

Cloudflare ra mắt Clef-omni, mô hình AI ra quyết định đa thức hỗ trợ âm thanh và video | Daily News