~/AI/alibaba-releases-qwen-image-3-0-with-advanced-text-rendering-and-4

Alibaba Ra Mắt Qwen-Image-3.0 Với Khả Năng Vẽ Chữ Nâng Cao Và Hỗ Trợ 4.5k Token

Alibaba đã chính thức ra mắt Qwen-Image-3.0, một mô hình nền tảng tạo ảnh mới hỗ trợ đầu vào siêu dài lên tới 4.5k token. Mô hình này cho phép hiển thị gốc (native rendering) 12 ngôn ngữ và hơn 20 phông chữ, giúp tạo ra các bố cục phức tạp như bài báo khoa học và giao diện người dùng nhiều lớp. Sự ra mắt này chuyển dịch trọng tâm của việc tạo ảnh bằng AI từ các kết quả thuần thẩm mỹ sang các tài nguyên thương mại có tính thực tiễn cao và sẵn sàng đưa vào sản xuất. Bằng cách giải quyết thách thức lâu đời về hiển thị văn bản chính xác và bố cục không gian phức tạp, mô hình giúp giảm đáng kể chi phí sản xuất áp phích đa ngôn ngữ, tài liệu giáo dục và kịch bản phân cảnh. Qwen-Image-3.0 có thể hiển thị rõ ràng các chữ nhỏ xuống tới 10px và hỗ trợ các công thức toán học LaTeX phức tạp, thiết kế giao diện người dùng lồng nhau và đồ họa thông tin dạng lưới 9 ô trong một lần tạo duy nhất. API của mô hình hiện đã có sẵn để thử nghiệm trên các nền tảng Bailian của Alibaba Cloud và Qwen AI.

## KIẾN THỨC NỀN

Lịch sử cho thấy các mô hình chuyển văn bản thành hình ảnh như Midjourney và Stable Diffusion thường gặp khó khăn trong việc hiển thị văn bản, thường tạo ra chữ viết sai chính tả hoặc không thể đọc được. Qwen-Image là một chuỗi các mô hình tạo và chỉnh sửa hình ảnh được phát triển bởi đội ngũ Qwen của Alibaba, với các phiên bản trước tập trung vào độ chính xác và tính thẩm mỹ, trong khi thế hệ thứ ba này ưu tiên tính thực dụng.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI#Image Generation#Qwen#Machine Learning

$ subscribe --daily