~/AI MUSIC GEN/developer-releases-open-source-1-2b-diffusion-transformer-for-game-music-generation

Nhà phát triển phát hành mô hình Diffusion Transformer 1,2B mã nguồn mở để tạo nhạc game

Một nhà phát triển đã huấn luyện từ đầu mô hình Diffusion Transformer (DiT) quy mô 1,2 tỷ tham số mang tên "Localsong" để tạo nhạc nền trò chơi. Mô hình được huấn luyện trên một GPU H100 đám mây duy nhất trong vòng 8 ngày, đồng thời trọng số (weights), giao diện WebUI và các mẫu âm thanh đã được phát hành trên Hugging Face. Bản phát hành này cung cấp cho các nhà phát triển trò chơi và nhà sáng tạo một giải pháp thay thế cục bộ, mã nguồn mở để tạo nhạc không lời chất lượng cao với nhiều phong cách khác nhau mà không cần phụ thuộc vào các API độc quyền. Nó chứng minh rằng việc huấn luyện các mô hình tạo âm thanh chuyên biệt, có năng lực tốt đang ngày càng khả thi đối với các nhà phát triển cá nhân sử dụng phần cứng đám mây dễ tiếp cận. Mô hình này sử dụng bộ tự mã hóa biến phân (VAE) từ Stable Audio 3 và chỉ tập trung vào các bản nhạc không lời (không có lời bài hát). Người dùng có thể chạy giao diện WebUI đi kèm trên máy cục bộ bằng trình quản lý gói Python siêu nhanh `uv` thông qua lệnh `uv run webui.py`.

## KIẾN THỨC NỀN

Diffusion Transformer (DiT) kết hợp khả năng tạo dữ liệu của mô hình khuếch tán (diffusion) với kiến trúc transformer có khả năng mở rộng cao, vốn được sử dụng rộng rãi trong các mô hình AI tiên tiến nhất hiện nay. Stable Audio sử dụng kiến trúc Mô hình Khuếch tán Ẩn (LDM), trong đó bộ tự mã hóa biến phân (VAE) nén âm thanh vào một không gian ẩn nhỏ gọn để xử lý hiệu quả. Công cụ `uv` là một trình quản lý gói Python hiện đại, cực nhanh được viết bằng Rust giúp đơn giản hóa việc quản lý các thư viện phụ thuộc và thực thi dự án.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#AI Music Generation#Diffusion Transformer#Open Source Models#Machine Learning

$ subscribe --daily

Nhà phát triển phát hành mô hình Diffusion Transformer 1,2B mã nguồn mở để tạo nhạc game | Daily News