~/ARTIFICIAL I/elevenlabs-releases-v4-and-v4-turbo-voice-models-with-10-second-voice

ElevenLabs ra mắt mô hình giọng nói v4 và v4 Turbo hỗ trợ nhân bản từ 10 giây âm thanh

ElevenLabs đã chính thức ra mắt các mô hình giọng nói thế hệ mới v4 và v4 Turbo dựa trên một kiến trúc hoàn toàn mới. Phiên bản cập nhật này mang đến khả năng nhân bản giọng nói chỉ từ 10 giây âm thanh, hỗ trợ hơn 90 ngôn ngữ, giảm độ trễ phát trực tuyến cho các tác vụ trò chuyện AI và cải thiện kiểm soát cảm xúc. Khi nhu cầu ứng dụng các trợ lý giọng nói AI trong doanh nghiệp tăng mạnh, việc giảm độ trễ phát trực tuyến và mở rộng hỗ trợ ngôn ngữ là chìa khóa cho các tương tác chăm sóc khách hàng tự nhiên. Đợt phát hành này củng cố vị thế dẫn đầu của ElevenLabs trong lĩnh vực tổng hợp âm thanh AI khi doanh thu thường niên (ARR) của hãng vượt 600 triệu USD và hướng tới kế hoạch IPO trong tương lai. Kiến trúc v4 cho phép mô hình bắt đầu tạo âm thanh đồng thời ngay khi mô hình ngôn ngữ lớn (LLM) vừa xuất phản hồi văn bản, giúp xử lý linh hoạt các tình huống cuộc gọi phức tạp như tranh luận hay chờ máy. Ngoài ra, người dùng hiện có thể xếp chồng nhiều thẻ lệnh (inline tags) theo thứ tự để điều chỉnh ngữ điệu và cảm xúc giọng nói một cách linh hoạt trên các đoạn văn bản dài.

## KIẾN THỨC NỀN

ElevenLabs là công ty hàng đầu về giọng nói nhân tạo, cung cấp công nghệ chuyển văn bản thành giọng nói (TTS) và tạo âm thanh chân thực. Trong lĩnh vực AI trò chuyện, các mô hình TTS phát trực tuyến (streaming TTS) xử lý luồng văn bản theo thời gian thực từ các mô hình ngôn ngữ lớn để tạo ra giọng nói tự nhiên với độ trễ tối thiểu. Thẻ lệnh (inline tags) là các chỉ dẫn được chèn trực tiếp vào văn bản nhằm giúp mô hình TTS điều chỉnh cảm xúc, nhịp điệu và ngữ điệu ngay giữa câu.

## TÀI LIỆU THAM KHẢO

## TỪ KHÓA

#Artificial Intelligence#Text-to-Speech#Voice Cloning#ElevenLabs#AI Voice

$ subscribe --daily

ElevenLabs ra mắt mô hình giọng nói v4 và v4 Turbo hỗ trợ nhân bản từ 10 giây âm thanh | Daily News