StepFun Ra Mắt Dòng Mô Hình Voice AI StepAudio 3, Dẫn Đầu Nhiều Bảng Xếp Hạng Toàn Cầu
Công ty AI StepFun đã chính thức ra mắt bộ mô hình StepAudio 3 trên nền tảng mở của mình, bao gồm StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen và StepAudio3Music. Các mô hình này đã giành vị trí dẫn đầu trên nhiều bảng xếp hạng của Artificial Analysis, bao gồm Conversational Dynamics (98,9%), Speech Reasoning (99,7%) và tỷ lệ lỗi từ (WER) của ASR phi luồng (1,7%). Dòng sản phẩm StepAudio 3 thúc đẩy sự phát triển của voice AI thế hệ mới nhờ khả năng đối thoại song công (full-duplex) thời gian thực, suy luận trực tiếp từ âm thanh và thực thi công cụ mà không làm gián đoạn cuộc trò chuyện. Hướng tiếp cận đa phương thức hợp nhất này giúp đơn giản hóa quy trình sản xuất âm thanh toàn diện và nâng cao tương tác giữa người với AI trong các lĩnh vực như chăm sóc khách hàng, trò chơi, truyền thông và doanh nghiệp. StepAudio 3 Realtime hỗ trợ gọi công cụ (tool call) bất đồng bộ và suy luận âm thanh song song trong khi đang tạo câu trả lời, cho phép người dùng ngắt lời hoặc giao nhiệm vụ ẩn một cách mượt mà. Ngoài ra, StepAudio 3 Gen hợp nhất khả năng tạo thoại, cảm xúc giọng nói, âm thanh môi trường, hiệu ứng tiếng động và nhạc nền chỉ trong một mô hình điều khiển bằng câu lệnh.
## KIẾN THỨC NỀN
Các hệ thống voice AI song công (full-duplex) cho phép mô hình vừa nghe vừa phản hồi đồng thời tương tự như con người, xử lý tốt các tình huống bị ngắt lời hoặc tạm dừng tự nhiên. Những nền tảng đánh giá như Artificial Analysis xếp hạng các mô hình speech-to-speech này dựa trên những tiêu chí như động lực hội thoại (conversational dynamics), khả năng thực thi tác vụ của agent và năng lực suy luận trực tiếp từ âm thanh.