~/SPEECH RECOG/stepfun-releases-stepaudio-3-series-scoring-top-ranks-on-global-benchmarks

StepFun Releases StepAudio 3 Series, Scoring Top Ranks on Global Benchmarks

AI startup StepFun has officially launched its StepAudio 3 model suite, including StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen, and StepAudio3Music on its open platform. The models achieved top rankings on several Artificial Analysis benchmarks, including Conversational Dynamics (98.9%), Speech Reasoning (99.7%), and non-streaming ASR word error rate (1.7%). The StepAudio 3 lineup advances native audio AI by enabling simultaneous full-duplex conversation, complex audio-based reasoning, and tool execution without interrupting interaction flow. This integrated multimodal approach simplifies end-to-end audio production and improves real-time human-AI interaction across customer support, gaming, media, and enterprise applications. StepAudio 3 Realtime supports asynchronous tool calling and parallel audio reasoning while generating responses, allowing users to make interruptions or assign background tasks seamlessly. Additionally, StepAudio 3 Gen unifies dialogue, vocal nuances, ambient noise, sound effects, and music generation into a single prompt-driven model.

## BACKGROUND

Full-duplex speech AI systems allow models to listen and respond simultaneously like humans, processing mid-sentence interruptions and natural pauses. Benchmark platforms like Artificial Analysis evaluate these speech-to-speech models across metrics such as conversational dynamics, agentic task execution, and direct speech reasoning.

## REFERENCES

## KEYWORDS

#Speech Recognition#Audio AI#Multimodal AI#Real-time AI#AI Models

$ subscribe --daily

StepFun Releases StepAudio 3 Series, Scoring Top Ranks on Global Benchmarks | Daily News