阶跃发布 StepAudio 3 系列语音大模型,多款登顶 Artificial Analysis 全球榜单
原标题:阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单
AI 摘要
阶跃于9月15日发布新一代语音大模型 StepAudio 3 系列,一次性推出 Realtime、ASR、TTS、Gen 和 Music 五款模型,覆盖实时语音交互、语音识别、语音生成和音乐创作等场景。多款模型在 Artificial Analysis 榜单中位列全球第一,其中 Realtime 在 Conversational Dynamics 榜单以 98.9% 综合得分排名第一,ASR 在非流式语音识别准确性榜单以 1.7% 的 WER 并列全球第一。五款模型均已上线阶跃星辰开放平台。
正文节选
0 9月15日,阶跃发布新一代语音大模型 StepAudio 3 系列,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。其中,多款模型在权威第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。 相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让 AI 不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。 其中,面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中,该模型以 98.9% 的综合得分排名全球第