阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一
1 小时前

阶跃公司正式发布了StepAudio3系列模型,该系列包含五款模型:StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music。目前,多款模型已在Artificial Analysis相关榜单上荣登全球榜首,且均已上线阶跃星辰开放平台。其中,StepAudio3Realtime支持原生全双工实时对话,能够理解多维度音频信息,实现推理与语音生成的并行处理,以及工具调用的异步执行,在相关榜单中位居全球第一。StepAudio3ASR结合了高精度识别与大语言模型能力,适应多场景和复杂输入,词错误率低至1.7%,同样并列全球第一。StepAudio3TTS则贴合人类口语模式,能够还原副语言表现,自主调整情绪语气,并支持流式生成。StepAudio3Gen能够基于描述统一生成包含人声、音效等的完整音频,并能精细控制声音特征与时序。而StepAudio3Music则支持从零生成音乐及多轮交互创作,能够基于多种输入完善作品,并控制曲风等元素,建模歌曲结构。

简体中文 English