阶跃发布StepAudio 3系列语音大模型,多款模型登顶全球第一
来源:凤凰网 1 小时前

凤凰网科技讯 9月15日,阶跃星辰今日正式发布StepAudio 3系列语音大模型,包含StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型。多款模型在Artificial Analysis榜单中位列全球第一。

StepAudio 3 Realtime支持原生全双工实时对话,在Artificial Analysis Conversational Dynamics榜单中以98.9%综合得分排名全球第一,在Speech Reasoning榜单中以99.7%的语音推理准确率同样位列全球第一。模型可同时理解语义、语气、情绪、副语言和环境声音,支持推理与语音生成并行,Tool Call和长任务可异步执行,不阻塞当前语音会话。

StepAudio 3 ASR将高精度语音识别与大语言模型的上下文理解能力结合,支持中文、英文、方言、中英混说、长音频及专业领域识别,能够处理低声、快语速、含糊连读、歌声和背景音乐等复杂输入,在医疗、法律、金融、汽车、编程等领域提升专业表达识别效果。该模型在Artificial Analysis非流式语音识别准确性榜单中WER仅为1.7%,并列全球第一。

StepAudio 3 TTS面向实时交互场景,在音色基底、语调层次、节奏律动和气口停顿等方面贴合人类自然口语模式,可还原笑声、迟疑、结巴、重复、改口等副语言表现,并基于流式生成架构实现生成与播放同步。

StepAudio 3 Gen支持基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐,可对多个角色的音色、语气、情绪、方言口音及笑声、喘息等副语言特征进行精细控制,并支持对白、音效、环境声和背景音乐的时间与顺序编排。

StepAudio 3 Music支持从零生成及基于ABC记谱法控制的多轮交互创作,覆盖歌曲创作、清唱配乐、歌曲翻唱等功能,用户可通过自然语言控制曲风、人声、旋律、节奏、乐器、情绪及段落结构。模型还对主歌、副歌、桥段等歌曲结构及跨段落旋律发展进行建模,在清唱配乐场景中可理解旋律、节奏和情绪,并补充和声、乐器及完整编曲。

简体中文 English