AI咨询

每日早报 投融资 最新技术 行业应用 大模型进展

AI知识

AI工具库 AI智能体 AI编程 Hermes 使用 Codex 使用 Claude Code 学习路径 Prompt模板库

AI应用

最佳实践 企业落地 AI赚钱 OPC 一人公司 落地SOP AI成熟度诊断 咨询预约

其他

AI 问答 关于本站
首页 / 最新技术 / 正文

阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单

事件

9月15日,阶跃发布新一代语音大模型 StepAudio 3 系列,一次性推出 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music 五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。其中,多款模型在 权威 第三方 AI 模型评测机构 Artificial Analysis 榜单中位列全球第一。 相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3 将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让 AI 不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。 其中,面向实时语音交互场景的 StepAudio 3 Realtime 支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。在 Artificial Analysis Conversational Dynamics 榜单中,该模型以 98.9% 的综合得分排名全球第一。 与传统实时语音模型主要追求低延迟和自然对话不同,StepAudio 3 Realtime 还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行;Tool Call 和长任务则可以异步执行,在任务运行期间不打断当前对话。其在 Artificial Analysis Speech Reasoning 榜单中同样位列全球第一。 在语音识别方面,StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力结合,不仅要解决“听清楚”,也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。 该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。在 Artificial Analysis 非流式语音识别准确性榜单中,StepAudio 3 ASR 的 WER(词错误率)为 1.7%,并列全球第一。WER 越低意味着转写错误越少,该成绩意味着模型在第三方综合测试中的语音识别准确率已处于全球第一梯队。 除实时交互和语音识别外,此次发布也进一步拓展了语音生成模型的能力边界。 StepAudio 3 TTS 面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。 StepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合到在一起。用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序,广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。 面向音乐创作的 StepAudio 3 Music 不再局限于“一句话生成一首歌”,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于 ABC 记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代,使 AI 更深入参与实际音乐生产流程。 过去一年,语音大模型正从单项的语音识别和生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争。随着 StepAudio 3 系列发布,阶跃音频模型的产品版图,已经全面

来源

本条目由采集管线自动抓取,原始内容见下方来源链接,审核时请补充观点与「对谁有用」的判断。

*采集源:雷锋网*

📎 原始来源:雷锋网
本站内容为摘要与观点整理,不全文转载原文;版权归原作者所有。
💬 对这篇还有疑问?

直接问 AI,回答带站内出处。

就这篇提问

相关内容