阶跃发布StepAudio 3全家桶

阶跃星辰一次发布五款StepAudio 3模型,覆盖实时交互、ASR、TTS、通用音频生成和音乐创作。真正值得关注的不是数量,而是语音AI开始从单点能力走向完整生产链路。
阶跃发布StepAudio 3全家桶
阶跃星辰在今天(2026年9月15日)正式发布StepAudio 3系列,一次推出StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music五款模型。 五款模型分别覆盖实时语音交互、自动语音识别、语音合成、完整音频生成和音乐创作,目前均已上线阶跃星辰开放平台。
StepAudio 3是阶跃面向语音理解与音频生成推出的新一代模型系列。 与只发布一个通用语音模型不同,阶跃这次将能力拆分成五个面向生产场景的模型,开发者可以根据延迟、生成质量和任务类型选择,而不是让一个模型同时兼顾所有指标。

五款模型分别解决什么问题
StepAudio 3系列的核心变化,是把语音AI从“能听、能说”扩展到“能交互、能执行、能创作”。 五款模型看起来名称相近,实际对应的产品形态和性能约束并不相同。
| 模型 | 核心定位 | 典型场景 | 已公布亮点 | 截至发布日的公开指标 | |---|---|---|---|---| | StepAudio3Realtime | 原生全双工实时语音模型 | AI助手、智能座舱、陪伴应用、语音客服 | 支持打断、持续聆听、并行推理和异步工具调用 | Conversational Dynamics 98.9%;Speech Reasoning 99.7% | | StepAudio3ASR | 自动语音识别模型 | 会议转写、字幕、客服质检、复杂环境录音 | 面向噪声、多人和复杂声学环境进行识别 | 官方暂未公布统一CER或WER数据 | | StepAudio3TTS | 真人级语音合成模型 | 数字人、播客、有声内容、交互式角色 | 强调语调、节奏、气口和副语言还原 | 官方暂未公布统一MOS数据 | | StepAudio3Gen | 通用音频内容生成模型 | 音效、环境声、广告和影视素材 | 目标是生成完整音频内容,而非只朗读文字 | 官方暂未公布标准化跑分 | | StepAudio3Music | 音乐生成模型 | 配乐、歌曲Demo、短视频音乐和创意辅助 | 面向音乐结构与风格创作 | 官方暂未公布标准化跑分 |
这套拆分方式比强行宣传一个“万能音频模型”更符合真实部署需求。 ASR追求低错误率、长音频稳定性和吞吐量,TTS更在意首包延迟、自然度与音色一致性,Realtime则必须同时解决端点检测、打断、轮次判断和生成延迟;音乐生成面对的又是分钟级结构、旋律发展与编曲一致性。它们共享音频基础能力,但优化目标并不相同。
StepAudio3Realtime拿到两个榜单第一
StepAudio3Realtime是这次发布中最值得关注的模型,也是公开指标最完整的一款。 根据阶跃披露的数据,该模型在第三方评测机构Artificial Analysis的Conversational Dynamics榜单中获得98.9%的综合得分,并在Speech Reasoning榜单中以99.7%的语音推理准确率排名第一。
Conversational Dynamics是用于衡量实时语音模型对话节奏和轮次处理能力的评测。 它关注的不是模型回答了多少知识题,而是模型能否判断用户是否说完、何时应该接话、遭遇打断后能否停止,以及面对简短反馈时是否继续原有话题。
Speech Reasoning是用于衡量模型直接从音频中获取信息并完成推理的评测。 这类测试不会只检查转写文本是否正确,还会考察模型能否利用语气、重音、说话状态和声音事件理解问题,然后给出符合音频上下文的答案。
98.9%和99.7%不能简单理解为模型已经在真实场景中达到接近100%的成功率。 榜单成绩反映的是特定测试集和计分规则下的能力上限,并不等于网络抖动、方言、回声、多人抢话和麦克风质量变化下的线上体验。尤其是Conversational Dynamics综合分,它也不是用户偏好率,更不能直接等同于真人感。
这两个成绩仍然证明阶跃已经进入实时语音模型的第一梯队。 过去语音助手最明显的问题不是“不懂知识”,而是交互节奏僵硬:用户没说完它就抢答,用户打断后它还继续播放,或者每句话之间都出现明显等待。实时语音产品要跨过可用门槛,首先要解决的正是这些看似细小、实际极其影响体验的问题。
全双工不只是允许用户插话
原生全双工实时对话是指模型可以持续接收音频,并在输出语音的同时继续监听用户输入。 传统语音助手通常采用“录音—识别—思考—合成—播放”的串行流程,系统说话时往往暂停理解输入,因此所谓打断只是检测到声音后停止播放器,并不代表模型理解了打断内容。
StepAudio3Realtime试图把打断升级为对话状态的一部分。 模型不仅要停止当前发言,还要判断用户是在纠正事实、补充条件、表示同意,还是只发出了笑声和迟疑声。相同的一句“等等”,可能意味着暂停任务,也可能意味着用户要修改目的地,两者需要完全不同的后续动作。
模型对副语言信息的直接利用,是端到端语音路线相对级联系统的重要优势。 副语言是指不完全由文字承载的声音线索,包括语气、情绪、停顿、笑声、叹气、犹豫、重音和语速。用户用平静语气说“没问题”和用明显不耐烦的语气说“没问题”,转写结果一样,但真实意图可能相反。
| 技术路线 | 工作方式 | 优点 | 主要问题 | |---|---|---|---| | 传统级联语音系统 | ASR转成文字,再交给语言模型,最后由TTS朗读 | 模块成熟、便于替换、成本可控 | 信息经过文字中转后,语气和环境声容易丢失;多个阶段叠加延迟 | | 端到端实时语音模型 | 直接理解音频上下文,并生成语音响应 | 能保留情绪、副语言和声音事件,交互更连贯 | 训练和部署复杂,调试可解释性较弱,算力压力更高 |
阶跃并不是第一家走端到端语音路线的公司,但它正在把这条路线做成可部署的模型产品。 OpenAI、Google、字节跳动以及国内多家大模型厂商都已将实时语音视为下一代人机交互入口,竞争重点也从“是否支持语音”转向首包延迟、打断准确率、任务执行能力和长对话稳定性。
边说边想,比单纯低延迟更重要
StepAudio3Realtime支持推理与语音生成并行,这意味着模型可以先快速回应,同时继续组织后续内容。 人类对话并不是在脑中写完一整段答案后才开口,而是先确认问题、给出结论,再逐步补充细节;实时模型采用类似策略,可以缩短用户感知到的等待时间。
并行生成的价值在复杂问题上尤其明显。 例如用户在车内询问一条涉及天气、充电站和拥堵情况的路线,模型可以先回应“我来比较两条路线”,随后继续查询工具并补充结果,而不是沉默数秒后一次性播报全部内容。
StepAudio3Realtime还允许Tool Call和长任务异步执行,不阻塞当前语音会话。 异步工具调用是指模型发起搜索、计算或设备控制任务后,仍能继续与用户对话,待任务完成再把结果自然带回当前上下文。这比让用户盯着加载动画,或者听一段循环等待音,更接近真人助理的工作方式。
异步执行也会带来新的产品风险。 当用户在任务执行期间修改条件,系统必须知道是取消旧任务、更新参数还是并行创建新任务;当工具返回结果时,模型还要判断当前话题是否适合插入。实时语音模型未来的差距,很可能不只来自基础模型,而是来自整套任务状态管理系统。
TTS开始追求不完美的“活人感”
StepAudio3TTS是面向自然口语和实时交互设计的语音合成模型。 阶跃强调它能够在音色基底、语调层次、节奏律动、气口和停顿等方面贴近人类口语,并可生成笑声、迟疑、结巴和重复等副语言现象。
高质量TTS的竞争已经从“字音正确”进入“表达合理”。 早期语音合成主要检查是否读错字、漏字,如今主流模型在清晰度上已经足够可用,真正影响听感的是一句话该在哪里加速、哪里放慢、哪个词需要重读,以及情绪是否与内容一致。
适度生成迟疑和重复并不是单纯制造瑕疵。 在角色对话、陪伴产品和互动游戏中,过于标准、每句话气息都完全稳定的声音反而容易暴露机器感。不过这项能力需要可控,否则在客服播报、导航和无障碍阅读场景中,结巴与重复只会降低信息效率。
StepAudio3TTS目前最需要补充的是可量化数据。 截至发布时,公开资料尚未给出统一的首包延迟、实时率、说话人相似度、MOS主观评分以及长文本稳定性数据,因此暂时无法依据同一口径与其他商业TTS产品进行严格横向比较。
ASR、音频生成和音乐模型补齐产品链
StepAudio3ASR是面向复杂场景语音理解的自动语音识别模型。 ASR即Automatic Speech Recognition,核心任务是将语音转换为文字,但生产环境还会涉及方言、专业词汇、多人分离、时间戳、标点恢复和噪声鲁棒性。
独立发布ASR模型说明阶跃没有把所有需求都押在端到端对话上。 会议纪要、视频字幕、录音质检和内容审核并不需要模型用语音回答,企业更关心识别错误率、长音频处理成本和并发吞吐。为这些场景保留专用模型,是更现实的商业选择。
StepAudio3Gen是面向完整音频内容生成的通用模型。 它与TTS的区别在于,TTS主要把文字变成可听语言,而音频生成还需要处理环境声、动作音效、空间氛围以及多种声音元素的组合,例如生成一段“雨夜车站里列车驶过并伴随广播”的音频素材。
StepAudio3Music是面向音乐创作的生成模型。 音乐模型不仅要生成局部听感合格的声音,还要维持节奏、和声、旋律和段落结构;当生成时长从十几秒增加到数分钟后,结构是否发展、主题是否重复得当,通常比瞬间音质更难。
Gen与Music的加入让StepAudio 3不再只是语音交互套件。 阶跃正在尝试覆盖从输入理解、实时对话、声音表达,到音效和音乐内容生产的完整链路,这与只做智能助手的产品方向相比,潜在市场扩展到了短视频、游戏、影视、广告和数字内容制作。
五款齐发背后的判断
阶跃这次真正释放的信号,是音频模型正在从单项跑分竞争进入平台化阶段。 开发者不再满足于一个能聊天的语音Demo,而是希望同一家供应商同时提供识别、合成、对话和内容生成能力,减少音色、格式、延迟和上下文系统之间的适配成本。
五个专用模型共享技术底座、分别优化,比一个模型包办所有任务更容易控制成本。 实时通话需要持续占用推理资源,批量转写更适合高吞吐处理,音乐生成则允许更长等待时间。如果全部使用同一个高规格模型,很多简单任务会为不需要的能力支付额外算力。
StepAudio 3当前最大的优势是实时交互指标明确,最大的缺口则是商业数据披露不足。 Realtime已经拿出98.9%和99.7%两项第三方榜单成绩,但ASR、TTS、Gen和Music仍缺少价格、延迟、生成时长、上下文窗口及标准评测结果。对于开发者而言,模型能否进入生产环境,最终取决于每小时成本、并发限制和失败率,而不只是演示效果。
榜单第一也不会自动转化为产品第一。 真实语音应用需要处理网络丢包、回声消除、麦克风阵列、隐私合规、敏感操作确认和跨设备状态同步;任何一个工程环节不稳定,都可能抵消基础模型的优势。
谁最值得现在关注StepAudio 3
实时助手和智能终端团队最值得优先测试StepAudio3Realtime。 智能座舱、耳机、机器人和陪伴硬件都要求模型在用户随时插话的情况下保持上下文,而异步工具调用也更适合导航、设备控制和长任务执行。
内容生产团队更应该关注StepAudio3TTS、StepAudio3Gen和StepAudio3Music之间的组合。 一条短视频可以由TTS完成旁白、Gen生成环境与动作音效、Music提供背景音乐,如果三者在同一平台内具备统一的控制方式,制作链路会比拼接多个独立工具更简单。
企业转写和质检团队则需要等待StepAudio3ASR的更多硬指标。 在没有公开中文字符错误率、英文词错误率、长音频速度和价格之前,仅凭“复杂场景理解”还不足以判断它能否替代现有ASR系统。
OpenAI Hub观点
StepAudio 3是一次有野心、也相当务实的产品发布。 有野心的一面在于,阶跃一次覆盖实时对话、识别、合成、音频和音乐五条产品线;务实的一面在于,它没有用一个“全能模型”包装所有任务,而是承认不同音频场景需要不同的延迟、质量和成本平衡。
StepAudio3Realtime比五款模型齐发本身更有战略价值。 98.9%的Conversational Dynamics得分和99.7%的Speech Reasoning准确率,为阶跃提供了清晰的第三方能力背书,而并行推理、原生全双工和异步工具调用,也比单纯宣传音色自然更接近下一代智能终端的核心需求。
StepAudio 3能否真正改写市场格局,还要看阶跃接下来是否公开完整评测和部署成本。 如果ASR、TTS、Gen和Music也能拿出与Realtime同样透明的数据,并在高并发和长时间运行中保持稳定,这套模型才算从“榜单全家桶”走向真正可用的音频基础设施。
参考来源
- IT之家:阶跃发布StepAudio 3系列语音大模型,拿下多个全球第一 —— 汇总五款模型的发布信息、应用方向及Realtime第三方榜单成绩。
- GitHub:Step-Audio项目仓库 —— 阶跃此前Step-Audio技术路线、模型资料与开源项目入口,可用于了解其语音理解和生成基础架构。



