千问TTS开始控制“喘气”

阿里发布 Qwen-Audio-3.0-TTS,以结构化标签控制笑声、呼吸和情绪,并用 Flash、Plus 两个版本分别覆盖实时对话与高质量配音。
千问TTS开始控制“喘气”
阿里千问在 7 月 20 日发布了新一代语音合成模型 Qwen-Audio-3.0-TTS,产品线分为面向实时交互的 Flash 版本和面向高质量生成的 Plus 版本。新模型支持 48kHz 音频输出、最长 3 分钟单次合成、16 种语言与 20 种中文方言,其中 Qwen-Audio-3.0-TTS-Plus 已登上第三方评测平台 Artificial Analysis 的语音合成榜单首位。
Qwen-Audio-3.0-TTS 是一组把文本转换为可控语音的生成模型,其核心变化不是单纯让声音“更像真人”,而是让开发者能够直接控制一句话怎样被说出来。用户可以在文本中嵌入 [gasp]、[giggles]、[angry] 等结构化标签,对抽气、轻笑、愤怒以及呼吸细节进行局部调节。
这次升级真正值得注意的地方,是语音生成的控制粒度终于从“整段风格”下沉到了“句内动作”。过去的 TTS 通常允许选择音色、语速和整体情绪,但很难准确表达“说到这里轻笑一下”“这个词要带着怒气”“停顿前先吸一口气”;Qwen-Audio-3.0-TTS 试图把这些原本依赖配音演员和后期剪辑的动作,变成可写进文本的生成条件。

Flash 和 Plus 不是高低配,而是两条产品路线
Qwen-Audio-3.0-TTS-Flash 是面向实时语音交互优化的低延迟版本,官方给出的首包延时为 300ms 级别。首包延时是系统收到文本后开始返回第一段可播放音频所需的时间,它比完整生成耗时更直接地决定语音助手会不会让用户感觉“卡住了”。
Qwen-Audio-3.0-TTS-Plus 是面向成品质量优化的高质量版本,重点放在多语种、复杂声学环境、指令遵循和最终听感上。根据阿里披露的信息,Plus 版本在 Artificial Analysis 的相关语音合成评测中位列第一,但目前公开报道没有给出各分项得分、参评快照和与第二名的具体差距,因此“冠军”可以证明它进入了第一梯队,却不能被简单理解为所有场景都全面领先。
两个版本的定位可以概括如下:
| 对比维度 | Qwen-Audio-3.0-TTS-Flash | Qwen-Audio-3.0-TTS-Plus | |---|---|---| | 核心定位 | 实时交互、语音 Agent、在线客服 | 精品配音、内容生产、多语种成品 | | 首包延时 | 300ms 级别 | 官方暂未公布具体数字 | | 主要优化方向 | 快速开始播放、降低等待感 | 自然度、表达力、语言覆盖与鲁棒性 | | 细粒度标签 | 支持 | 支持 | | Freestyle 指令 | 支持 | 支持,强调高质量遵循 | | 输出规格 | 最高 48kHz | 最高 48kHz | | 单次合成长度 | 最长 3 分钟 | 最长 3 分钟 | | 典型场景 | 实时助手、数字人对话、客服播报 | 有声内容、广告、游戏与影视配音 | | 第三方榜单表现 | 官方未披露榜单名次 | Artificial Analysis 榜首 | | 公开价格 | 截至发布时,参考资料未提供 | 截至发布时,参考资料未提供 |
这种拆分比做一个“全能但昂贵”的统一模型更符合实际部署需求。实时语音系统最怕的不是某个字听感少了 5% 的细腻度,而是用户说完后沉默一秒;内容生产则正好相反,创作者愿意多等几秒,但不能接受角色在关键台词里情绪错位。
结构化标签让提示词变成配音时间轴
细粒度表达控制是 Qwen-Audio-3.0-TTS 最有产品价值的升级。结构化标签是嵌入文本中的显式控制标记,用来指定某个局部片段的情绪、呼吸或非语言声音,而不是让模型自行猜测整段话的表演方式。
[gasp] 对应抽气,[giggles] 对应轻笑,[angry] 对应愤怒语气。标签本身并不复杂,但它解决了生成式 TTS 长期存在的一个工程问题:自然语言指令适合描述整体风格,却很难稳定地绑定到准确位置。
例如,“用惊讶又克制的语气读完这段话”属于全局指令,模型可能在开头、结尾或整段平均施加效果;把抽气标签放在某个词前,则更像在配音稿上做动作标记。对批量内容生产来说,这种可定位、可复制、可进入模板系统的控制方式,比偶尔生成一条令人惊艳的 Demo 更重要。
Freestyle 指令控制则承担更开放的风格描述。Freestyle 指令是用自然语言描述角色、情绪、节奏和场景的控制方式,例如要求声音像深夜电台、紧张地压低音量,或者以带有距离感的纪录片旁白风格表达。
标签与 Freestyle 实际上解决的是两个不同层级的问题。Freestyle 像给演员讲整场戏的背景,结构化标签则像在剧本具体位置写下“停顿”“轻笑”和“吸气”;两者结合,才能让生成模型从朗读器变成可编排的表演工具。
48kHz 有价值,但不能直接等于录音棚质量
Qwen-Audio-3.0-TTS 将最高输出采样率从 24kHz 提升到 48kHz。采样率是每秒对连续声音进行数字采样的次数,48kHz 理论上能够保留最高约 24kHz 的频率信息,也是影视和专业音频工作流中常见的交付规格。
48kHz 的直接价值是减少后续制作链路里的格式转换。游戏、短剧、广告和视频项目常以 48kHz 作为工程规格,如果模型只输出 24kHz,制作方往往需要升采样后再进入剪辑、混音和母带流程;模型原生输出 48kHz,至少能让文件规格直接对齐现有工作流。
不过,把 48kHz 简单解释为“从电话品质升级到录音棚品质”并不严谨。电话语音通常受限于更低的有效带宽,而 24kHz 采样音频的理论频率上限已经达到 12kHz,明显高于传统窄带电话;真正决定听感的还有生成模型、声码器、量化位深、压缩格式、噪声底和高频细节是否真实。
换句话说,48kHz 是必要的产品参数,却不是音质保证书。如果模型只是把缺乏细节的波形输出为更高采样率文件,文件会变大,声音却未必更好;Qwen-Audio-3.0-TTS 能否在生产环境保持榜单上的优势,仍需观察齿音、爆破音、背景音乐混合以及长文本音色一致性。
16 种语言与 20 种方言瞄准的是规模化本地化
Qwen-Audio-3.0-TTS-Plus 覆盖中文、英文、日语、韩语和德语等 16 种语言,并新增阿拉伯语、越南语、马来语和菲律宾语。多语种 TTS 是让同一套语音系统处理不同语言文本的能力,其难点不仅是读音正确,还包括重音、节奏、连读和文化语境下的自然表达。
中文方言覆盖则扩展到广东、重庆、东北、陕西、上海、四川、云南等 20 种。方言 TTS 是按照特定地域语音系统合成文本的技术,它不是简单给普通话加口音,而要处理方言独有的声调、词汇、语流音变和表达习惯。
从上一代公开资料中常见的北京话、上海话和四川话,扩展到 20 种方言,意味着千问正在把方言能力从展示性功能推向可用的产品矩阵。区域客服、本地生活内容、文旅讲解和面向中老年用户的语音服务,都比通用助手更需要这种能力。
但“支持某种方言”仍然不是一个二元指标。模型可能会说粤语,却未必能自然处理粤语书面语与口语的差异;模型也可能带有东北口音,却无法稳定还原不同城市之间的细分特征。开发者在采购或上线前,应该用真实业务文本测试地名、人名、数字、行业术语和代码切换,而不是只听官方准备好的短句。
精品音色库是在把模型能力做成可交付产品
阿里还将陆续提供指令风格音色、20 种方言音色、细粒度控制音色以及 14 种以上小语种音色。精品音色库是经过预设和调校、可直接用于生成任务的声音资源集合,它的意义在于降低用户自行设计角色和反复调参的成本。
音色库比参数表更能决定开发者是否愿意采用一款 TTS。企业通常不想从零研究“温暖、专业、年轻但不活泼”应该怎样写提示词,而是希望选择一个稳定音色后,在数万条任务中获得接近一致的结果。
这也是 Qwen-Audio-3.0-TTS 与单纯模型发布不同的地方。模型能力决定上限,音色资产、版本稳定性、发音词典、审核机制和批处理体验决定能否真正进入生产系统;阿里这次强调“开箱即用”,说明竞争已经从论文指标延伸到资产运营。
3 分钟上限足够做短内容,却还不是长篇有声书方案
Qwen-Audio-3.0-TTS 单次语音合成最长可达 3 分钟。单次合成时长是模型在一次任务中连续生成并维持音色、节奏和上下文一致性的最大音频长度,它会直接影响长内容是否需要切片。
3 分钟足以覆盖客服回复、信息播报、短视频旁白、游戏角色台词和大多数广告素材。相比只能生成短句的系统,它能减少句间拼接造成的音量、语气和底噪跳变,也更适合生成有完整起承转合的段落。
3 分钟仍不足以直接完成播客和有声书章节。长内容生产还需要自动切段、跨段音色保持、上下文情绪继承、断句修复和失败重试机制,而每次切片都可能造成语速或声线漂移;因此,最长时长是能力进步,但不是端到端长音频生产的终点。
300ms 级首包延时,让语音 Agent 更接近可用
Flash 版本的 300ms 级首包延时是此次发布中最重要的工程指标之一。人类对话对停顿非常敏感,当语音识别、语言模型推理和语音合成串联在一起时,每个环节多出几百毫秒,最终都会变成明显的轮次等待。
300ms 级首包并不代表用户在 300ms 内就能听到完整回答。端到端延时还要叠加语音活动检测、ASR 转写、模型首 Token、网络传输和播放器缓冲,因此一套语音 Agent 即使采用 Flash,也必须同时优化整个链路。
流式 TTS 的关键指标还包括首包后的生成速度是否快于播放速度。如果模型很快吐出第一小段,却在后续持续卡顿,体验仍然会崩溃;官方此次没有公布实时率、并发吞吐与长文本延时曲线,这些数据将比单个首包数字更能说明 Flash 的生产价值。
榜单第一提供了背书,但真实业务更看重稳定性
Artificial Analysis 榜首给 Qwen-Audio-3.0-TTS-Plus 提供了一个清晰的市场标签。独立评测的价值是把不同厂商的模型放进相对统一的测试框架,避免所有产品都只引用自家挑选的最佳案例。
榜单结果仍然不能代替业务验收。TTS 的主观偏好很强,同一个声音在广告配音中可能富有感染力,在客服场景里却显得过度表演;中文多音字、英文缩写、金额、日期、药品名称和专有名词,也可能暴露通用榜单覆盖不到的问题。
更稳妥的判断是:Plus 已经具备进入全球第一梯队的证据,Flash 则给出了有竞争力的实时交互起点。阿里这次最强的地方不是某一个跑分,而是同时补齐细粒度控制、48kHz 输出、多语种、方言、实时版本和可用音色库,形成了一套相对完整的语音生成产品。
谁最适合现在开始测试
实时语音产品团队应该优先测试 Flash。智能客服、车载助手、陪伴硬件和实时数字人对延迟最敏感,300ms 级首包能够给端到端优化留下更多预算,但测试时必须记录完整链路而非只看模型响应。
内容生产团队应该优先测试 Plus。广告、短剧、游戏和知识内容需要更稳定的情绪、角色一致性与高规格音频,结构化标签可以减少反复抽卡,48kHz 输出也更容易接入现有制作流程。
全球化产品团队应该重点测试 Plus 的 16 种语言和跨语言音色一致性。真正有价值的问题不是它能否分别读出中文和阿拉伯语,而是同一品牌角色切换语言后,年龄感、情绪和辨识度是否仍然一致。
方言业务团队则不应只测试“听起来像不像”。更严格的验收集应包括本地词汇、数字串、地址、地名、口语助词、普通话与方言混说,并邀请母语使用者进行盲测,否则很容易把夸张口音误判为地道方言。
语音合成的下一阶段,是从声音生成走向表演编程
Qwen-Audio-3.0-TTS 代表的方向,是把语音生成从一个不可预测的黑盒变成可编排的表达系统。过去开发者向 TTS 提交文本并接受结果,现在则可以逐步指定声音身份、整体风格、局部情绪、呼吸动作和输出规格。
这种变化与图像生成从一句提示词走向 ControlNet、参考图和局部编辑非常相似。生成质量达到可用线之后,真正拉开产品差距的往往不是“还能不能更像真人”,而是用户能否稳定、重复、低成本地得到自己想要的那个版本。
阿里此次发布仍留下了几个需要补充的信息。官方尚未在参考资料中披露 Flash 与 Plus 的具体价格、实时率、并发能力、各语言分项成绩和标签完整列表,也没有因为“全面开放”就等同于开放模型权重;开发者在做成本和架构决策前,仍应以阿里云百炼控制台的最新模型文档为准。
整体来看,Qwen-Audio-3.0-TTS 是一次比“音质升级”更有意义的产品迭代。Plus 用第三方榜单和 48kHz 输出争夺高质量内容市场,Flash 用 300ms 级首包切入实时 Agent,而细粒度标签则把两条路线连接起来——它让机器不只负责念字,也开始接受导演指令。
参考来源
- IT之家:位列 Artificial Analysis 榜首,阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS——提供模型发布时间、Flash 与 Plus 定位、300ms 级首包延时、48kHz 输出、语言及方言覆盖等发布信息。



