Nari Labs押注Qwen3语音模型

Nari Labs近期推出基于Qwen3的TTS与ASR方案,把低延迟、复杂场景识别和开源部署放在同一张牌桌上。真正的看点不是又多了两个模型,而是语音应用的成本与实时性门槛正在同时下降。
Nari Labs押注Qwen3语音模型:低延迟之外,真正的竞争是全链路成本
Nari Labs近期推出基于 Qwen3 的 Qwen3-TTS 与 Qwen3-ASR 语音模型方案,目标很明确:让开发者在更低延迟、更高识别准确率和更低部署成本之间,不必再做三选一。
这次上新的意义,不在于语音模型名单里又增加了两个名字,而在于开源语音栈正在从“能跑 Demo”进入“能承受真实业务”的阶段。Qwen3-ASR 覆盖多语言、中文方言、语言识别和复杂声学环境;Qwen3-TTS 则把流式生成、声音设计与音色克隆放在核心位置。对于电话机器人、实时客服、智能硬件和 AI 陪伴等应用,首包延迟和错一个数字,往往比榜单上的平均分更决定产品生死。

先说结论:这不是又一个“语音大模型 Demo”
Qwen3-ASR 是一个统一流式与离线推理、面向多语言和复杂音频场景的自动语音识别模型家族。Qwen3-TTS 是一个支持流式和非流式生成、并提供声音控制与音色定制能力的文本转语音模型家族。
Nari Labs 这次押注的产品逻辑,和过去把 ASR、对话模型、TTS 简单串起来的方案不同:它试图把每个环节的等待时间和基础设施成本都压下来。Qwen3-ASR-0.6B 面向效率,Qwen3-ASR-1.7B 面向更高识别质量;Qwen3-TTS 也提供不同采样率和能力取向的模型版本。开发者可以根据业务的并发、准确率和 GPU 预算做取舍,而不是拿一个最大模型解决所有问题。
这条路线有现实价值。一个语音助手的用户感知延迟,不是某个模型在实验室里的推理耗时,而是音频采集、回声消除、网络传输、端点检测、ASR、LLM、TTS、音频下发和播放时间的总和。模型只快 50 毫秒不一定能让用户感知,但如果 ASR 能更早输出中间结果,TTS 能在句子尚未结束时开始生成,系统就有机会把一轮对话从“等对方说完再回答”改造成“边听边准备”。
Qwen3-ASR:0.6B 和 1.7B 分别解决什么问题
Qwen3-ASR 的核心卖点是统一在线与离线推理,并在小模型效率和大模型准确率之间提供清晰分工。
根据 Qwen 团队公开资料,Qwen3-ASR-0.6B 的平均首 token 延迟最低可到 92 毫秒;在并发数为 128 的测试中,该版本可实现约 2000 倍实时的处理吞吐。这里的“2000 倍实时”意味着处理 1 秒音频所需的计算时间,理论上远低于 1 秒,但它不是端到端通话延迟,也不等于所有硬件和音频条件都能复现同样结果。
Qwen3-ASR-1.7B 则更像质量优先的版本。公开信息显示,它在开源 ASR 评测中达到较强水平,并具备与高水平商业语音 API 竞争的能力。对会议转写、专业术语识别、长文本记录和多语言内容而言,1.7B 版本更有吸引力;对海量设备、低成本外呼和边缘部署而言,0.6B 版本的参数规模更容易控制显存与并发成本。
| 模型 | 参数规模 | 主要取向 | 公开关键指标 | 更适合的场景 | |---|---:|---|---|---| | Qwen3-ASR-0.6B | 0.6B | 准确率与效率平衡 | 首 token 延迟最低约 92ms;并发 128 时最高约 2000 倍实时吞吐 | 实时客服、智能硬件、批量转写 | | Qwen3-ASR-1.7B | 1.7B | 更高识别质量 | 在开源 ASR 评测中表现强,并接近高水平商业方案 | 会议、专业语音、复杂多语言音频 | | Whisper 系列 | 多种规模 | 生态成熟、部署广泛 | 具体结果依模型、语言和硬件而变 | 通用转写、已有 Whisper 工程栈 |
ASR 是自动语音识别的缩写,负责把声音转换成文字,但真实业务里的难点从来不只是“听清楚一句话”。电话场景里的姓名、订单号、金额、日期和地址,都可能因为噪声、口音或多人抢话而出错。一个模型在安静环境下的字错率很低,并不能证明它适合呼叫中心。
Qwen3-ASR 的竞争力因此需要放到复杂声学环境里看。它强调多语言和中文方言支持,也面向具有挑战性的文本模式进行优化。对中文开发者来说,方言覆盖和语言识别并不是宣传页上的附加项:当用户一句话里混用普通话、粤语、英文缩写和产品型号时,识别系统能否保持上下文稳定,直接决定后续 LLM 会不会做出错误动作。
Qwen3-ASR 还可以与 Qwen3-ForcedAligner-0.6B 配合使用。Forced Aligner 是“强制对齐”模型,负责把文字片段与音频中的时间位置对齐,适合字幕生成、逐字高亮、语音数据标注和视频剪辑。公开资料显示,该对齐模型覆盖 11 种语言,并采用非自回归时间戳预测方式。它解决的不是“听懂什么”,而是“这句话在第几秒开始、哪个字对应哪段声音”。
Qwen3-TTS:97 毫秒首包,解决的是抢话问题
Qwen3-TTS 的核心卖点是流式语音生成,即模型不必等整段文本生成完毕,就可以逐步输出音频。
Qwen3-TTS 官方仓库给出的端到端合成延迟最低可达 97 毫秒,并采用 Dual-Track 混合流式生成架构:同一个模型既支持流式,也支持非流式生成。在实时交互里,模型可以在输入单个字符后尽快输出第一个音频包。这个设计对电话机器人尤其重要,因为用户对“机器在思考还是死机”的判断,通常发生在等待的前几百毫秒。
不过,97 毫秒不能直接等同于用户听到声音的延迟。文本生成、网络传输、音频缓冲、播放器启动和设备端处理,都可能继续增加等待时间。如果 LLM 需要 1 秒才能生成第一句文本,TTS 再快也没有用;如果播放器为了避免卡顿缓冲 500 毫秒,模型的 97 毫秒也会被吞掉。真正有意义的指标是从用户停止说话到听见稳定回复的端到端首声延迟。
Qwen3-TTS 的另一张牌是可控语音生成。它不仅把文本读出来,还支持通过指令控制说话风格、目标音色和表达方式。Qwen3-TTS-25Hz-1.7B-CustomVoice 与 Qwen3-TTS-12Hz-1.7B-CustomVoice 是公开比较中出现的两个版本。25Hz 和 12Hz 代表不同的音频生成采样率取向,并不简单等同于“25Hz 一定比 12Hz 更好”;前者通常更偏细节和表现力,后者可能在效率或特定部署条件下更有吸引力,最终仍要看场景和硬件。
在 InstructTTSEval 的公开结果中,Gemini-flash、Gemini-pro、Qwen3-TTS CustomVoice 和 GPT-4o-mini-tts 在属性感知与合成准确率、描述—语音一致性、响应精确度等指标上各有差异。例如中文 Target Speaker 任务中,Qwen3-TTS-25Hz-1.7B-CustomVoice 的 APS、DSD、RP 分别为 83.1、75.0 和 63.0;12Hz 版本分别为 83.0、77.8 和 61.2。英文任务中,25Hz 版本对应分数为 79.0、82.8 和 69.3。
| 模型 | 中文 APS | 中文 DSD | 中文 RP | 英文 APS | 英文 DSD | 英文 RP | |---|---:|---:|---:|---:|---:|---:| | Gemini-flash | 88.2 | 90.9 | 77.3 | 92.3 | 93.8 | 80.1 | | Gemini-pro | 89.0 | 90.1 | 75.5 | 87.6 | 86.0 | 67.2 | | Qwen3-TTS-25Hz-1.7B-CustomVoice | 83.1 | 75.0 | 63.0 | 79.0 | 82.8 | 69.3 | | Qwen3-TTS-12Hz-1.7B-CustomVoice | 83.0 | 77.8 | 61.2 | 77.3 | 77.1 | 63.7 | | GPT-4o-mini-tts | 54.9 | 52.3 | 46.0 | 76.4 | 74.3 | 54.8 |
这些数字说明两件事。第一,Qwen3-TTS 并非在每个维度上都击败闭源模型,尤其是自然度、风格一致性和指令遵循仍然需要按任务细看。第二,它已经把开源 TTS 的能力推进到可以认真比较的区间,开发者不必为了声音控制和低延迟,默认接受高昂的商业服务费用或不可控的外部依赖。
Nari Labs 的真正看点:把模型能力转成可部署方案
Nari Labs 的价值不只是重新包装两个 Qwen3 模型,而是把低延迟语音应用的工程问题摆到台面上。
语音产品常见的失败原因,不是 ASR 或 TTS 单点能力不足,而是整条链路没有围绕实时交互设计。VAD,也就是语音活动检测,决定系统何时认为用户开始或结束说话;降噪和回声消除决定模型听到的是用户声音还是扬声器回放;打断检测决定用户说“等等”时,系统是否能及时停止播放;背景人声过滤则避免旁边人的一句话被误当成指令。
如果这些组件处理得不好,再强的模型也会显得迟钝。一个典型问题是用户说完后,端点检测又等了 600 毫秒才提交音频;ASR 首 token 需要 200 毫秒;LLM 首 token 又用了 400 毫秒;TTS 首包再用 100 毫秒。最终用户听到回复已经超过 1 秒。模型宣传页上的单项延迟都不算高,但组合起来仍然会让对话节奏变得僵硬。
因此,开发者评估 Qwen3-TTS 与 Qwen3-ASR 时,不能只复制一段音频听 Demo,而应建立自己的端到端测试集,至少包含以下内容:
- 安静室内、街道、车内和多人会议等不同噪声环境;
- 人名、品牌名、药品名、型号、金额、日期和长数字串;
- 普通话、方言、夹杂英文和不同语速;
- 用户说到一半停顿、重复、改口和被打断的情况;
- 弱网、丢包、设备麦克风质量下降和长时间运行;
- 并发从 1、16、64 到 128 时的首包延迟、吞吐和显存占用。
单次成功任务成本 = 全链路总成本 ÷ 成功完成的任务数。这个公式比“每分钟语音多少钱”更接近商业现实,因为频繁超时、重试、人工兜底和错误识别,都会把账面上的低价变成实际高成本。
和 Whisper、商业 API 比,Qwen3 适合谁
Qwen3 语音模型最适合重视数据控制、部署弹性和中文场景质量的团队,而不是所有开发者的默认答案。
Whisper 的优势是生态成熟、资料丰富、工程案例多,很多团队已经围绕它建立了切分、热词、后处理和评测体系。Qwen3-ASR 的优势则在于新的多语言能力、中文方言覆盖、统一流式与离线推理,以及更清晰的小模型—大模型分层。若一个项目已经稳定运行,迁移的收益需要通过真实数据验证,不能因为新模型跑分更高就立刻重写生产链路。
商业语音 API 的优势是接入快、运维负担低,并且通常提供稳定的 SLA、区域节点和配套监控。开源模型的优势是权重可控、数据不必离开自己的基础设施,并能针对行业词汇做定制。代价是团队需要自己承担 GPU 调度、版本升级、容量规划、故障恢复和安全合规。
| 方案 | 优势 | 主要代价 | 更适合的团队 | |---|---|---|---| | Qwen3-ASR/TTS 自部署 | 数据控制强、可调优、长期边际成本可控 | 需要 GPU、运维和实时链路工程能力 | 有基础设施能力的产品团队、私有化项目 | | Whisper 生态 | 工具链成熟、社区广、迁移资料多 | 实时能力、中文细节和后处理需自行优化 | 已有 Whisper 资产的团队、通用转写项目 | | 商业语音服务 | 接入快、SLA 和运维支持更完整 | 长期调用成本、数据流向和供应商依赖 | 快速验证、低运维投入的应用 |
哪些场景值得优先测试
实时客服和 AI 外呼是 Qwen3 语音模型最容易体现价值的场景。这里同时要求低首包延迟、稳定打断、数字识别和电话窄带音频适配,0.6B ASR 可以承担高并发,1.7B 则可用于对关键通话做高质量转写或质检。
会议转写和内容生产更适合优先测试 1.7B ASR 与 ForcedAligner。会议场景需要长音频稳定性、专业术语、时间戳和多语言混杂;如果还要自动生成字幕、逐句高亮或剪辑片段,强制对齐能力会比单纯字错率更有用。
智能硬件和机器人则更看重本地部署与响应速度。家庭设备、车载终端和穿戴设备可能无法持续依赖云端连接,小模型的显存占用、断网可用性和噪声鲁棒性会比单次最高准确率更关键。
AI 陪伴、游戏角色和虚拟人会把注意力转向 TTS。声音是否自然只是第一关,真正影响留存的是角色音色能否稳定、情绪和语气能否按指令变化,以及用户打断后系统是否能迅速收声并重新接话。Qwen3-TTS 的流式生成和 CustomVoice 路线,至少在工程方向上对准了这些问题。
仍然需要警惕的三个风险
第一,公开基准不等于生产质量。模型评测往往使用固定数据和理想硬件,真实业务中会出现口音、重叠语音、设备差异、网络抖动和词表变化。上线前必须用自己的匿名业务数据做回放测试,并分别报告字错率、实体错误率、首声延迟、打断成功率和任务完成率。
第二,开源不等于零成本。模型权重免费,只代表软件授权层面没有按分钟支付费用。GPU 空闲率、峰值并发、冷热启动、模型量化、监控、日志存储和故障切换都要计入成本。如果业务规模小且波动大,商业服务可能反而更便宜;如果数据量大且调用稳定,自部署才更容易体现边际成本优势。
第三,声音克隆需要合规边界。音色定制和克隆能力可以用于品牌角色、无障碍辅助和内容生产,但也可能被用于冒充他人、诈骗或未经授权的声音复制。产品应保留授权记录、限制敏感场景、增加合成音标识,并对训练音频和生成日志进行访问控制。
OpenAI Hub 判断:低延迟是入场券,不是终点
Qwen3-TTS 与 Qwen3-ASR 的价值,在于它们把开源语音模型的竞争从“谁的 Demo 更像真人”推进到“谁能在真实链路里更快、更稳、更便宜”。97 毫秒级 TTS 首包和 92 毫秒级 ASR 首 token 都很有吸引力,但只有在 VAD、网络、LLM 和播放环节一起优化时,用户才会真正感受到速度。
对开发者来说,最务实的路径不是立刻在所有产品中替换现有模型,而是先做一轮小规模 A/B 测试:用相同音频、相同硬件和相同并发,比较 0.6B 与 1.7B 的准确率、显存占用和尾延迟;再把 TTS 放入真实打断链路,测量从用户停顿到听见首个稳定音频包的时间。
如果你的核心需求是中文、多语言、私有化和高并发,Qwen3 语音模型值得进入候选名单;如果你最看重开箱即用的 SLA,或者团队没有实时音频基础设施,商业 API 仍然是更稳妥的起点。Nari Labs 这次推出的方案有竞争力,但它更像一套值得认真验证的开源基础设施,而不是可以无条件替代所有商业语音服务的终局答案。
参考来源
- Qwen3-TTS GitHub 仓库:查看 Qwen3-TTS 的流式生成架构、模型版本与 InstructTTSEval 结果。
- Qwen3-ASR 相关 GitHub 代码与资料:Qwen 官方 GitHub 组织页,可进一步核对 Qwen3-ASR 及音频模型开源项目。
- Reddit LocalLLaMA 讨论:开发者社区对 Qwen3-ASR 与 Whisper 实际表现的讨论,属于非官方经验信息。



