AI 快讯讯飞推出能听懂情绪的语音大模型
模型上新

讯飞推出能听懂情绪的语音大模型

2026-09-16T11:14:57.833Z

科大讯飞今日上线 Spark-Audio-1.0-Preview,采用 0.65B 音频编码器与 30B-A3B MoE 大模型,支持 99 种语言、202 种方言,并尝试让模型直接理解语气、情绪和环境声。

讯飞 Spark-Audio-1.0-Preview 上线:语音大模型开始直接理解语气、情绪与环境声

科大讯飞于 2026 年 9 月 16 日上线 Spark-Audio-1.0-Preview。这是一款基于全国产化算力训练的语音基座大模型,核心变化不是把语音识别得更快,而是让模型不再只盯着转写文本,而是直接理解一段声音里包含的语义、语气、情绪、说话人和环境信息。

语音基座大模型是能够在统一模型中直接处理语音及其他音频信息,并完成识别、理解、推理等任务的模型。与传统的“先语音转文字、再交给语言模型处理”的级联系统相比,它试图保留声音本身携带的更多信息。

这件事的意义在于,语音交互的竞争重点正在从“听清楚用户说了什么”,转向“判断用户是在什么场景下、用什么状态说这句话”。对于客服、汽车座舱、机器人和会议助手等产品来说,后者往往比单纯的文字准确率更接近真实体验。

从语音转文字,到直接理解声音

传统语音系统通常采用级联方案:第一步由自动语音识别模型把音频转成文字,第二步由语言模型根据文字进行问答、总结或执行指令,其他能力则通过声纹识别、情感识别、翻译等独立模块补齐。

级联语音系统是将多个专用模型按顺序连接起来完成音频任务的技术路线。它的优点是模块成熟、部署方式清晰,但缺点也很明显:每个模块只能看到自己负责的那一部分信息。

第一类问题是信息丢失。文字通常只能回答“说了什么”,却难以完整记录“怎么说的”。例如,同一句“我没事”,可能是平静回应,也可能是压低声音后的敷衍,或者是在嘈杂环境中带着明显焦虑说出的话。如果系统只接收转写结果,后续大模型看到的很可能只是完全相同的三个字。

第二类问题是链路割裂。语音转写、翻译、声纹识别和情感分析各自运行时,一个模块的错误可能被下游继续放大。音频先被错误切分,转写就可能出错;转写结果缺少停顿和重音,情绪判断又会进一步失真。多模块串联还会带来额外等待时间,用户感受到的就是延迟、卡顿和答非所问。

Spark-Audio-1.0-Preview 的路线,是让同一个模型同时接收文本和语音,并对人声、环境音、音乐等不同声音成分进行统一建模。它不只是在音频末端输出文字,而是把声音当作一种可以直接参与推理的输入。

这并不意味着级联系统会立刻消失。对于大量已有业务,级联架构依然便于替换、调试和成本控制。但在需要低延迟、多轮交互和复杂场景理解的应用中,统一语音模型有机会减少模块之间的“翻译损耗”,让系统更像一个真正听见现场的智能体。

0.65B 音频编码器,搭配 30B-A3B MoE

Spark-Audio-1.0-Preview 采用 0.65B 参数的 Dense 音频编码器,并搭配 30B-A3B 结构的混合专家大语言模型。Dense 结构是每次处理输入时都激活全部参数的模型结构;MoE,即混合专家结构,则会根据输入内容选择部分专家参与计算,在扩大总参数规模的同时控制实际计算量。

需要注意的是,30B-A3B 并不等于每次推理都要完整运行 300 亿参数。按照命名方式,30B 代表模型总参数规模,A3B 通常表示单次输入约激活 30 亿参数。这样的设计更适合在保持较强语言理解能力的同时,控制语音实时交互所需要的计算成本。

| 项目 | Spark-Audio-1.0-Preview | |---|---| | 模型定位 | 语音基座大模型 | | 音频编码器 | 0.65B,Dense 结构 | | 语言模型 | 30B-A3B,MoE 结构 | | 训练数据 | 1300 万小时音频及大量文本数据 | | 训练算力 | 全国产化算力集群 | | 输入模态 | 文本、语音 | | 语言识别 | 99 种语言 | | 方言识别 | 202 种方言 | | 主要能力 | 语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析、音频问答 |

从模型规模看,它并不是单纯追求一个更大的音频编码器,而是把音频前端与具备推理能力的语言模型组合起来。音频编码器负责把连续的声音信号转换成模型可处理的表示,后面的 MoE 语言模型则负责理解内容、遵循指令、进行问答和组织输出。

讯飞披露,该模型使用了 1300 万小时音频以及大量文本数据进行训练,并基于纯国产算力集群完成训练。对于模型公司而言,训练数据规模只是基础指标,真正决定落地效果的还包括数据覆盖的语言、方言、噪声、说话距离、多人重叠发言以及真实任务分布。

因此,1300 万小时不能简单等同于“识别一定更准”。它更值得关注的地方,是讯飞能否利用长期积累的中文语音、方言和真实业务数据,把模型优势转化到复杂场景,而不是只在安静、单人、标准普通话测试中取得高分。

99 种语言、202 种方言,复杂场景是主战场

Spark-Audio-1.0-Preview 支持 99 种语言和 202 种方言识别。多语言和多方言覆盖,是讯飞这款模型最容易被产品团队直接感知的能力之一,尤其适合跨境沟通、区域客服、政务服务和车载语音等场景。

官方信息显示,该模型在 Fleurs、Kespeech、LibriSpeech 等中英文、多语言和多方言语音识别评测任务中进行比较,并在多项任务中与同尺寸的 Qwen3.5-omni-flash(35B-A3B)对比。讯飞称,Spark-Audio-1.0-Preview 在多语言、多方言语音识别方面的平均效果表现出优势;与参数规模高一个数量级的 Qwen3.5-omni-plus 相比,整体效果接近。

| 对比对象 | 参数规模或定位 | 讯飞披露的比较结论 | |---|---:|---| | Spark-Audio-1.0-Preview | 30B-A3B MoE,语音基座模型 | 支持 99 种语言、202 种方言,复杂场景表现突出 | | Qwen3.5-omni-flash | 35B-A3B | Spark-Audio-1.0-Preview 在多语言、多方言识别平均效果上表现出优势 | | Qwen3.5-omni-plus | 规模高一个数量级 | Spark-Audio-1.0-Preview 整体效果接近 | | 更大规模闭源语音基座模型 | 闭源模型 | 官方称整体表现接近,部分真实应用任务领先 |

这里需要保留一个判断边界:目前公开资料主要给出了相对结论,没有披露完整的逐项准确率、错误率、延迟、显存占用和评测样本量。因此,“接近”与“领先”应理解为讯飞基于其评测体系给出的产品发布结论,而不是一张已经完全公开、可由第三方复现的排行榜。

但讯飞强调的方向是明确的:在高噪声、小声说话等更接近真实使用的任务中,Spark-Audio-1.0-Preview 的表现明显领先。这样的指标比安静录音室里的普通话识别率更有应用价值,因为真实用户往往在车里、商场、办公室、户外甚至多人同时说话的环境中使用语音产品。

情绪和环境音,为什么会改变产品体验

情感分析是从声音的词义、音高、能量、语速、停顿和韵律等信息中判断说话者状态的技术。对传统文本大模型而言,情绪通常只能通过字面和上下文推断;对直接处理音频的模型来说,声音本身提供了更多证据。

以客服为例,用户说“你们处理得挺快”,文字看起来是正面评价,但如果语速很快、重音明显、背景中伴随争执声,模型可能需要进一步确认用户是否在讽刺或表达不满。系统如果能识别这些信号,就可以调整回复策略,提醒人工客服介入,而不是机械地把对话归为满意。

在汽车座舱中,环境音同样重要。模型需要区分用户是在正常驾驶中说话,还是在车内有儿童哭声、导航播报、车窗外鸣笛或多人交谈。环境音识别不是为了给声音贴标签,而是帮助系统判断当前对话是否适合立即打断、是否应该提高确认频率,以及指令是否可能被噪声污染。

在机器人和智能家居中,说话人识别则关联权限和个性化服务。系统可以区分不同家庭成员,结合当前语气和历史对话提供不同响应。不过,声音身份和情绪都属于敏感信息,产品落地时必须明确告知采集范围、保存周期和使用目的,不能把“听懂”变成无边界监听。

更像底座,而不是一个单点功能

Spark-Audio-1.0-Preview 的产品价值,不只在于提供一个更强的转写工具,而在于它被设计成可继续微调的语音基座。语音基座模型是面向多个语音任务预训练、并可通过后续适配构建专用系统的通用模型。

讯飞表示,类似星火大模型的“1+N”体系,开发者可以在语音基座大模型上进行微调,构建语音识别、语音同传和语音交互等专用模型或系统。这种方式的好处是,企业不必为每一个场景从头训练完整模型,而是围绕行业术语、对话流程、目标方言和安全规则进行适配。

可能的落地方向包括:

  • 客服质检:同时分析转写内容、语气变化、情绪波动和多人对话关系,识别高风险投诉或升级节点。
  • 会议与访谈:在输出文字纪要之外,标记发言人、争议点、环境干扰和关键情绪变化。
  • 车载语音:在噪声和多人交谈环境下完成指令理解,减少因误识别导致的重复确认。
  • 语音同传:把识别、翻译和上下文理解放在更紧密的模型链路中,降低复杂对话中的语义断裂。
  • 机器人交互:根据用户的语气、音量、停顿和现场声音调整响应方式,而不是只对文字命令做固定映射。
  • 方言服务:为地方政务、医疗咨询和区域客服提供更贴近本地用户的语音入口。

不过,底座模型能否形成生态,最终要看三个指标:开放程度、微调工具是否成熟,以及真实推理成本是否足够低。单纯拥有 99 种语言和 202 种方言并不意味着每一种语言都能达到同样的识别质量;单纯支持情感分析,也不意味着它能稳定区分复杂、混合或伪装情绪。

讯飞的优势与它要面对的竞争

讯飞在中文语音、方言和教育、会议、翻译等业务上拥有较长时间的数据与场景积累,这是 Spark-Audio-1.0-Preview 的现实优势。相比只依赖公开多语种数据训练的通用模型,讯飞更有机会在中文方言、真实噪声和行业语音上做深。

它的另一项优势是国产算力适配。模型完全基于国产化算力集群训练,说明讯飞在训练框架、算子适配、集群调度和模型工程方面进行了系统性优化。对于需要本地部署、数据不出域或对供应链有明确要求的政企客户,这种能力本身就是采购时的重要变量。

但竞争也会更直接。多模态模型正在把语音、视觉和文本统一到同一个交互框架里,通用模型厂商可以借助更大的语言模型和更丰富的多模态数据快速补齐语音能力。讯飞需要证明的,不只是某几项语音评测更好,而是能否在端到端延迟、长音频稳定性、多人重叠语音、复杂指令遵循和跨语言对话上持续领先。

此外,Preview 版本意味着产品仍处于预览阶段。开发者在评估时,最好不要只听一段演示音频,而应使用自己的数据做小规模验证,重点测试以下问题:

  1. 高噪声、小音量和远场拾音下的识别错误率;
  2. 多人同时讲话时的说话人区分能力;
  3. 方言与普通话混说时的切换稳定性;
  4. 情绪判断是否容易受到个人音色、年龄和文化差异影响;
  5. 长音频输入时的上下文保持和延迟变化;
  6. 环境音识别是否会误把音乐、播报或机械声当作用户指令。

判断:语音模型真正的门槛,不是多转写几个字

Spark-Audio-1.0-Preview 释放出的信号很清楚:语音大模型正在从 ASR 加语言模型的拼接方案,走向对完整声音场景的统一理解。它的技术组合——0.65B Dense 音频编码器、30B-A3B MoE 语言模型、1300 万小时音频训练数据,以及 99 种语言和 202 种方言支持——具备较强的产品化指向。

它最有价值的地方,不是让机器多识别几个字,而是让机器开始理解那些没有写在文字里的信息:一个人是否犹豫、是否生气、是否在嘈杂环境中求助,旁边是否有人插话,当前声音是否来自一个需要优先处理的场景。

当然,发布会上的相对评测结论还需要更多第三方结果验证,尤其是逐项准确率、实际延迟、推理成本和长期稳定性。对于开发者而言,Spark-Audio-1.0-Preview 值得关注,但更适合被看作一个正在进入真实业务检验期的语音底座,而不是已经解决所有语音交互问题的终点。

如果它能把复杂噪声、方言、情绪和多人对话能力稳定地转化为低延迟产品体验,语音交互就会从“语音输入框”进一步变成真正的场景理解入口。这可能是 2026 年语音大模型竞争中,比单纯拼识别率更重要的一条分界线。

参考来源

相关推荐

查看全部