讯飞发布Spark-ASR-2.0

科大讯飞今日发布新一代语音识别大模型 Spark-ASR-2.0,采用非自回归与 LLM 增强自回归协同架构,重点解决方言、高噪、小音量、快语速和中英文混说等复杂场景,整体推理成本仅较上一代增加约 10%。
讯飞发布 Spark-ASR-2.0:语音识别开始从“听清”走向“成文”
科大讯飞今天发布新一代语音识别大模型 Spark-ASR-2.0,并宣布将于明天,也就是 2026 年 9 月 24 日起,逐步上线讯飞输入法。与此同时,这套模型还会通过讯飞开放平台提供服务,后续落地讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等产品。
Spark-ASR-2.0 是科大讯飞面向通用和复杂声学场景推出的语音识别大模型,核心目标不只是把声音转成文字,还要让转写结果更符合真实语境、更接近可以直接使用的成稿。
这次更新最值得关注的,不是“又一个 ASR 模型上线”,而是讯飞试图用一套混合架构同时解决两个长期矛盾:一方面,语音识别需要足够快,才能支撑输入法、会议记录和实时字幕;另一方面,识别结果又需要具备语言模型的上下文理解能力,能够处理省略、口语、专业术语和中英文混说。过去这两件事往往需要在速度和准确率之间做取舍,Spark-ASR-2.0 的路线是让非自回归模型负责效率,再让 LLM 增强的自回归模块负责复杂语境下的修正。

一、这次升级,重点不在“能不能识别”,而在“识别结果能不能直接用”
语音识别是将连续语音信号转换为文字序列的技术,常用 WER(词错误率)或 CER(字错误率)衡量识别错误,数值越低代表识别效果越好。对于中文场景,CER 通常更常见;对于中英文混合、英文单词和数字较多的场景,WER 能更直观地反映词级错误。
过去的 ASR 产品通常把目标定义为“尽可能原样还原用户说了什么”。但真实使用中,用户说话往往并不规整:会有重复、停顿、口头禅、半句改口,也会把英文缩写、数字、品牌名和中文句子混在一起。原样转写虽然忠实,却不一定好读,更不一定能直接用于会议纪要、客服质检或内容发布。
讯飞对 Spark-ASR-2.0 的定位,是从“逐字还原”进一步走向“流畅成文”。这意味着模型不仅判断音频中出现了哪些音节,还要结合上下文对句子进行断句、标点、格式化和语义层面的整理。例如,在会议转写中,它需要识别出“这个方案我们下周一再确认一下”,而不是机械地输出一串缺少停顿和标点的字;在中英文混说场景中,它还要判断一个发音究竟对应中文词、英文缩写还是产品名称。
这里需要特别区分两个概念:识别准确率解决的是“听到的内容是否正确”,而文本流畅规范性解决的是“转写结果是否像一段可以直接阅读的文字”。Spark-ASR-2.0 这次把两者放在同一个升级目标中,也是它与传统实时转写模型的主要差异之一。
二、非自回归与 LLM 增强自回归,讯飞选择了混合路线
非自回归语音识别是指模型不必严格按照“一个词接一个词”的顺序生成结果,而是可以并行预测多个位置的文本,从而降低推理延迟和计算开销。自回归模型则是根据前文逐步生成后文,通常具备更强的上下文建模能力,但推理速度和成本容易受到序列长度影响。
Spark-ASR-2.0 采用的是非自回归与 LLM 增强自回归协同的架构。简单说,非自回归部分像一条高吞吐的流水线,先快速完成基础识别;LLM 增强的自回归部分则更像编辑和校对环节,针对上下文依赖强、容易歧义或需要语言理解的内容进行补充判断。
这种设计没有把所有任务都交给大语言模型,也没有完全依赖传统声学模型,而是试图让不同模块各做擅长的事情:
- 非自回归模块:优先保证实时性、吞吐量和基础识别效率。
- LLM 增强自回归模块:处理长距离上下文、口语省略、句子连贯性和复杂语义关系。
- 声学与文本联合增强模块:让模型同时利用声音特征和语言先验,减少单纯依赖文本猜测带来的错误。
- 动态上下文注入模块:根据当前任务、历史语句和场景信息动态调整识别结果。
这套路线的价值在于,它没有简单地把一个更大的语言模型堆到 ASR 后面。后处理式的语言模型确实能把句子润色得更顺,但如果声学识别阶段已经把关键实体听错,后续语言模型可能会“自信地改错”。Spark-ASR-2.0 强调中英文混合文本与声学联合增强,说明讯飞希望在声音证据和语言逻辑之间建立更紧密的协同,而不是只靠语言模型进行事后纠错。
官方披露,Spark-ASR-2.0 在整体效果提升的同时,推理成本相较 Spark-ASR-1.0 仅增加约 10%。对于输入法和实时会议转写来说,这个数字比单纯的离线 benchmark 更有意义:如果模型准确率提高,但每次请求的算力成本翻倍,最终很难覆盖大规模用户;如果成本只增加 10%,就更有机会在高频产品中持续运行。
三、复杂声学场景,是 Spark-ASR-2.0 的主战场
复杂声学场景是指存在噪声、距离、音量、语速、说话人差异或多语言混用等因素,导致语音信号质量明显下降的使用环境。对于这类场景,模型面对的并不是“标准普通话录音”,而是现实世界里不够干净的声音。
按照科大讯飞公布的信息,Spark-ASR-2.0 重点提升了以下几类任务:
1. 中英文混合
中英文混合识别是移动输入和办公场景中的高频需求。用户可能会说“我们先把这个 feature freeze,之后再看 release plan”,也可能在中文句子中插入公司名、软件名、产品型号或英文缩写。
这类输入的难点在于,中文和英文在发音、分词、大小写、数字表达上都不一样。模型不仅要听对,还要决定最终应该如何呈现:英文单词是否保留英文拼写,数字是否格式化,品牌名是否使用正确大小写。讯飞表示,Spark-ASR-2.0 在中英文混合场景中的 WER/CER 相比 Spark-ASR-1.0 明显降低,这会直接影响输入法、跨语言会议和技术文档转写体验。
2. 方言
方言识别是语音模型最容易暴露真实泛化能力的场景之一。普通话测试集上表现优秀的模型,不一定能处理粤语、吴语、闽南语或带有明显地域口音的普通话。
讯飞称,Spark-ASR-2.0 在方言场景下相较当前业界最好水平仍具备显著优势。需要注意的是,官方目前公开信息主要是定性描述,没有同步披露各方言测试集的具体 WER/CER、样本数量和竞品名称,因此外部读者暂时无法复现“显著优势”的精确幅度。但从产品落地角度看,方言能力对客服、政务热线、医疗问诊、地方媒体和跨区域企业会议都非常关键。
3. 高噪声与小音量
高噪声和小音量是现实环境中最难处理的两类问题。前者会把人声和背景声音混在一起,后者则会让有效语音信号本身变弱。手机在街边、地铁、展会、工厂和多人会议室里工作时,录音质量远低于实验室条件。
Spark-ASR-2.0 将高噪声、小音量列为重点提升方向,意味着讯飞正在把模型优化从“标准麦克风、近距离讲话”推进到更接近真实设备和真实用户的环境。对于讯飞 AI 眼镜、智能办公本等硬件产品,这一点尤其重要,因为用户不可能每次说话都把麦克风放在嘴边。
4. 快语速与儿童语音
快语速会压缩音节之间的间隔,增加分词和边界判断难度;儿童语音则存在音高更高、发音尚未稳定、词汇表达方式不同等特点。两者都不适合仅依赖标准成人普通话数据训练出来的模型。
讯飞将快语速和儿童语音纳入 Spark-ASR-2.0 的重点能力范围,说明其应用目标已经不局限于办公会议。教育陪练、家庭设备、儿童内容创作和智能硬件交互,都可能成为后续落地场景。
四、动态上下文注入,解决“单句听对、整段听错”
动态上下文注入是指模型根据当前语音任务中的历史文本、领域信息、热词或对话状态,实时调整后续识别结果的机制。它解决的是传统 ASR 只看局部音频、缺少上下文的问题。
同一个发音在不同场景中可能对应完全不同的词。比如在科技会议里,“模型训练”比“模型穿行”更合理;在金融客服里,一串数字可能是银行卡号、金额或日期;在医疗场景里,一个普通发音可能对应药品名称或疾病术语。如果模型不知道当前主题,即使音频信号相同,也很难稳定选出正确文本。
讯飞开放平台既有的实时语音转写产品已经支持领域个性化、热词、标点预测、数字日期格式化和说话人分离等能力。Spark-ASR-2.0 后续通过开放平台提供服务后,动态上下文注入有望进一步强化这些场景能力。不过,当前公开资料尚未说明 Spark-ASR-2.0 是否会以独立参数、领域模型或自动上下文机制的形式开放,开发者还需要等待具体产品文档和服务说明。
从产品体验看,动态上下文最直接的价值是降低“前后文互相打架”的情况。例如会议中先出现“星火大模型”,后文再次提到同一名称时,模型应该保持一致,而不是因为局部噪声把它识别成其他同音词。对于长会议、采访和客服通话,这种一致性往往比某一个短句的局部准确率更重要。
五、与上一代和业界水平相比,Spark-ASR-2.0 到底强在哪里
目前官方没有公开 Spark-ASR-2.0 的完整 benchmark 表格、全部测试集规模、每个场景的具体 WER/CER 数值以及参与对比的竞品型号,因此不能把“明显提升”直接换算成某个确定的百分比。可以确认的是,讯飞给出的测试数据来自真实任务请求数据,并持续从讯飞星火 App、讯飞听见 App、讯飞翻译机、讯飞输入法和讯飞开放平台开发者场景中滚动更新。
这类真实请求数据比固定公开语料更接近产品实际表现,但也带来一个问题:不同厂商如果使用了不同的测试集、噪声条件和评价口径,横向比较就不能只看宣传结论。开发者真正关心的,仍然是自己业务中的延迟、稳定性、领域词准确率、说话人分离效果和长音频表现。
| 对比维度 | Spark-ASR-1.0 | Spark-ASR-2.0 | 当前公开信息判断 | |---|---|---|---| | 中英文混合 | 支持 | 重点增强 | Spark-ASR-2.0 的 WER/CER 明显降低 | | 方言识别 | 支持 | 重点增强 | 官方称具备相对业界最好水平的显著优势 | | 高噪声场景 | 支持 | 重点增强 | 官方称主要任务效果优于业界最优水平 | | 小音量语音 | 有一定能力 | 重点增强 | 官方称具备显著优势 | | 快语速 | 支持 | 增强 | 适合实时输入与会议转写 | | 儿童语音 | 支持 | 增强 | 面向更复杂用户群体 | | 上下文理解 | 基础支持 | 引入动态上下文注入 | 更重视长文本和语境一致性 | | 文本流畅规范性 | 以准确转写为主 | 重点提升 | 从“还原语音”走向“流畅成文” | | 推理成本 | 基准 | 约增加 10% | 以有限成本换取更多复杂场景能力 |
从这个表格可以看出,Spark-ASR-2.0 并不是一次单纯追求模型规模的更新。它更像是在现有 ASR 基础上,对速度、复杂环境鲁棒性和文本可用性进行重新平衡。
六、明天上线讯飞输入法,才是这次发布的第一个验证场
讯飞输入法是 Spark-ASR-2.0 面向普通用户的第一个大规模验证场。输入法语音输入具有三个特点:请求量大、反馈即时、场景极其分散。用户可能在安静办公室里输入,也可能在公交车、商场、厨房或户外边走边说;可能使用普通话,也可能夹杂方言、英文、数字和网络词汇。
对输入法而言,模型的平均准确率并不是唯一指标。用户更在意的是:
- 说完之后多久能看到完整结果;
- 识别错误是否集中出现在关键名词和数字上;
- 句子是否自动断开并补充合理标点;
- 说错后重新组织语言时,模型能否理解最终意图;
- 在嘈杂环境里,是否需要重复说第二遍。
Spark-ASR-2.0 的非自回归架构有利于维持实时反馈,而 LLM 增强自回归和动态上下文注入则可能改善长句和复杂表达。两者能否在手机端形成稳定体验,将比发布会上的模型描述更能说明问题。
不过,输入法也会放大模型的缺点。只要模型偶尔把联系人姓名、地址、验证码或专业名词识别错,用户就会明显感知。因此,讯飞需要在默认模型、个性化词库、端侧处理和云端推理之间做好平衡。Spark-ASR-2.0 的成本只增加约 10%,为大规模上线提供了更现实的基础,但最终体验还取决于端到端延迟、网络状况和产品侧的纠错策略。
七、对开发者来说,真正值得关注的是后续开放方式
Spark-ASR-2.0 将通过讯飞开放平台提供服务,这意味着它不只是讯飞自有产品的内部能力,也可能进入客服、会议、教育、政务和智能硬件等第三方系统。
对于开发者,模型是否好用通常取决于以下几个因素,而不只是官方 benchmark:
- 实时延迟:音频输入到首个中间结果、最终结果分别需要多长时间。
- 长音频稳定性:连续运行几十分钟或数小时后,是否出现上下文漂移和断句恶化。
- 热词与领域适配:能否针对产品名、药品名、企业名和技术术语进行个性化增强。
- 说话人分离:多人会议中,能否稳定区分不同发言人,并保持角色一致。
- 格式化能力:数字、日期、金额、英文缩写和标点是否能输出为可直接使用的文本。
- 错误可控性:在不确定时,模型是否会保留原始音频证据,而不是生成看似流畅但实际错误的句子。
- 部署与数据安全:政务、金融、医疗客户是否支持私有化或混合云部署。
讯飞现有语音产品已经覆盖实时转写、长音频转写、热词、角色分离、领域参数和标点预测等功能,Spark-ASR-2.0 后续能否把这些能力整合得更紧密,将决定它在企业市场中的竞争力。
尤其需要警惕“流畅成文”带来的新风险。传统 ASR 的错误通常比较明显,用户一眼就能看出句子不通;经过语言模型润色后,文本可能变得更顺,但实体名、数字和关键事实一旦被改错,反而更难被发现。因此,在客服质检、医疗记录、金融通话和司法场景中,系统仍然需要保留原始音频、置信度、候选结果和人工复核机制。
八、我们的判断:这是一场更务实的 ASR 升级
Spark-ASR-2.0 的价值,不在于它是否把语音识别重新定义成了一个更大的语言模型,而在于它是否把复杂场景下的准确率、实时性和文本可用性放到了同一套系统里解决。
从公开信息看,讯飞这次选择的是一条相对务实的路线:用非自回归架构控制推理成本,用 LLM 增强自回归模块补足上下文能力,再通过声学与文本联合增强、动态上下文注入提升方言、噪声、混合语言和长文本场景的表现。整体推理成本只增加约 10%,说明它更重视大规模产品落地,而不是只追求实验室指标。
但这次发布也存在明显的信息缺口:官方尚未公开完整 WER/CER 数值、详细测试集构成、延迟指标、模型参数规模以及与具体竞品的逐项对比。对于开发者而言,真正的评估仍需要等到讯飞开放平台上线后,结合自己的录音数据进行测试。
如果 Spark-ASR-2.0 能在讯飞输入法中稳定改善方言、嘈杂环境和中英文混说,同时维持接近上一代的实时响应速度,那么它会是一款有实际意义的产品级升级;如果“流畅成文”主要依赖后处理润色,却牺牲了专有名词、数字和事实准确性,那么它更适合会议草稿和日常输入,不适合直接进入高风险业务流程。
目前可以给出的结论是:Spark-ASR-2.0 并不是把 ASR 做得更像一个聊天模型,而是试图让语音识别从“把声音听出来”进一步走向“把信息整理好”。 明天开始在讯飞输入法的逐步上线,将是验证这套技术路线是否成立的第一步;随后开放平台的实际延迟、价格、配额、热词机制和数据处理方式,则会决定它能否真正成为开发者愿意采用的基础能力。
参考来源
- IT之家:科大讯飞发布全新语音识别大模型 Spark-ASR-2.0,明日上线讯飞输入法 —— 本文关于发布时间、技术方向、复杂场景能力、推理成本和产品落地计划的主要信息来源。



