AI 快讯微软把语音转写卷到每小时0.1美元
模型上新

微软把语音转写卷到每小时0.1美元

2026-09-04T02:04:16.367Z
微软把语音转写卷到每小时0.1美元

微软于 9 月 3 日发布 MAI-Transcribe-2,支持 60 种语言,FLEURS 平均词错误率为 5.2%,并在 2026 年底前以每小时 0.10 美元的限时价格提供服务。

微软把语音转写卷到每小时 0.1 美元

微软在 9 月 3 日发布 MAI-Transcribe-2,一款面向生产环境的多语言语音转文字模型。它支持 60 种语言,提供自动语言识别、说话人分离、逐词时间戳和可配置转写风格,上市优惠价为每小时 0.10 美元,约合人民币 0.67 元,优惠持续到 2026 年年底。

这不是一次简单的模型迭代。MAI-Transcribe-2 的核心竞争力不只在于识别准确率,而是微软试图同时把准确率、实时处理速度和单位音频成本压到一个更适合大规模部署的区间。对会议记录、客服质检、字幕生成和语音代理来说,转写模型最难的往往不是能不能把声音变成文字,而是能否稳定处理口音、噪声、多人对话、专业词汇和中英混说,并且让成本不会随着音频量增长失控。

微软 MAI-Transcribe-2 的多语言语音转写、说话人分离与时间戳功能示意图

5.2% 词错误率,微软把准确率对准主流模型

**词错误率(Word Error Rate,WER)是衡量语音识别准确率的常用指标,数值越低代表转写结果与人工标注文本的差异越小。**它通常统计替换、删除和插入错误的比例,是语音识别模型之间最常见的横向比较指标之一。

在 FLEURS 测试集上,MAI-Transcribe-2 无论是强制指定语言,还是让模型自动推断语言,平均词错误率都为 5.2%。微软给出的对比数据如下:

| 模型 | 指定语言 WER | 自动识别语言 WER | 备注 | |---|---:|---:|---| | MAI-Transcribe-2 | 5.2% | 5.2% | 支持 60 种语言 | | Gemini 3.1 Pro | 5.3% | 5.8% | 自动识别时误差上升 | | GPT-Transcribe | 10.4% | 10.6% | 两种模式均高于 MAI-Transcribe-2 | | Whisper v3-Large | 22.8% | 23.5% | 开源语音识别基线 |

从数字看,MAI-Transcribe-2 在该测试中的优势相当明确:指定语言时,比 Gemini 3.1 Pro 低 0.1 个百分点;自动语言识别时,比 Gemini 3.1 Pro 低 0.6 个百分点;与 GPT-Transcribe 相比,错误率大约降低一半;与 Whisper v3-Large 相比,则接近四分之三的差距。

但这组数据也需要正确解读。FLEURS 是适合做多语言基准测试的数据集,不等于真实世界中的所有音频场景。电话录音、远场会议、多人抢话、背景音乐、地方口音和高度专业化词汇,都可能让实际 WER 明显高于公开基准。因此,5.2% 更适合作为模型能力上限附近的参考,而不是所有业务都能直接复现的承诺。

微软此次更值得关注的地方,是 MAI-Transcribe-2 在自动识别语言模式下没有出现明显的准确率滑坡。很多语音系统在用户预先指定语言时表现不错,但一旦交给模型自动判断,就会在短音频、混合语言或口音环境中出现额外错误。MAI-Transcribe-2 的两种模式均为 5.2%,说明它至少在这项测试中把语言识别与语音内容识别结合得更紧密。

速度提升 5 到 10 倍,成本才真正有意义

**批量转写速度是指模型处理音频所需的时间与音频时长之间的关系,它决定了会议、客服和媒体内容能否快速完成处理。**微软援引 Artificial Analysis 的评测称,MAI-Transcribe-2 的速度比 GPT-Transcribe 快 10 倍,比 Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍。

如果一段 60 分钟的录音需要 10 分钟处理,那么理论上,快 10 倍意味着处理时间可能降至约 1 分钟。当然,实际耗时还会受到上传、排队、并发限制、音频格式和后处理环节影响,不能简单理解为每个请求都能稳定达到 10 倍加速。但对每天处理数万小时音频的企业来说,速度差异会直接影响机器数量、任务积压和结果交付时间。

| 对比维度 | MAI-Transcribe-2 表现 | 业务影响 | |---|---|---| | 处理速度 | 比 GPT-Transcribe 快 10 倍 | 更适合批量会议、客服和媒体音频 | | 处理速度 | 比 Scribe v2 快 7 倍 | 减少长音频等待时间 | | 处理速度 | 比 Gemini 3.5 Transcribe 快 5 倍 | 有利于高并发转写 | | 限时价格 | 0.10 美元/小时 | 2026 年底前降低试用和部署门槛 | | 支持语言 | 60 种 | 覆盖多语言内容和跨国业务 |

价格同样是这次发布的关键。每小时 0.10 美元意味着,1000 小时音频的基础转写成本约为 100 美元;如果只按模型计费,不考虑存储、网络、并发和其他云服务费用,成本已经低于许多团队自行部署 GPU 推理服务的综合门槛。对于需要处理大量历史录音的企业,价格下降的意义通常比单次识别准确率提升 1 个百分点更直接。

不过,0.10 美元是上市限时价格,优惠截止时间为 2026 年 12 月 31 日。开发者在计算长期预算时,不应直接把这个数字当作永久价格。尤其是客服中心、媒体平台和会议产品,音频规模可能从每月几百小时迅速增长到几十万小时,正式上线前仍需要确认计费规则、并发限制、文件大小、保留策略以及不同功能是否产生额外费用。

不只是把声音变成文字:四个实用功能

**说话人分离(speaker diarization)是把一段多人录音切分为不同发言者,并将对应文字归属到各个说话人的技术。**MAI-Transcribe-2 新增说话人分离后,会议转写不再只是连续的一整段文本,而可以标记为说话人 1、说话人 2 或对应的角色标签。

这项能力对会议纪要、客服质检和访谈整理尤其有用。比如一段销售电话中,系统可以区分客服与客户;一场产品评审中,系统可以把主持人、工程师和业务负责人分开。它并不能凭空知道每个人的真实姓名,除非业务系统根据声纹、座位或上下文进一步完成身份映射,但至少解决了多人录音中“谁说了什么”的第一步。

**逐词时间戳是为每个识别词语记录精确起止时间的功能。**它比按句或按段落提供时间信息更细,适合字幕对齐、音频检索、播客导航和视频剪辑。用户点击某个关键词时,产品可以直接跳转到对应音频位置;剪辑工具也可以根据文本快速定位片段,而不必从头拖动时间轴。

MAI-Transcribe-2 还提供两种转写风格:

  • verbatim 模式:保留“嗯”“那个”等语气词、重复表达和口误,适合合规审查、法律取证、客服分析和研究工作。
  • clean 模式:删除部分语气词和不影响语义的口头重复,让结果更像可直接阅读的字幕、会议笔记或发布稿。

两种模式对应的是不同的产品目标。合规部门通常需要“原话是什么”,内容团队更关心“读起来是否顺畅”。如果让同一份原始转写同时承担这两种任务,往往需要人工反复清理。风格可配置后,产品可以保留一份更接近原始音频的结果,再按下游场景生成不同版本。

此外,模型支持关键词偏置。**关键词偏置是向语音识别模型提供一组业务相关词汇,以提高专业术语、品牌名和专有名词被正确识别的概率。**例如医疗场景中的药品名称、金融场景中的公司简称、技术会议中的框架和项目代号,都可能因为发音相近或训练数据稀少而被错写。关键词偏置不能保证百分之百正确,但能让通用模型更贴近具体业务。

60 种语言和混合语言,是它真正的差异化点

**自动语言识别是模型在不要求用户提前指定语言的情况下,判断音频所使用语言的能力。**MAI-Transcribe-2 支持 60 种语言,并能够处理自然混用语言的对话,用户不必在每段录音开始前手动选择语言。

这项功能对跨国客服、国际会议和短视频内容尤其重要。现实中的对话很少像基准数据那样整齐:一个人可能用中文提问,夹杂英文产品名;跨国团队可能在同一场会议中切换中文、英语和日语;客服录音则可能出现用户与坐席语言不同的情况。强制指定单一语言在这类场景下容易造成识别偏差,自动检测和语言切换则更符合真实使用方式。

但“支持 60 种语言”不应被简单理解为每种语言都拥有完全相同的效果。语料规模、口音覆盖、书写规范和领域词汇都会影响模型表现。对中文用户来说,真正需要测试的不只是普通话,还包括粤语、方言口音、夹杂英文的商务对话,以及带有多人重叠发言的会议录音。微软目前公布的核心数字是 60 种语言整体平均结果,开发者仍应使用自己的音频样本做验收。

MAI-Transcribe-2 与 Whisper:便宜之外,更适合直接接入业务

Whisper v3-Large 仍然是开发者熟悉的开源语音识别基线,优势在于可自行部署、可控性强,也方便在本地或私有环境中处理敏感数据。但从此次 FLEURS 数据看,MAI-Transcribe-2 的平均 WER 为 5.2%,Whisper v3-Large 在指定语言和自动识别语言下分别为 22.8% 和 23.5%,两者存在明显差距。

这并不意味着 Whisper 没有价值。对于有 GPU、具备模型优化能力、需要离线运行或不能上传音频的团队,本地部署仍然有吸引力。问题在于,企业真正上线时要承担模型部署、显存管理、扩缩容、监控、版本升级和异常处理等工程成本。云端模型则把这些复杂度交给服务商,开发者用按时长计费换取更快的接入速度。

MAI-Transcribe-2 的策略很清楚:不一定要在所有场景击败开源模型的灵活性,而是用更低价格和更快速度,争夺那些“我需要可靠转写,但不想自己维护语音基础设施”的客户。

对开发者来说,哪些场景值得优先测试?

第一类是会议与协作软件。逐词时间戳可以支持音频检索,自动语言识别可以减少会前配置,说话人分离则能直接生成按角色组织的会议纪要。对于跨语言团队,混合语言识别也比单语言模型更有实际价值。

第二类是客服和销售质检。大量电话录音需要先转写,后续才能进行意图识别、投诉分类、销售话术分析和合规检测。verbatim 模式保留口误和完整表达,适合审计;关键词偏置可以帮助识别产品名、药品名和企业内部术语。

第三类是视频字幕和内容生产。clean 模式能减少人工清稿,逐词时间戳则方便字幕与画面同步。对于每天需要处理几十小时甚至上百小时素材的团队,速度和单价往往比模型在极少数句子上的极限准确率更重要。

第四类是语音代理和无障碍产品。语音代理需要尽快理解用户输入,低延迟转写可以缩短等待时间;无障碍应用则可以把直播、会议和课堂内容实时转成文本。不过,实时场景需要重点确认流式处理能力,而目前公开资料更强调批量转写速度,开发者不应仅凭批量 benchmark 推断实时体验。

仍有三个问题需要上线前验证

第一,公开数据主要来自微软引用的基准和第三方评测,企业还需要在真实音频上做 A/B 测试。建议至少准备普通话、方言、电话窄带音频、远场会议、多人重叠发言、中英混说和专业术语等样本,并分别统计整体 WER、关键词召回率、说话人切分准确率和时间戳偏差。

第二,隐私与数据治理不能被低价掩盖。医疗记录、客服录音和内部会议可能包含个人信息或商业机密。上线前需要确认音频和转写文本的存储区域、保留时长、训练用途、删除机制以及权限审计,尤其要区分测试环境与生产环境的数据处理策略。

第三,优惠价格的结束时间已经明确。MAI-Transcribe-2 在 2026 年底前每小时 0.10 美元的价格非常有吸引力,但长期产品规划不能只依赖限时折扣。团队应同时测算正常价格下的单小时成本,并比较自建 Whisper、其他云端转写服务和多模型路由方案的总拥有成本。

OpenAI Hub 观点:转写模型进入“基础设施价格战”

MAI-Transcribe-2 最值得关注的不是“微软又发布了一个语音模型”,而是语音转写正在从功能竞争进入基础设施价格战。准确率达到可用水平后,速度、语言覆盖、工程接入和每小时成本开始决定产品选择。

对大多数开发者而言,MAI-Transcribe-2 目前最有吸引力的组合是:60 种语言、5.2% 的 FLEURS 平均 WER、自动识别语言、说话人分离、逐词时间戳,以及 0.10 美元/小时的限时价格。它特别适合需要快速上线、音频量较大、又不想自行维护 GPU 推理集群的团队。

但它还不是“所有语音场景的终点”。FLEURS 的结果不能替代真实业务测试,批量速度也不能直接等同于实时延迟,60 种语言的平均值更不能代表每一种语言都达到相同水准。更稳妥的做法是先用自己的音频做小规模评测,再决定是否迁移核心生产链路。

截至 2026 年 9 月 4 日,MAI-Transcribe-2 已可在 Microsoft Foundry、MAI Playground 和 OpenRouter 中试用或使用。对于正在搭建会议记录、客服分析、字幕生成和多语言语音应用的开发者,这个模型值得立即加入评测清单;对于已经在使用 Whisper 或其他云端模型的团队,最应该先算的不是“要不要换”,而是同等准确率下,每小时音频到底能省多少钱、少等多久,以及能否减少多少维护工作。

参考来源

相关推荐

查看全部