Grok转写2.0:错误率近乎减半

SpaceXAI发布Grok Voice Transcribe 2.0,四类真实场景错误率全面下降,19种语言短句词错误率从20.6%降至6.8%,批量和流式价格维持不变。
Grok转写2.0:错误率近乎减半
SpaceXAI于当地时间9月18日发布Grok Voice Transcribe 2.0,在价格完全不变的情况下,将多类真实业务场景的语音转写错误率降低约一半。新模型现已通过Grok Voice的语音转文字服务提供,并计划在未来数周内逐步成为默认选项。
Grok Voice Transcribe 2.0是一款面向批量音频和实时流式音频的语音转文本模型,底层建立在驱动Grok Voice的音频基础模型之上。它并非只针对录音棚级别的清晰语音做优化,而是把重点放在客服电话、多人交谈、地方口音、短语音指令以及电话号码和邮箱地址等容易出错的真实场景。

四组数据说明:这次提升不只是跑分好看
词错误率是衡量语音识别准确度的核心指标,英文简称WER,计算时会统计转写结果中的替换、删除和插入错误,数值越低越好。简单理解,WER为10%意味着平均每识别100个词,大约会出现10个词级错误,但它不直接等同于句子准确率。
SpaceXAI此次没有只展示公开排行榜,而是从线上实际业务中抽取四类内部数据集进行测试。四个数据集分别覆盖8 kHz客服电话、用户与Grok的英语对话、电话号码及邮箱等口述凭证,以及19种语言的简短语音指令。
新模型在四项内部测试中均超过1.0版本,其中多语言短句的相对错误降幅达到67.0%。具体结果如下:
| 测试场景 | Grok Voice Transcribe 1.0 WER | Grok Voice Transcribe 2.0 WER | 相对错误降幅 | |---|---:|---:|---:| | 8 kHz客服电话音频 | 10.6% | 7.1% | 33.0% | | 与Grok的英语对话 | 8.7% | 3.3% | 62.1% | | 电话、邮箱、地址等口述凭证 | 7.2% | 3.2% | 55.6% | | 19种语言的简短指令 | 20.6% | 6.8% | 67.0% |
多语言短句是这次最值得关注的一项,因为它也是语音模型最容易翻车的场景。长音频通常包含足够多的上下文,模型可以通过连续词语判断语言、口音和主题;一句只有两三秒的车载指令却没有这种余地,模型既要迅速判断语言,又要在发动机、风噪和路噪中识别具体命令。
从20.6%降至6.8%不只是榜单数字变化,而是产品体验从“经常需要重复”向“多数时候一次完成”靠近。对于“导航到某个地址”“给某人打电话”或“把温度调到21度”这类短命令,一个关键词识别错误就可能导致整条指令失效,因此短句WER下降的实际价值往往高于长篇会议转写中的同等降幅。
公开流式榜单第一,但内部测试更有参考价值
Grok Voice Transcribe 2.0在Artificial Analysis收录的32款流式语音模型中取得准确率第一。SpaceXAI还将其与七家竞争对手进行了比较,官方展示的主要对手包括ElevenLabs Scribe v2和Deepgram Nova-3。
公开榜单第一可以证明模型具备竞争力,但它不意味着模型在所有语言、设备和噪声环境下都会稳定领先。语音识别的表现高度依赖音频采样率、口音构成、背景噪声、说话距离以及专有名词密度,同一模型在播客、电话客服和车载语音中的表现可能完全不同。
四个内部数据集反而更能解释这次升级的产品方向。客服电话测试使用8 kHz音频,这是传统电话线路常见的窄带规格,声音细节远少于视频会议和手机录音;口述凭证则包含电话号码、邮箱和地址,一旦漏掉一个数字、字母或符号,整条信息就可能无法使用。
口述凭证的WER从7.2%降至3.2%,意味着模型对高价值细节的处理能力明显增强。客服系统最怕的并不是把一个语气词识别错,而是把订单号、联系方式或门牌号识别错,因为前者通常不影响理解,后者却可能直接造成业务错误。
价格不变,真正压低的是每条可用转写的成本
Grok Voice Transcribe 2.0的批量转录价格仍为每小时音频0.10美元,实时流式转录价格仍为每小时音频0.20美元。按9月19日汇率粗略换算,分别约为0.67元和1.3元人民币。
| 服务模式 | 1.0价格 | 2.0价格 | 典型用途 | |---|---:|---:|---| | 批量转录 | 0.10美元/音频小时 | 0.10美元/音频小时 | 视频字幕、播客归档、会议录音、历史客服质检 | | 实时流式转录 | 0.20美元/音频小时 | 0.20美元/音频小时 | 实时字幕、电话机器人、车载助手、语音智能体 | | 说话人分离 | 已包含 | 已包含 | 区分客服、客户及会议参与者 | | 逐词时间戳 | 已包含 | 已包含 | 字幕对齐、音视频检索和片段定位 | | 自定义关键词 | 已包含 | 已包含 | 人名、品牌名、产品型号及行业术语识别 |
说话人分离是自动判断音频中“谁在什么时候说话”的能力,而不是简单输出一整段没有角色区分的文本。对于客服质检和多人会议,这项能力决定了后续摘要、责任判断和情绪分析能否正确关联到具体说话者。
自定义关键词功能也可称为关键词偏置,它允许业务方提示模型优先关注特定品牌名、人名或专业术语。医疗、金融、汽车和企业软件中的专有名词通常不在日常口语高频词表中,如果缺少关键词控制,即便模型整体WER很低,关键实体仍可能持续识别错误。
价格不变的意义并不只是账单没有上涨,而是每条“可直接进入业务流程”的有效转写成本下降。假设一家公司每月处理100万小时批量音频,模型费用仍为10万美元;如果错误率下降约一半,人工复核、客户纠错和下游数据清洗的成本也会随之减少,而这些隐性成本往往高于模型调用本身。
这不是实验室模型,Grok Voice已经在大规模业务中运行
Grok Voice的音频基础模型已经进入客服电话、视频转录和实体硬件等实际业务。SpaceXAI称,相关系统每天处理数万通客服电话,并已转录数百万小时的视频旁白,同时为特斯拉车辆中的Grok助手等语音智能体提供支持。
Atlassian旗下视频协作产品Loom也已经采用新模型,用于转录其平台上的视频录制内容。Loom的典型内容包括屏幕演示、异步工作汇报、产品反馈和团队说明,这类录音往往同时包含技术术语、界面名称以及临时口语表达,对转写准确率和时间戳精度都有较高要求。
大规模线上使用数据是SpaceXAI相对不少语音模型厂商的重要优势。实验室数据可以教会模型识别标准发音,但真实电话线路中的压缩失真、抢话、停顿、背景人声和突然切换语言,往往只能通过持续运行的产品获得足够多的反馈样本。
这种数据闭环也是Grok Voice Transcribe 2.0比单纯更新模型参数更值得注意的地方。Grok语音助手、客服电话、Loom视频和车载场景不断提供不同类型的困难样本,模型升级后又能直接回到这些产品中接受验证,形成数据、训练与部署之间的循环。
多语言和中途切换语言,是语音智能体的关键能力
Grok Voice Transcribe 2.0支持数十种语言、自动语言检测以及录音过程中途切换语言。自动语言检测是模型无需预先指定语种,就能根据音频内容判断当前语言并输出对应文本的能力。
语言切换对全球化客服和车载助手尤其重要。用户可能用中文说一句指令,再读出英文产品名、邮箱地址或道路名称;如果模型把整段音频强行按单一语言解码,英文实体通常会被转换成发音相近但完全错误的本地语言文字。
19种语言短句WER从20.6%降至6.8%,说明SpaceXAI重点补上了低上下文条件下的语言识别短板。不过,这组测试只能证明被测语言集合的平均表现,不能直接推导出每一种语言都获得相同幅度的提升,尤其是方言、混合口音和低资源语言仍需要业务方单独验证。
对开发团队来说,升级成本接近于零
现有语音转文字服务的集成可以在不重写业务逻辑的情况下获得2.0的准确率升级。SpaceXAI表示,新模型现已可用,并将在未来数周逐步成为语音转文字服务的默认模型;需要提前验证的团队可以在模型配置中主动选择2.0。
默认模型切换仍然不等于可以跳过回归测试。开发团队至少应使用自有音频检查专有名词、数字格式、标点、时间戳、说话人标签以及多语言切换,因为平均WER下降并不能保证每个细分领域都没有回退。
一套更可靠的上线流程应包括以下几步:
- 从线上业务中抽取不同设备、口音和噪声条件的代表性样本;
- 分别统计普通词语、数字、邮箱、地址和专有名词的错误率;
- 检查实时流式场景中的首字延迟和最终文本修订频率;
- 对比1.0与2.0在说话人分离和时间戳上的稳定性;
- 将高频误识别实体加入自定义关键词,并再次进行测试。
实时语音产品还需要关注延迟,而不只是最终WER。一个模型即便最终文本非常准确,如果需要等待数秒才能输出结果,也不适合电话机器人和车载助手;反过来,输出很快但持续大幅修改前文,也会导致字幕跳动和智能体错误触发。
SpaceXAI目前重点宣传的是准确率和价格,并未在本次公告中提供统一的端到端延迟数字。因此,在意实时交互的团队仍需用目标地区、真实网络和实际音频长度进行压力测试,不能只根据准确率榜单直接替换生产模型。
判断:语音识别正在从“模型能力竞争”转向“单位业务成本竞争”
Grok Voice Transcribe 2.0最有杀伤力的地方不是拿到一个榜单第一,而是在0.10美元和0.20美元两个价格档位上继续提供说话人分离、逐词时间戳和关键词控制。对高音频量业务而言,这种打包定价会直接迫使竞品重新评估基础转写和高级功能的收费方式。
这次升级也表明,通用语音识别的竞争重点已经从清晰英语录音转向更难的现实音频。电话窄带、多人口音、口述凭证、短指令和中途切换语言,才是决定语音模型能否进入客服、汽车和硬件设备的关键能力。
Grok Voice Transcribe 2.0仍有两个需要继续观察的问题。第一,官方内部数据集无法被外部完整复现,不同行业的真实结果可能存在差异;第二,SpaceXAI尚未公布各语言的逐项成绩和实时延迟,开发团队不能把19种语言的平均WER当成任一单独语言的保证。
综合价格、功能和现有业务规模来看,Grok Voice Transcribe 2.0已经不只是Grok助手的附属能力,而是一款有能力独立参与企业语音识别竞争的产品。对于正在处理客服录音、视频字幕、车载命令或实时语音智能体的团队,这次升级值得立即加入评测清单,尤其适合数字信息密集、多语言短句较多以及音频质量不稳定的场景。
参考来源
- IT之家:SpaceXAI发布Grok Voice Transcribe 2.0,错误率降低约一半——汇总新模型发布时间、内部测试结果、业务部署情况及价格信息。



