AI 快讯Qwen Scribe开源:Mac离线听写
产品更新

Qwen Scribe开源:Mac离线听写

2026-07-29T21:03:21.720Z
Qwen Scribe开源:Mac离线听写

Qwen Scribe 近日开源,主打在 Apple Silicon Mac 上本地完成语音转写与日常听写。它的核心价值不是“又一个录音转文字”,而是把隐私、离线可用和系统级输入放进同一条工作流。

Qwen Scribe 开源:Apple Silicon Mac 又多了一个本地听写选择

Qwen Scribe 近日以开源项目形式亮相,目标是在 Apple Silicon Mac 上本地完成语音转写和听写,不把录音发送到云端。项目已经登上 Show HN,引发开发者对本地语音输入、隐私边界以及 Qwen 语音模型桌面化的讨论。

**Qwen Scribe 是一款面向 Apple Silicon 的开源本地语音转文字工具。**它覆盖两类相近但并不相同的需求:一类是把已有音频转换为文本,也就是 transcription;另一类是把说话实时或准实时变成可输入其他应用的文字,也就是 dictation。

先说一个容易混淆的地方:Qwen Scribe 并不是阿里云或 Qwen 团队发布的官方桌面产品,而是围绕 Qwen 语音识别能力构建的第三方开源项目。“使用 Qwen 模型”“项目名称里有 Qwen”和“由 Qwen 官方维护”是三件不同的事,用户在评估版本更新、模型许可和长期维护能力时,需要把这层关系看清楚。

项目代码与最新安装说明可在 Qwen Scribe GitHub 仓库 查看。由于项目仍处于快速迭代阶段,支持的 macOS 版本、模型选择、构建方式和权限要求,都应以仓库当前 README 与 Release 页面为准。

Qwen Scribe 在 Apple Silicon Mac 上进行本地录音、模型推理并将文本写入应用的流程示意图

它解决的不是识别问题,而是输入问题

**语音识别(ASR)是把音频信号转换为文字序列的技术。**过去两年,Whisper、Parakeet 和 Qwen 等模型已经把“能不能识别”变成一个基本解决的问题,但桌面听写真正难做的部分,往往位于模型之外。

一个可长期使用的听写工具至少要处理五个环节:

  1. 快速开始和停止录音;
  2. 稳定取得麦克风音频;
  3. 在本地完成推理;
  4. 清理标点、断句和口头停顿;
  5. 把结果写入浏览器、编辑器、聊天软件或终端。

**本地听写是指录音采集、语音识别和文本生成主要在用户设备上完成的输入方式。**它与普通文件转写的最大差异,不是音频长短,而是交互容错率:会议录音晚几十秒出结果通常可以接受,写邮件时每句话都要等待数秒则很难形成习惯。

Qwen Scribe 的产品方向因此比“给模型套一个界面”更有意义。它试图把模型推理接进 macOS 的日常输入链路,让语音不只是生成一份转录文件,而是成为键盘之外的第二种文字入口。

这也是我们认为它值得关注的主要原因。本地 ASR 模型已经不少,真正稀缺的是安装成本低、触发稳定、延迟可控,并且能在不同应用之间正常工作的桌面产品。

Apple Silicon 是本地语音工具的现实甜点区

**Apple Silicon 是苹果自研的 Arm 架构芯片平台,包括 M1、M2、M3、M4 及后续 M 系列芯片。**这些芯片采用统一内存架构,CPU、GPU 和神经网络相关计算单元可以在同一内存池中处理数据,减少独立显存与系统内存之间的搬运成本。

这套硬件对本地语音识别尤其合适。ASR 推理通常同时涉及音频预处理、特征编码、Transformer 计算和文本解码,任务规模低于大型文本模型,又足以利用 GPU 并行能力。相比在普通笔记本 CPU 上硬跑,本地模型在 Apple Silicon 上更容易做到可接受的速度、功耗和噪声控制。

**统一内存并不意味着模型运行没有成本。**模型权重、音频特征、中间激活和应用本身都会占用内存;当系统内存不足并触发交换时,听写延迟会出现明显波动。8GB Mac 能否流畅运行,取决于具体模型大小、量化方式、上下文长度以及同时打开的应用,不能只看“支持 Apple Silicon”这句话。

以参数量计算,0.6B 模型若按 FP16 保存,仅原始权重理论值就约为 1.2GB;若采用 4-bit 量化,权重理论值约为 300MB,但实际占用还要加入量化元数据、运行时缓存和音频处理开销。这一计算只用于解释模型规模,不代表 Qwen Scribe 某个具体版本的下载包体或内存占用。

苹果开源的 MLX 已经成为 Apple Silicon 本地模型生态的重要基础设施,不过“针对 Apple Silicon”并不自动等于“使用 MLX”。Qwen Scribe 的具体推理后端和依赖版本仍应以项目仓库为准,用户不应仅凭产品定位推断底层实现。

本地处理的价值,首先是隐私边界更清楚

**端侧处理是指原始数据主要在用户自己的设备上完成计算,而不是上传到远程服务器。**对于会议记录、客户沟通、医疗咨询、法律材料和未公开产品讨论,音频是否离开电脑不是一个抽象卖点,而是直接影响合规和使用意愿的条件。

Qwen Scribe 的本地路线带来三个直接收益:

  • **离线可用。**网络不稳定、出差或受限环境下仍可完成转写;
  • **成本可预测。**高频听写不需要按音频分钟持续支付云端识别费用;
  • **数据边界明确。**原始声音和识别文本可以留在设备内,降低第三方处理链路带来的暴露面。

**本地运行并不等于天然零风险。**应用仍可能需要麦克风权限、辅助功能权限或输入控制权限,模型首次下载也需要联网;如果软件包含崩溃报告、更新检查或遥测功能,还要分别检查其网络行为。开源的价值在于这些行为能够被审查,而不是自动保证软件绝对安全。

对于企业部署,至少应检查四项内容:代码许可证、模型权重许可证、应用签名与分发方式、日志和临时音频的保存策略。代码可以商用,不代表模型权重必然允许同样的使用范围;两套许可证必须分开确认。

Qwen Scribe 与现有 Mac 听写工具怎么选

**Mac 本地听写市场已经形成了 Whisper、Parakeet、Qwen 与系统自带能力并存的格局。**Qwen Scribe 的优势是开源、本地和 Qwen 路线,但它并不是一个没有竞争者的新赛道。

| 产品 | 主要技术路线 | 本地运行 | 开源情况 | 已知价格信息 | 更适合的场景 | |---|---|---:|---|---|---| | Qwen Scribe | Qwen 语音识别路线 | 是,面向 Apple Silicon | 项目代码开源,具体许可看仓库 | 开源项目本身可获取 | 想尝试 Qwen 本地 ASR、重视可审查性与离线使用的开发者 | | FluidVoice | 可选 Parakeet 等本地模型 | 是 | 开源 | 免费 | 追求低延迟、多模型选择的 Mac 用户 | | Vowen | 设备端识别与 AI 排版 | 是 | 未以开源为主要卖点 | 提供免费版,无需注册即可开始 | 希望开箱即用、重视成稿整理的普通用户 | | OpenSuperWhisper | OpenAI Whisper | 是 | 开源 | 可自行安装使用 | 偏好成熟 Whisper 生态和多尺寸模型的用户 | | Apple 听写 | macOS 系统语音识别 | 视语言与系统设置而定 | 否 | 随 macOS 提供 | 不想安装额外软件、需求较轻的用户 |

FluidVoice 的相关介绍建议 Apple Silicon 用户从 Parakeet TDT v3 开始,其模型下载量约 500MB,支持 25 种语言,并在速度和准确率之间取得平衡;只做英文输入时,Parakeet Flash 更偏向低延迟。这里的数字来自产品介绍,不应直接当作跨设备基准测试结果。

Vowen 的差异化方向则不是单纯识别,而是“识别后成稿”。它强调清理口头禅、添加标点并根据输入场景调整文本,同时宣称支持 100 多种语言。对非技术用户来说,这种后处理体验可能比底层模型名称更重要。

OpenSuperWhisper 代表的是成熟的 Whisper 路线。Whisper 的优势是社区大、模型尺寸选择多、语言覆盖广,缺点是不同模型在速度、内存和识别率之间差异明显,应用需要替用户做好默认配置,否则用户仍然要面对模型选择题。

Apple 自带听写的最大优势是零安装和系统集成,但它更像基础能力。第三方工具的机会在于提供更灵活的语言检测、文件转写、模型切换、文本清理以及更明确的本地处理方式。

现在还不能把它叫作“最快”或“最准”

**词错误率(WER)是衡量语音识别准确率的常用指标,计算替换、删除和插入错误占参考词数的比例。**WER 越低通常越好,但中文还经常使用字错误率(CER),两者不能在不同测试集上直接横向比较。

**实时因子(RTF)是处理耗时与音频时长的比值。**例如,转写 60 秒音频耗时 6 秒,RTF 为 0.1;但听写产品还要考虑录音结束后的首字等待、标点生成和文本写入耗时,因此 RTF 不能完整代表体感延迟。

基于目前公开信息,我们不建议把 Qwen Scribe 直接描述为“Mac 上最快”或“准确率最高”的工具。一个可信的对比至少需要公布以下条件:

  • Mac 具体型号、芯片和内存容量;
  • macOS 与应用版本;
  • 模型名称、精度和量化方式;
  • 音频语言、采样率、噪声条件和说话人数;
  • 冷启动时间、热启动时间、RTF、首字延迟与峰值内存;
  • 中文 CER、英文 WER 以及专有名词测试结果。

**没有统一测试条件的“更快”通常只是营销描述。**M1 8GB 与高配 M 系列芯片的结果没有可比性,英文单人近讲音频与中英夹杂会议录音也不应放在同一张成绩表里。

Qwen Scribe 当前更准确的定位,是一个值得开发者试用和审查的新选项,而不是已经用公开基准击败所有竞品的成熟冠军。

真正影响使用体验的是模型之外的细节

**听写工具的留存率通常由交互细节决定,而不是由实验室识别率单独决定。**即使底层模型准确率很高,只要快捷触发不稳定、每次都要手动复制,或者输入时打断当前焦点,用户很快就会退回键盘。

Qwen Scribe 后续是否能从 GitHub 项目成长为日常工具,主要取决于以下几项:

1. 中英混说与术语识别

中英夹杂是中文开发者最常见的真实场景。“把这个 pull request rebase 一下”“检查 token usage 和 latency”对语言自动识别、分词和专有名词都提出了更高要求。只在纯中文普通话测试集上表现好,并不足以服务开发者。

2. 标点与口语清理

逐字识别只能生成原料,听写需要生成能直接发送的文本。是否删除“嗯”“那个”等填充词,是否保留原话,以及是否自动整理段落,最好交给用户配置,因为会议存档和写邮件对忠实度的要求完全不同。

3. 权限与文本注入稳定性

macOS 对麦克风、辅助功能和输入监控有明确权限边界。应用若要把文字写入任意软件,必须在便利性与安全性之间做取舍;权限提示是否清楚、撤销后是否正常降级,都属于产品完成度的一部分。

4. 长音频与实时听写的分离

文件转写适合批处理、说话人分离和时间戳,实时听写更在意短句延迟和快速撤销。两个场景共享模型,但不应强行使用同一套界面和默认参数。

5. 模型与应用独立升级

模型更新可能改善识别率,也可能增加内存占用或改变输出格式。成熟工具应允许锁定模型版本、查看下载体积并回退,而不是每次应用升级都悄悄替换核心模型。

我们的判断:方向正确,完成度比模型名更重要

**Qwen Scribe 最有价值的地方,是把 Qwen 本地语音识别带进 Apple Silicon 桌面工作流。**它让开发者多了一个 Whisper 和 Parakeet 之外的可审查方案,也说明本地 AI 应用正在从聊天窗口进入操作系统的输入层。

但开源只是第一步。一个模型演示可以容忍手动安装和偶发错误,系统级听写工具却需要每天触发数十次甚至数百次。真正的门槛是稳定性、延迟、权限管理、文本后处理和升级维护,而不是仓库里能否成功跑出第一段文字。

对愿意折腾的 Apple Silicon 用户,Qwen Scribe 已经值得试用,尤其适合处理不希望上传云端的个人笔记、访谈草稿和开发者口述内容。对只想下载后立即工作的用户,Vowen、FluidVoice 或系统听写目前可能仍有更低的上手门槛。

**本地听写正在从隐私功能变成生产力基础设施。**如果 Qwen Scribe 后续能补齐可复现基准、稳定安装包、权限说明和多语言实测,它有机会成为 Qwen 语音生态在 Mac 上的重要入口;如果只停留在“本地跑通模型”,则很容易被更成熟的产品壳层超越。

参考来源

相关推荐

查看全部