Gboard开始记住你怎么说话

Gboard v18.0.3 Beta 暗藏 Rambler 词典,可复用个人词典并学习用户的口语词汇。语音输入正从通用转录工具,转向理解个人表达习惯的长期助手。
Gboard 的语音输入开始建立“个人记忆”
谷歌正在让 Gboard 的 Rambler 学习用户经常说的词,语音输入也因此从一次性的语音转文字,迈向持续适应个人表达习惯的个性化系统。
8 月 13 日,Android Authority 在拆解 Gboard v18.0.3 Beta 时发现了两张尚未公开启用的 Rambler 界面。第一张界面允许用户在 Standard(标准)听写与 Rambler 听写之间切换;第二张则显示,Rambler 可以调用用户已有词典,并新增一个名为“Rambler Dictionary”的词典,用于保存“从 Rambler 语音输入中学习到的词语”。
Rambler 是 Gboard 中由 Gemini Intelligence 驱动的智能语音输入功能,它不再逐字照录声音,而是尝试把带有停顿、重复、填充词和临时改口的口语,整理成接近书面表达的文本。
这次变化的重点并不是识别率又提高了几个百分点,而是 Gboard 可能开始回答一个更棘手的问题:同一个发音,到底应该写成哪个属于你的词。

Rambler 不只是把“嗯”和“啊”删掉
Rambler 的核心能力是理解说话过程,而不是机械记录说话结果。
传统语音输入通常遵循“听到什么就写什么”的路径。用户说“明天下午,嗯不对,后天下午三点,帮我约一下产品会”,最终文本可能保留完整的自我修正过程。Rambler 则会尝试判断用户已经推翻前面的时间,把结果整理为“后天下午三点,帮我约一下产品会”。
谷歌在 2026 年 5 月公布 Gemini Intelligence 时,用购物清单解释过这项能力:用户先说要买苹果、香蕉和橙子,随后又补一句“不买苹果了”,Rambler 输出的最终清单会直接排除苹果,而不是把否定指令原样附在末尾。
这种处理方式意味着 Rambler 已经越过了自动语音识别的传统边界。自动语音识别,也就是 ASR,是把音频信号转换为文字序列的技术;Rambler 在 ASR 之后增加了语义理解和文本重写,开始判断哪些内容是有效指令、哪些只是犹豫,以及哪一句才代表用户最终意图。
Rambler 还支持在同一条消息中切换语言。谷歌官方博客表示,它会利用 Gemini 的多语言能力处理混合表达,例如用户在英语和印地语之间来回切换时,仍然根据上下文整理完整消息。对于习惯说“这个 issue 下个 sprint 再 fix”的技术团队来说,多语言不是展示能力,而是高频刚需。
Rambler Dictionary 才是这次更新的关键
Rambler Dictionary 是一个用于保存 Rambler 从用户语音输入中学习到的词语的个人词典,它让语音输入有机会积累跨会话的个性化词汇。
从 v18.0.3 Beta 暴露的文字看,Rambler 至少可能拥有两条个性化路径:一条是直接使用 Gboard 现有的用户词典,另一条是从后续语音输入中学习新词。这意味着用户过去手动添加的人名、公司名、缩写或专业术语,不一定需要再向 Rambler 重新“教学”。
个人词典解决的是通用模型最难覆盖的长尾词汇。一个面向全球用户训练的模型可以准确识别“人工智能”,却不一定知道某个内部项目叫“星轨”、同事英文名写作“Jaxon”而非“Jackson”,也很难判断用户口中的“Agent”应该保留英文,还是转换成“智能体”。
开发者和专业用户会最先感受到这项功能的价值。在真实工作沟通中,产品代号、GitHub 项目名、模型名称、框架缩写和中英文混说的频率远高于日常聊天;如果每次都要手动把“库伯内提斯”改回“Kubernetes”,语音输入节省的时间很快就会被二次校对抵消。
下面是 Standard 与 Rambler 两种模式基于当前已知信息的差异:
| 对比项 | Standard 标准听写 | Rambler 听写 | |---|---|---| | 基本定位 | 将语音尽量按原句转成文字 | 理解口语意图并整理成可发送文本 | | 填充词处理 | 可能保留“嗯”“啊”等内容 | 可主动删除填充词和无意义停顿 | | 自我修正 | 容易保留修改前后的两段表达 | 尝试只保留用户最终决定 | | 重复内容 | 以原始转录为主 | 可合并或删除重复表达 | | 复杂语音编辑 | 能力有限 | 云端模式下支持对话式语音编辑 | | 多语言混说 | 取决于传统识别与语言设置 | 借助 Gemini 理解单条消息中的语言切换 | | 个性化词汇 | 使用常规用户词典 | 可使用现有词典,并可能通过 Rambler Dictionary 持续学习 | | 离线能力 | 支持基础听写,具体能力依设备而定 | 支持基础标点、文本清理和大小写处理 | | 输出可控性 | 更接近逐字记录 | 更流畅,但存在语义改写偏差风险 |
这张表也说明了 Rambler 的代价:输出越像“写出来的”,它就越不是原始语音的忠实副本。
个性化词典比“更大模型”更实用
个性化词典是一种保存用户特有词汇、拼写与表达偏好的数据结构,它的价值在于用少量个人数据修正通用模型的长尾错误。
语音识别产品过去习惯强调通用准确率,但平均准确率无法反映专业场景的真实体验。模型把一百个常用词全部识别正确,却把会议里反复出现十次的项目名识别错十次,用户仍会认为它“不好用”。高频专有词的错误成本,明显高于偶发普通词错误。
Rambler Dictionary 的产品价值也不取决于词典能存多少词,而取决于三个更具体的问题:它能否自动判断一个陌生词值得记住、能否避免把偶然口误写入长期词典,以及用户能否方便地查看、修改和删除学习结果。
自动学习如果缺少管理界面,很容易从便利功能变成新的纠错负担。假设用户第一次说错了某个客户名称,Rambler 却把错误拼法加入词典,后续模型可能会因为“这是用户偏好”而反复输出错误结果。个人化系统一旦形成错误记忆,修复成本甚至高于没有记忆。
从拆包截图看,谷歌至少已经意识到词典需要被显式呈现,而不是完全藏在模型内部。“Rambler Dictionary”这个独立入口暗示用户可能有机会审阅学习到的词语,但目前还没有足够证据确认它是否支持逐项编辑、批量删除、导入导出或关闭自动学习。
云端负责高级改写,离线保留基础整理
Rambler 采用云端模型完成高级能力,同时提供功能受限的离线模式。
根据谷歌支持页面披露的信息,切换至离线选项后,用户将无法使用“高级风格改写和复杂对话式语音编辑”。不过,在没有网络连接时,Rambler 仍能完成基础标点、语音文本清理和大小写处理。
这套分层方式比“有网才能用、断网完全失效”更合理。地铁、电梯、航班和信号不稳定的会议室恰恰是语音输入的常见场景,基础能力留在本地,至少能够保证键盘不会因为云端不可达而退化成摆设。
| 运行模式 | 可用能力 | 暂不可用能力 | 更适合的场景 | |---|---|---|---| | 云端模式 | 基础转录、标点、文本清理、大小写、风格改写、复杂对话式编辑 | 仍受网络延迟和服务可用性影响 | 长消息、聊天润色、包含多次改口的复杂表达 | | 离线模式 | 基础标点、语音文本清理、大小写处理 | 高级风格改写、复杂对话式语音编辑 | 弱网环境、快速记事、对云端处理更谨慎的场景 |
这里需要纠正一个容易流传的误解:Rambler 不能被简单描述为“全部在手机上运行”。谷歌现有说明明确区分了云端模型与离线模式,而高级改写能力依赖云端;不同设备、语言和发布阶段是否会采用更多端侧模型,还需要等待正式上线后的技术说明。
“学习你怎么说话”也带来新的隐私问题
个性化语音输入的隐私风险不只来自录音,还来自系统长期记住了哪些词。
谷歌官方称,Rambler 会清晰提示功能已经启用,音频仅用于实时转录,不会被保存。这个承诺解决的是原始音频留存问题,却没有完全回答 Rambler Dictionary 的数据生命周期:学习到的词保存在本地还是与账号同步、是否参与模型改进、卸载 Gboard 后是否保留,以及用户能否一键清空。
个人词典可能包含比普通输入历史更敏感的信息。公司内部项目名、客户名称、药品名称、家庭成员姓名和未公开产品代号,恰恰都是通用模型不认识、却最可能被系统学习的词。换句话说,Rambler Dictionary 越有用,它保存的信息就可能越私人。
谷歌需要在正式发布时提供至少四项明确控制:
- 是否允许 Rambler 自动学习新词的独立开关;
- 学习词语的可查看、可编辑和可删除界面;
- 本地保存、账号同步与云端处理范围的明确说明;
- 无痕模式、企业工作资料和普通个人资料之间的数据隔离。
这些控制项不是面向隐私极客的附加设置,而是个性化功能能否进入企业环境的前提。企业用户愿意让输入法记住术语,不代表愿意让术语跨设备同步,更不代表允许这些信息进入通用训练流程。
Rambler 正在把输入法变成最贴近用户的 Agent
Gboard 的优势不是拥有一个聊天机器人,而是占据了所有应用共享的文本入口。
独立 AI 写作工具通常要求用户先打开应用、输入或粘贴内容、等待改写,再把结果复制回原来的聊天窗口。Rambler 如果直接嵌入键盘,就能在 WhatsApp、邮件、办公软件和浏览器表单中工作,不需要每个应用单独适配。
这种分发位置让 Gboard 比很多 AI 助手更容易形成高频使用。用户未必每天主动打开 Gemini,但每天都会敲键盘;只要 Rambler 能把一段杂乱口语稳定整理成可直接发送的消息,它提供的就是可被感知的时间节省,而不是一个需要刻意寻找的 AI 功能。
个性化词典进一步强化了这种入口优势。独立聊天机器人知道用户过去聊过什么,输入法则可能知道用户在不同应用里经常输入什么;前者更接近知识助手,后者更接近跨应用的表达层。对于谷歌来说,这也是 Gemini Intelligence 从系统功能切入 Android 的一条现实路径。
但输入法不应该替用户“想太多”。聊天机器人写错一句话,用户通常会先阅读再复制;键盘直接重写即将发送的消息,用户可能因为习惯快速发送而忽略语义变化。Rambler 必须在流畅度与忠实度之间保持边界,尤其不能擅自改变数字、时间、否定关系和人名。
目前仍是 Beta 拆包发现,不等于已经全面上线
Gboard v18.0.3 Beta 中出现相关界面,只能证明谷歌正在测试 Rambler 的个性化词汇能力,不能证明所有用户现在都能使用。
APK 拆解经常会提前暴露字符串、图片和未启用入口,但功能可能通过服务器端开关灰度发布,也可能在正式上线前改名、调整交互甚至被暂时搁置。目前尚未确认 Rambler Dictionary 的正式发布时间、首批支持语言、设备范围、词典容量和同步方式。
谷歌在 2026 年 5 月已经把 Rambler 作为 Gemini Intelligence 的组成部分公开,最新拆包则表明这项功能仍在继续完善。与首次发布时强调的“删除停顿和理解改口”相比,8 月出现的个人词典更像是一次产品纵深:谷歌不只希望 Rambler 听懂自然口语,还希望它逐渐听懂具体的人。
对于普通用户,Rambler 最直接的收益是少改几次错字、少删除几句废话;对于开发者、研究人员和跨语言团队,真正值得关注的是专有词识别能否稳定积累。如果 Rambler Dictionary 做对了,语音输入会第一次具备类似机械键盘肌肉记忆的效果——使用时间越长,它越知道用户下一次想写成什么。
OpenAI Hub 观点:这是小功能,也是语音交互的分水岭
Rambler Dictionary 看起来只是 Gboard 多了一个词典,实际却标志着语音输入的优化目标正在从“识别所有人”转为“适应每个人”。
过去十年,语音输入的竞争集中在识别速度、通用词错误率和语言数量;生成式 AI 加入后,竞争开始转向意图还原、文本整理和长期偏好。前一阶段解决“机器有没有听见”,后一阶段解决“机器是否知道你真正想写什么”。
这项功能值得期待,但现阶段仍不宜高估。拆包信息没有给出准确率、延迟、学习速度或误学习率等数据,谷歌也尚未公开 Rambler 与标准听写在统一测试集上的量化对比。没有这些数字,就不能断言它已经比现有语音输入更可靠。
Rambler 最终是否好用,将由三个指标决定:专业词第一次说错后需要纠正几次才能学会、模型整理口语时改变原意的比例有多高,以及个人词典能否被用户完全控制。前两个决定效率,最后一个决定信任。
如果谷歌能把这三件事同时做好,Gboard 就不再只是 Android 上的一块键盘,而会成为一个理解用户语言习惯、覆盖所有应用的个人表达代理。这比在键盘里再塞一个聊天窗口,更有用,也更难被替代。
参考来源
- IT之家:谷歌 Gboard 输入法转录 Rambler 功能将支持学习用户口语词汇——整理了 Gboard v18.0.3 Beta 拆包发现、两种听写模式及 Rambler Dictionary 信息。
- 知乎:谷歌“读作 Android,写作 Gemini”的硬件发布会——介绍 Gemini Intelligence 与 Rambler 的初次发布背景及口语整理能力。



