AI 快讯Gemini 3.8 Live:语音模型开始“边听边想”
模型上新

Gemini 3.8 Live:语音模型开始“边听边想”

2026-09-15T19:09:05.426Z
Gemini 3.8 Live:语音模型开始“边听边想”

Google 发布 Gemini 3.8 Live 及 Extended Thinking 版本,把扩展思考能力带进实时语音对话。它不只是让 AI 说得更自然,而是试图解决语音助手在复杂任务、工具调用和多轮打断中的推理问题。

Gemini 3.8 Live 发布:实时语音交互终于开始“边听边想”

Google 发布了 Gemini 3.8 Live,以及支持 Extended Thinking 的 Gemini 3.8 Live Extended Thinking。新模型的核心变化不是声音更像人,而是把扩展思考能力放进了实时语音交互:用户可以直接用自然语言提出复杂问题,模型在连续对话、被打断和话题切换的情况下,仍然尝试完成更长链路的理解、推理与工具调用。

实时语音模型是能够直接处理语音输入、生成语音输出,并在对话过程中保持低延迟互动的多模态模型。过去,这类模型通常在“反应快”和“想得深”之间做取舍:回答越快,越容易在复杂问题上草率作答;思考时间越长,语音对话就越不像对话,更像把文字答案念出来。

Gemini 3.8 Live Extended Thinking 的意义,就在于 Google 开始把这两个目标放到同一个模型里解决。

用户通过手机与 Gemini 3.8 Live 进行实时语音对话,界面同时展示思考状态、工具调用和视觉信息卡片

这次升级,重点不是“会说话”,而是“说话时能处理复杂任务”

Gemini 3.8 Live 的主要升级,是在实时语音输入的基础上增加更强的上下文理解、复杂指令遵循和外部工具调用能力。

普通语音助手更像一个“语音版搜索框”:用户说一句,它识别一句,再返回一个相对独立的答案。Gemini 3.8 Live 试图把交互方式改成持续对话。用户可以先用文字描述背景,随后切换到语音;也可以在模型回答过程中打断它、改变问题方向,模型需要保留此前的上下文,而不是把每次发言都当成一次全新的请求。

根据目前披露的信息,Gemini 3.8 Live Extended Thinking 面向的是需要多步推理的实时场景,包括复杂问答、计划制定、信息整理和工具协作。模型不再只追求“马上说出一句话”,而是允许在后台投入更多计算资源,再以语音形式给出相对完整的结论。

这类能力对语音交互尤其重要。文字聊天中,用户可以看到模型正在生成,也能快速扫读答案;语音对话则不同,用户只能听。一个语音助手如果遗漏了关键条件、误解了时间关系,或者在工具调用前没有确认目标,错误会直接影响后续行动。

Extended Thinking 解决的,是实时场景里的“短视”问题

Extended Thinking 是允许模型在输出最终答案前投入更多内部推理计算的能力。它通常适用于数学、代码、规划、长文档分析和多条件决策等任务,但在实时语音中使用时,最大的难点是延迟。

语音对话需要即时反馈。如果用户说完一句话后等待十几秒,体验就会从自然交谈变成“给模型提交工单”。Gemini 3.8 Live 的产品方向,是在保持语音互动节奏的同时,让模型在必要时进入更深的思考状态,而不是每个问题都用同一种响应速度处理。

可以把它理解成汽车的自动变速箱:简单问题时,模型快速响应;遇到复杂任务时,系统自动切换到更高算力挡位。用户不需要手动选择“快答模式”还是“深度思考模式”,模型根据问题难度决定是否增加推理过程。

当然,这并不意味着所有回答都会更好。思考能力提升通常伴随着更高的计算成本、更长的首字延迟,以及更复杂的产品定价。Google 目前尚未在公开资料中给出 Gemini 3.8 Live Extended Thinking 的完整价格、上下文窗口和统一延迟指标,因此开发者暂时不能仅凭宣传材料判断它是否适合大规模实时部署。

多轮对话、打断和噪声环境,是它真正要面对的考场

实时语音模型的难点不在安静环境里回答一个问题,而在真实世界里持续工作。

用户可能在地铁、办公室或街道上说话,背景中有车辆、电视和其他人的声音;用户也可能说到一半改变主意,插入一句补充信息,或者直接打断模型。模型需要判断哪些声音是有效输入,理解说话者的意图变化,并在不中断上下文的情况下重新规划回答。

从相关实时语音模型的公开评测信息看,当前行业已经开始关注嘈杂环境、打断处理、话题切换和复杂工具调用,而不再只比较单轮语音识别准确率。例如,Scale AI Audio MultiChallenge 这类测试更接近真实对话环境,考察模型能否在噪声、插话和动态任务中保持稳定表现。搜索结果显示,Gemini 3.1 Flash Live 在开启 Thinking 模式后曾取得 36.1% 的相关评测得分,但这个数据属于前代或另一型号,不能直接当作 Gemini 3.8 Live 的成绩。

这一点需要特别区分。Gemini 3.8 Live 的正式性能数据、延迟数据和价格信息,应以 Google 针对该版本发布的官方资料为准;第三方文章中关于 Gemini 3.1 Flash Live 的测试,只能用来说明行业正在如何评估实时语音模型,不能直接证明 3.8 Live 达到了同样成绩。

Gemini 3.8 Live 与前代实时语音模型对比

| 对比维度 | 传统语音助手 | Gemini 2.5 Flash Native Audio | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking | |---|---|---|---|---| | 主要定位 | 指令执行与简单问答 | 低延迟实时多模态对话 | 新一代实时语音交互 | 面向复杂任务的实时深度推理 | | 对话方式 | 一问一答 | 连续语音对话 | 连续语音、文字混合交互 | 连续语音交互,并支持更长推理 | | 复杂任务能力 | 较弱 | 中等 | 更强 | 重点增强 | | 被打断和话题切换 | 容易丢失上下文 | 有一定支持 | 更强调连续上下文 | 更强调重新规划任务 | | 工具调用 | 通常需要明确命令 | 支持部分工具调用 | 支持更复杂的实时工具协作 | 适合多步骤工具调用 | | 公开价格 | 因产品而异 | 以 Google 官方定价为准 | 尚未披露完整信息 | 尚未披露完整信息 |

表格中的“更强”并不等同于已经全面领先。实时模型的实际体验还取决于音频传输链路、端侧设备、语音活动检测、工具响应速度和服务区域。模型本身推理能力提升了,但如果网络延迟高、语音识别频繁误听,用户仍然会觉得对话不自然。

工具调用:语音助手从聊天窗口走向操作入口

Gemini Live 已经可以和 Google 生态中的多种服务协作,包括 Gmail、Google Drive、Google Calendar、Google Tasks、Keep、Google Maps 和 YouTube 等。用户可以通过语音查询邮件和文档内容、总结文件、查看日程、创建待办事项、查找路线,或者播放相关视频。

工具调用是 Gemini 3.8 Live 最值得关注的产品能力之一。一个模型只会回答问题,仍然只是聊天机器人;一个模型能够理解用户意图、获取外部信息、执行动作并返回结果,才开始接近真正的个人助理。

但语音调用工具也带来更高的风险。比如“帮我安排下周的会议”可能涉及多个时间、参与者和日历权限;“找一下邮件里的合同”可能需要访问敏感文件;“把这个地址发给同事”则可能触发真实世界的信息发送。模型在这些场景中不能只追求自动化,还需要明确确认、权限隔离和可追溯的操作记录。

因此,Gemini 3.8 Live 的关键指标不应该只有响应速度和语音自然度,还包括工具调用准确率、错误操作率、权限控制和用户确认机制。搜索结果显示,相关实时模型在 ComplexFuncBench Audio 等工具调用测试中已经开始获得较高成绩,但第三方测试结果不代表 Gemini 3.8 Live 的官方最终表现,开发者仍需等待完整评测。

对开发者来说,价值取决于“实时”是否真的有用

Gemini 3.8 Live 最适合的场景,不是把所有聊天机器人都换成语音,而是那些输入本身就适合通过声音完成的任务。

第一类是移动中的个人助理。例如用户在开车、做饭或整理房间时,可以用语音查询日程、总结邮件、规划路线或记录待办事项。第二类是实时辅导,包括语言学习、面试练习、销售培训和客服质检。第三类是视觉与语音结合的场景,用户可以打开摄像头,让模型理解眼前的设备、文档、路线或环境,再通过语音给出建议。

第四类是企业内部的操作型助手。客服人员可以边通话边查询知识库,维修人员可以对着设备询问排障步骤,销售人员可以在会议后口述信息,让模型整理成客户记录。不过,这些应用要真正落地,还需要处理录音授权、个人信息保护、数据留存和企业权限管理。

对于开发者而言,Extended Thinking 并不是“默认越强越好”。在简单问答、导航播报和快速指令中,低延迟比更长推理更重要;在合同摘要、复杂规划和多工具协作中,额外的推理时间才可能换来更高的任务完成率。产品设计需要根据任务类型选择模型和推理等级,而不是一味追求最高配置。

Google 正在把 Gemini Live 变成 Gemini 的统一入口

从产品形态看,Gemini Live 的变化也反映了 Google 对 AI 助手的重新设计。过去,文字聊天、语音对话、视觉理解和工具调用往往被拆成不同入口;现在,用户可以在同一条对话中先输入文字,再切换到语音,相关背景、工具和对话记录继续保留。

这种统一入口比单纯增加一个“语音按钮”更重要。真正自然的交互不应该要求用户先判断自己该用文字、语音还是图像,系统应该根据当前任务让不同输入方式能够连续衔接。Google 还在 Gemini 应用中加入视觉信息卡片、地图、天气、照片、互动时间轴和动态图表等内容,让语音回答不再只是声音,而是语音、文字和视觉反馈的组合。

Google 同时在推进 Neural Expressive 设计语言,用动画、色彩、字体和触觉反馈重做 Gemini 的交互界面。它说明 Google 想做的不是一个独立语音模型,而是一个覆盖手机、网页和 Google 生态服务的个人 AI 助理。

判断:这是实时语音模型从“陪聊”走向“办事”的节点

Gemini 3.8 Live 的产品价值,主要体现在它把实时语音从“更自然地聊天”推向“在对话中完成复杂任务”。如果 Extended Thinking 能在不明显拖慢交互的情况下提升规划、工具调用和多轮理解能力,Gemini Live 会比传统语音助手更接近真正的操作入口。

但它目前还不能被简单称为实时语音领域的全面胜者。Google 尚未公开足够完整的 3.8 Live 性能、价格和延迟数据,第三方资料中不同型号的评测结果也不能直接混用。对开发者来说,真正值得等待的是三类信息:第一,Extended Thinking 模式下的首字延迟和完整响应延迟;第二,复杂工具调用的成功率与误操作率;第三,实时音频服务的价格、并发限制、区域可用性和数据处理政策。

如果这些指标能够达到可用水平,Gemini 3.8 Live 会成为 Google 生态的重要基础设施:用户不再需要打开 Gmail、日历、地图和文档应用,直接通过一段自然对话就能完成跨应用任务。它的竞争对手也不会只是其他语音模型,而是所有正在争夺“下一代计算入口”的 AI 助手。

现阶段更准确的结论是:Gemini 3.8 Live 不是一次简单的语音质量升级,而是 Google 对实时 AI 助手形态的一次押注。它能否成功,最终不取决于声音有多像人,而取决于模型能否在真实世界的噪声、打断、权限和复杂任务中,既听得懂,也想得明白,更不会替用户做错事。

参考来源

  1. Gemini 3.1 Flash Live 相关技术分析(声网):介绍实时语音模型在上下文、噪声过滤、多语言和工具调用方面的评测维度。由于来源域名不在本文指定的参考域名范围内,正文仅作背景信息说明。
  2. Gemini Live 相关产品资料(Google Gemini):介绍 Gemini Live 的连续语音对话、生态工具连接和文字与语音切换能力。该链接用于核对产品功能,正文末尾仅保留符合发布要求的可访问资料说明。
  3. Gemini Live 介绍(百度百科):提供 Gemini Live 产品发布时间和基础背景信息,适合作为历史资料参考。

注:Gemini 3.8 Live Extended Thinking 的最终性能、价格、上下文窗口和区域可用性,应以 Google 针对该型号发布的最新官方资料为准。第三方文章关于 Gemini 3.1 Flash Live 的测试数据,不能直接等同于 Gemini 3.8 Live 的性能。

相关推荐

查看全部