AI 快讯Gemini Spark开始替人跑腿
产品更新

Gemini Spark开始替人跑腿

2026-08-02T04:04:24.542Z
Gemini Spark开始替人跑腿

Google将Gemini Spark向全球更多用户开放,这款个人AI Agent可整理收件箱、搜索航班并操作网页,但付款等敏感步骤仍需用户确认。

Gemini从回答问题,走到了替用户办事

Google正在把Gemini Spark开放给全球更多用户,个人AI Agent也因此从演示阶段走向真实账户和真实工作流。根据Google于7月31日公布的信息以及IT之家8月2日的报道,Spark目前已覆盖大部分支持Gemini的地区,可以在用户授权后整理收件箱、总结通讯邮件、取消订阅,并通过Chrome完成搜索航班、推进机票预订、查询收藏房源等多步骤网页操作。

Gemini Spark是Google面向个人用户推出的常驻型AI智能体,它不只生成文字答案,还能根据目标持续调用已连接的应用、浏览器会话和个人信息来执行任务。普通聊天机器人通常在输出答案后结束工作,Spark则要把一句自然语言要求拆成多个步骤,判断使用哪些信息源、打开哪些页面、填写哪些字段,并在需要用户决策时暂停。

这次更新的重点不是Gemini又多了一个入口,而是Google开始把模型放进用户已经登录的数字生活。过去,用户让AI推荐一趟航班,得到的往往是一份搜索建议;现在,Spark可以进一步打开航班页面、筛选日期和价格、利用Chrome中的登录状态推进流程,直到付款或正式提交前再把控制权交还用户。

Gemini Spark在Chrome中执行航班搜索、收件箱整理和人工付款确认的流程示意图

Spark能做什么,边界又在哪里

Spark最适合处理的是步骤较多、规则相对明确、需要跨页面或跨应用完成的重复任务。Google列出的典型场景包括管理邮件、安排日程、持续追踪条件、浏览已登录网站,以及围绕一个长期目标定期生成结果。

收件箱整理是Spark现阶段最容易体现价值的场景。用户可以要求它找出一周内的通讯邮件并生成摘要,也可以识别低价值订阅、整理需要回复的邮件,或者从学校通知、会议邀请和项目邮件中提取日期与待办事项。Google在官方说明中强调,Spark不会无差别读取所有邮件,而是在用户指示和授权范围内处理相关内容。

网页代办是Spark与传统Gemini对话最明显的分界线。Spark与Chrome整合后,可以使用用户已经保存并授权调用的账户登录信息,访问需要登录的网站,搜索符合条件的航班、查看收藏房源或协助填写表单。这类能力本质上相当于让AI获得一台可操作的浏览器,而不是只让模型阅读一份静态搜索结果。

长期任务是Spark区别于一次性浏览器自动化的另一项能力。用户可以设置持续条件,例如机票价格低于某个阈值时提醒、项目状态变化后生成摘要,或者每周整理特定主题的邮件和资料。Spark可以在后台继续运行这些工作,不要求用户一直打开当前聊天窗口或守在电脑前。

不过,Spark所说的预订机票并不等于AI可以不经确认直接花钱。它能够搜索、筛选和推进预订步骤,但付款、最终提交等高风险动作仍交由用户完成,因此更准确的说法是Spark可以把任务推进到结账前,而不是独立完成一笔不可逆交易。

| 任务类型 | Spark可以代办的步骤 | 通常需要用户介入的步骤 | 主要风险 | |---|---|---|---| | 航班与机票 | 搜索航班、比较条件、填写部分信息、推进预订流程 | 确认行程、付款、处理验证码 | 选错日期、价格变化、附加费用 | | 收件箱管理 | 查找邮件、分类、摘要、识别订阅、准备处理建议 | 确认重要删除或敏感回复 | 误分类、遗漏上下文、隐私暴露 | | 房源查询 | 登录网站、查看收藏、按条件筛选和整理 | 联系房东、提交申请、支付费用 | 信息过期、错误筛选、身份信息提交 | | 持续监控 | 定期检查条件、汇总变化、触发提醒 | 调整规则、确认后续行动 | 误报、漏报、长期权限过宽 |

两道安全闸门仍然不够,但方向是对的

Spark目前公开强调了两类安全机制:第一类是针对提示词注入的防御,第二类是把付款等敏感操作留给用户确认。这两道闸门分别处理AI被外部内容诱导和AI执行不可逆动作的问题,也是浏览器智能体要进入真实账户必须具备的最低配置。

提示词注入是网页、邮件或文档通过隐藏指令误导AI智能体执行非预期操作的攻击方式。传统浏览器把网页内容展示给人,用户通常能区分正文和操作指令;智能体却可能同时把两者视为可执行上下文。例如,一封邮件可以在不可见区域写入要求智能体转发机密内容的文字,恶意网页也可以诱导智能体忽略用户原始目标并访问其他页面。

付款确认只能降低损失上限,不能消除前序步骤中的风险。即使AI不能直接完成支付,它仍可能填错乘机人信息、取消用户实际需要的订阅、把敏感邮件摘要带入错误会话,或者在多个相似页面中选择错误选项。因此,用户确认不能只出现在最后一个付款按钮前,还应出现在删除数据、发送消息、修改账户设置和提交身份信息等关键节点。

Google的优势在于可以把Gemini、Chrome、Gmail、Calendar、账号体系和Personal Intelligence连接起来,但这种整合也会放大一次授权的影响范围。一个只会聊天的模型答错问题,用户通常损失几分钟;一个拥有邮箱、浏览器和账户会话的智能体做错动作,影响可能跨越多个服务,甚至持续数天才被发现。

Spark现阶段更适合采用最小权限,而不是一次性开放全部个人数据。用户可以先从只读、可撤销、低风险的任务开始,例如生成邮件摘要或监控价格,再逐步开放取消订阅、修改日程和填写表单等权限。对于工作邮箱、医疗记录、财务账户和包含未公开项目资料的页面,持续授权仍需要谨慎。

Google真正卖的是执行环境,不只是模型能力

Spark的竞争力并不完全取决于Gemini模型跑分,而取决于Google能否提供稳定的执行环境。个人Agent需要知道用户是谁、已经登录哪些网站、有哪些日程和邮件、任务执行到哪一步,以及发生异常时如何恢复;这些能力很难只靠更大的上下文窗口解决。

Chrome整合让Google拥有其他AI产品难以复制的入口优势。浏览器保存的登录状态、密码管理和网页交互能力,可以减少智能体在不同服务之间反复授权的摩擦;Gmail与Calendar则提供大量结构化个人上下文,让Spark更容易把邮件中的日期、联系人和事件转换为后续动作。

传统RPA是通过固定规则、选择器和脚本重复操作软件的自动化方式,而个人AI Agent更强调理解自然语言目标并根据页面变化动态调整步骤。RPA在流程固定时通常更可控,但网站版式改变就可能失效;Spark这类Agent的适应性更强,却也更难预测,需要更严格的权限、审计和人工确认。

| 产品形态 | 输入方式 | 是否能执行多步骤任务 | 对页面变化的适应性 | 价格与使用门槛 | 适合场景 | |---|---|---:|---:|---|---| | Gemini Spark | 自然语言目标与持续条件 | 是,可跨应用和网站 | 较强,但仍可能误判 | 需要指定Google AI付费订阅,且受地区限制 | 个人邮件、行程、网页和长期任务 | | 普通聊天助手 | 单轮或多轮提示词 | 通常只提供答案或建议 | 不直接操作页面 | 常有免费版及付费版 | 写作、问答、分析和信息整理 | | 传统RPA | 规则、流程图或脚本 | 是,但流程通常预先定义 | 较弱,需要维护选择器和规则 | 常按席位、机器人或企业项目计费 | 稳定、重复、结构化的企业流程 | | 浏览器扩展式助手 | 当前页面指令 | 可完成局部操作 | 中等,通常局限于前台页面 | 视产品而定 | 页面摘要、填写表单和短流程操作 |

Google目前没有公布Spark在真实任务上的统一成功率、平均完成时间或提示词注入拦截率。缺少这些数字意味着外界暂时无法量化判断它比普通人工操作快多少,也不能仅凭官方演示确认其在复杂网站、网络波动、验证码和页面改版情况下的可靠性。

覆盖扩大了,但还谈不上无门槛开放

Spark此次扩围仍然同时受到地区、年龄、账号和订阅层级限制。官方产品信息显示,个人用户需要年满18岁,具体兼容性和功能可用性还会因国家、账户类型及连接服务而变化;Google也在向部分企业用户逐步开放,而不是让所有Gemini用户立即获得相同能力。

根据7月31日公布的安排,Spark现已进入大部分支持Gemini的地区,但欧洲经济区、尼日利亚、瑞士和英国仍不在此次开放范围内。这意味着此次所谓全球扩围实际明确排除了4个市场或区域,监管、隐私要求和产品合规仍是个人Agent扩大覆盖面的主要变量。

订阅门槛也让Spark更像高阶AI产品,而不是Gemini的免费基础功能。报道显示,美国用户需要订阅Google AI Pro或Google AI Ultra,其他已开放地区则需要Google AI Ultra;实际价格、套餐权益和可用入口可能因市场变化,用户应以Gemini应用内显示为准。

| 用户所在地区 | 当前订阅要求 | 其他主要条件 | 开放状态 | |---|---|---|---| | 美国 | Google AI Pro或Google AI Ultra | 年满18岁,功能与账号兼容性适用 | 已向更多用户开放 | | 其他受支持地区 | Google AI Ultra | 年满18岁,功能与账号兼容性适用 | 已向大部分地区扩展 | | 欧洲经济区 | 暂不适用 | 尚未列入本轮开放 | 未开放 | | 英国、瑞士、尼日利亚 | 暂不适用 | 尚未列入本轮开放 | 未开放 | | 部分企业账户 | 依企业资格与部署安排 | 由管理员、地区及服务支持决定 | 逐步开放 |

这种套餐设计说明Google目前优先把Spark放在高价值用户中验证,而不是追求最大用户规模。Agent任务会持续占用模型推理、浏览器实例、连接器和后台执行资源,成本通常高于一次普通对话;付费门槛既能覆盖计算成本,也能减少早期阶段的滥用和支持压力。

个人Agent的关键指标不是聪明,而是能否放心托管

Spark最有价值的场景不是替用户写一封更漂亮的邮件,而是消灭每天反复发生的数字杂务。对于每天接收上百封邮件、频繁比较航班、跟踪多个项目或管理家庭日程的用户,一次节省5分钟并不显眼,但一个每天执行4次、每次节省5分钟的工作流,每月按30天计算可以节省600分钟,也就是10小时。

工作流是把输入条件、执行步骤、异常处理和人工确认组合成可重复任务的机制。用户真正需要设计的不是一句万能提示词,而是明确Spark何时启动、允许读取什么、可以修改什么、遇到哪些情况必须暂停,以及任务完成后如何留下可检查的结果。

一个可靠的收件箱工作流应该把摘要、分类、删除和外发分成不同权限层级。Spark可以先以只读方式生成每日摘要,经过一段时间验证后再允许添加标签;取消订阅、删除邮件和自动回复则应继续保留确认。这样的渐进式授权虽然不如全自动酷,但更接近个人Agent能够长期使用的现实路径。

Google这次扩围的积极意义在于,个人Agent终于开始处理真实网页和真实账户,而不是停留在演示视频里。它的短板同样明显:可用地区不完整、订阅要求较高、关键成功率尚未披露,提示词注入也仍是整个行业没有彻底解决的问题。

Spark是否会成为个人AI Agent的主流形态,最终取决于三个可验证结果:任务完成率是否足够高,关键动作是否始终可控,用户能否清楚知道它访问了哪些数据。模型偶尔答错一句话可以重问,Agent偶尔替用户做错一件事却可能让整套自动化失去信任。

Google现在领先的不是一个更会聊天的界面,而是一条从个人数据、浏览器登录态到后台执行的完整链路。对深度用户来说,Spark已经值得用低风险工作流试验;对普通用户来说,最稳妥的做法仍是把它当成需要监督的数字助理,而不是可以完全放任的自动驾驶系统。

参考来源

相关推荐

查看全部