谷歌办公Agent上线,开始调用Claude

谷歌在 Gemini at Work 2026 中发布 Gemini Agent,支持跨应用执行任务、长期云端运行、独立企业身份和多智能体协作,更关键的是,它可以按任务调用 Gemini 或 Claude。办公 Agent 正从单模型助手转向跨模型协作系统。
谷歌办公Agent上线,开始调用Claude
谷歌在 2026 年 10 月 9 日发布了企业办公智能体 Gemini Agent,并明确支持根据任务需要调用 Anthropic 的 Claude。办公 Agent 的竞争,已经从谁能写邮件、做 PPT,进入谁能组织多个模型和工具完成一项完整工作。
这不是一次普通的 Gemini 功能更新。Gemini Agent 的目标,是让用户只交代最终目标,智能体自行拆解任务、选择工具、调用企业数据、执行多轮操作,并在云端持续推进工作。谷歌给出的产品原则是:You give it objectives, not instructions。 中文可以理解为:用户给目标,不再逐步下指令。

谷歌发布了什么
Gemini Agent 是一个能够长期运行、跨应用调用工具并自主规划企业任务的办公智能体。 它覆盖的不是单一聊天窗口,而是 Google Workspace、企业数据、代码环境和多智能体协作组成的工作系统。
根据 Google Cloud 在 Gemini at Work 2026 中公布的信息,Gemini Agent 目前重点覆盖以下能力:
- 统一入口:用户通过自然语言描述目标,智能体负责拆解后续步骤。
- 跨应用调用:能够在 Gmail、Google Docs、Google Sheets、Google Slides 等应用之间传递任务结果。
- 云端持久运行:复杂任务不需要用户一直停留在当前页面,智能体可以在云端继续执行。
- 工具和技能调用:针对报告、数据分析、机器学习等工作提供专门 Skill。
- 多智能体协作:大型任务可以拆分给多个子 Agent,分别处理资料、数据、代码和内容生成。
- 事件触发与定时任务:企业可以让智能体根据时间、邮件、文件变化或其他事件自动启动流程。
- 多模型路由:除了 Gemini 系列模型,系统也可以调用 Claude 等第三方模型。
这意味着 Gemini Agent 的交互单位不再是一次问答,而是一项可交付的工作。例如,用户提出制作一份市场分析报告,智能体可以先搜索和整理资料,再在 Sheets 中建立财务模型,最后在 Slides 中生成演示文稿。用户看到的不是一堆互相割裂的回答,而是一份可以继续编辑、复核和交付的结果。
从聊天助手变成数字同事
Coworker Agent 是一种拥有企业身份、工作职责和持续任务的数字同事型智能体。 它可以拥有独立的企业邮箱、日历、云端存储空间和公司目录身份,并以明确的工作角色参与团队协作。
这个设定比单纯给聊天机器人增加工具更重要。传统办公助手通常需要员工打开窗口、提出请求,然后等待结果;Coworker Agent 则更接近一个可以被分配任务的虚拟员工。企业可以让它长期负责资料汇总、会议准备、销售线索整理、周期性报告或邮件草拟,而不是每周重复告诉它同一套背景信息。
一个典型流程可能是这样的:
- 企业为 Agent 分配一个明确职责,例如销售运营分析员。
- 管理员授予它读取 CRM 导出表、销售邮件和季度目标文档的权限。
- Agent 每周一自动汇总上周销售进展,标出异常数据和待跟进客户。
- 它在 Sheets 中更新预测模型,在 Docs 中生成周报草稿。
- 涉及外发邮件、修改关键数据或发布正式报告时,交由员工审批。
这种产品形态的价值,在于它将 AI 从被动响应变成了组织流程中的一个节点。真正的竞争点也因此从模型回答得像不像人,转移到它能否稳定地完成任务、正确使用权限,并且在失败时给出可追踪的过程记录。
最值得关注的是:它可以调用 Claude
多模型路由是指智能体根据任务类型、复杂度、成本和延迟,在不同底层模型之间自动选择。 Gemini Agent 支持 Google 自有模型,也支持 Anthropic Claude 等第三方模型,这让谷歌的办公智能体不再被单一模型绑定。
这件事的信号很强。过去,云厂商通常希望用户把数据、工具和模型全部锁定在自己的平台上;而 Gemini Agent 的设计更像一个模型编排层。只要某个任务更适合 Claude,系统就可以把任务交给 Claude;需要深度接入 Google Workspace 时,再由 Gemini 或谷歌自己的工具链完成。
谷歌给出的智能路由数据是:在相关任务中,采用路由后综合运行成本可以降至全部使用前沿模型时的约三分之一,执行速度提升约 40%。换算来看,如果一项流程全部使用高成本前沿模型的相对成本是 3,智能路由后的成本大约是 1;如果原流程需要 10 分钟,理论上可以压缩到约 6 分钟。需要注意的是,这些数字是谷歌公布的结果,适用任务范围、评测方法和基准成本仍需要进一步核实,不能直接等同于所有企业工作流都能获得同样收益。
| 对比维度 | Gemini Agent | 传统办公助手 | 单模型 Agent | |---|---|---|---| | 工作方式 | 以目标为输入,自主规划任务 | 以单轮请求为主 | 围绕一个模型执行任务 | | 工具调用 | 可跨 Google Workspace、数据和代码环境 | 通常局限在单个应用 | 取决于产品集成能力 | | 模型选择 | Gemini 与 Claude 等模型动态路由 | 通常固定模型 | 一般固定底层模型 | | 任务持续性 | 支持云端持续运行、事件触发和定时任务 | 多数需要用户主动启动 | 视产品是否提供后台执行能力 | | 协作方式 | 可拆分给多个子 Agent | 基本没有多 Agent 协作 | 通常由一个 Agent 完成 | | 企业身份 | Coworker Agent 可拥有邮箱、日历和目录身份 | 通常没有独立身份 | 多数以用户身份运行 | | 主要风险 | 权限、审计、模型路由和结果责任 | 能力有限但边界清晰 | 单点模型错误和上下文不足 |
这也解释了为什么谷歌不必等到下一代 Gemini 模型再进入办公 Agent 市场。对办公智能体来说,决定体验的并不只是模型在基准测试上的最高分,而是模型、应用、数据、权限和执行环境能否被组织成一个可靠流程。模型能力是发动机,Agent 编排才是整辆车。
四重记忆解决长期工作的上下文问题
企业智能体记忆是指系统保存并复用任务状态、用户偏好、企业规则和历史工作方式的能力。 如果 Agent 只能记住当前对话,它就很难承担长期职责;用户每次都要重新解释业务背景,所谓数字同事最终仍然只是一个更大的聊天窗口。
谷歌围绕 Gemini Agent 提出了四类记忆机制,分别解决不同层面的问题:
- 任务记忆:记录当前工作进行到哪一步、已经完成了哪些操作、还有哪些待处理事项。
- 用户记忆:保存用户的偏好、常用格式、工作习惯和上下文要求。
- 企业记忆:理解公司内部的指标定义、组织结构、流程规则和权限边界。
- 工作流记忆:从过去的执行方式中提取可复用步骤,帮助 Agent 处理重复性任务。
这四类记忆的意义,不是让 AI 记住更多闲聊,而是让它知道一个企业如何定义营收、哪些文件可以引用、什么操作必须审批,以及一份周报过去是怎样生成的。对企业用户而言,记忆是否可查看、修改、删除和审计,比记忆容量本身更重要。
多 Agent 协作,才是办公自动化的下一阶段
多智能体协作是指由一个主 Agent 负责规划,再将不同子任务分派给具备专门能力的子 Agent。 它的价值不在于让多个模型同时聊天,而在于把复杂工作拆成可以并行、验证和重新执行的模块。
以一份季度经营分析为例,主 Agent 可以将任务拆成四部分:
- 研究 Agent:整理行业数据、竞争对手动态和外部资料。
- 数据 Agent:读取企业表格,计算收入、成本、转化率和增长趋势。
- 代码 Agent:编写并运行分析脚本,检查异常值和计算逻辑。
- 内容 Agent:将结果组织成文档、演示文稿和管理层摘要。
最后由主 Agent 汇总结果,并把关键数字与原始数据链接起来。这样的架构接近一个小型项目团队:不同角色处理不同环节,主协调者负责安排顺序、整合结果和暴露风险。
不过,多 Agent 并不天然等于更可靠。任务拆得越细,通信成本、上下文丢失和错误传递的概率也越高。如果研究 Agent 引用了一条错误数据,内容 Agent 可能会把它包装得更加可信;如果数据 Agent 的口径与企业财务口径不一致,最后的 PPT 可能看起来完整,却不能用于决策。因此,企业部署这类系统时,必须保留来源追踪、步骤日志、权限隔离和人工审批。
谷歌真正瞄准的是办公入口
Gemini Agent 的发布,也说明办公 Agent 的竞争已经从功能竞争转向入口竞争。谁能成为企业员工每天提交目标、获取结果和分配任务的入口,谁就有机会掌握企业软件使用链路中的核心位置。
微软拥有 Microsoft 365、Teams、Excel 和企业目录;Salesforce 掌握 CRM、销售流程和客户数据;Meta 正在探索面向办公的智能体;OpenAI、Anthropic 等模型厂商则通过 Codex、Claude Code 等产品从代码和桌面任务切入。谷歌的优势是 Workspace、Cloud、数据分析工具和企业身份体系可以在同一个账户体系中衔接起来。
但谷歌也面临一个现实问题:企业不会因为 Agent 能生成一份漂亮的 Slides,就自动把关键工作交给它。真正影响采购的因素包括数据隔离、权限颗粒度、审计能力、失败后的责任归属、输出是否可验证,以及模型调用成本是否稳定。
调用 Claude 既是 Gemini Agent 的卖点,也是谷歌必须面对的复杂性。不同模型的上下文窗口、工具调用格式、数据处理位置、输出风格和安全策略并不完全一致。谷歌需要把这些差异藏在编排层之后,否则用户会感受到同一项任务在不同模型之间表现不稳定,企业管理员也很难解释为什么某次任务使用了外部模型。
对开发者和深度用户意味着什么
办公 Agent 的产品边界正在从生成内容扩展到执行工作流。 对开发者而言,未来重要的能力不只是调用某个模型,而是设计可被 Agent 理解、验证和组合的工具。
这会带来几项变化:
- 企业软件需要提供更清晰的权限和动作接口,让 Agent 能够安全地查询、修改和提交数据。
- 工具输出需要结构化、可追踪,不能只返回一段无法验证的自然语言。
- 应用要支持长任务状态、暂停、恢复、重试和人工接管。
- 模型评测要从单轮回答准确率,扩展到完整工作流成功率。
- 组织需要重新定义哪些环节允许自动执行,哪些环节必须经过人工审批。
对普通深度用户来说,Gemini Agent 的关键价值也不在于它能不能帮你写一封邮件,而在于它是否能把几个原本需要来回切换的工作连接起来。例如从邮件中提取客户需求,更新表格,生成报价文档,再创建日历事项。如果这些步骤仍然需要用户不断确认,Agent 只是快捷方式;只有当它能在边界清晰的情况下持续完成任务,才称得上办公智能体。
我们的判断:方向正确,但还没有证明可靠
谷歌这次发布的意义,大于某一个新功能。它首次比较明确地承认:企业办公 Agent 不一定要坚持只使用自家模型,未来的核心产品可能是一个能够调度多个模型、多个应用和多个数字身份的工作操作层。
这对用户是好事。模型之间可以按任务分工,简单任务使用更快、更便宜的模型,复杂任务交给推理能力更强的模型;企业也不必因为选择了一套办公软件,就永久绑定某一个模型供应商。
但这并不意味着 Gemini Agent 已经解决了办公自动化。谷歌目前公布的成本下降 66.7% 和速度提升 40%,仍然需要更多公开评测验证;Coworker Agent 的独立身份、长期记忆和自动执行能力,也会把权限管理和责任追踪推到更高优先级。
我们的判断是:Gemini Agent 是办公智能体从聊天助手走向工作系统的重要一步,但它的成败不取决于能否调用 Claude,而取决于能否让跨模型协作在真实企业流程中稳定、可审计、可接管。
如果它只是把 Gemini、Claude、Sheets 和 Slides 拼在一起,用户得到的是一套能力更复杂的缝合系统;如果它能准确选择模型、维护任务状态、引用可靠数据,并在关键节点主动请求授权,办公 Agent 才会从演示功能变成企业真正愿意依赖的生产工具。
参考来源
- 量子位:不等 Gemini 4 了!谷歌发布办公 Agent,支持调用 Claude:介绍 Gemini Agent、Coworker Agent、跨应用执行和多模型调用等核心信息。
- 36氪:今天,Gemini 全面杀入 AI 办公大战:补充谷歌云在智能路由、四重记忆和多智能体协作方面的产品信息。
- Reddit:Claude Code 生成多个 AI Agent 并让其互相交流:用于说明多智能体协作在开发和办公场景中的行业讨论背景。



