AI 快讯Claude看你操作一遍,就能学会工作流
产品更新

Claude看你操作一遍,就能学会工作流

2026-07-22T07:05:53.794Z
Claude看你操作一遍,就能学会工作流

Claude Cowork 新增“录制技能”,可根据屏幕操作与语音讲解自动生成可复用工作流。它显著降低了 Agent Skill 的制作门槛,但稳定性、权限控制和敏感数据处理仍是落地关键。

Claude 把“写自动化”变成了“演示自动化”

Anthropic 正在为 Claude Cowork 推出“录制技能”(Record a skill)功能,用户只需完整演示一次电脑操作,并同步用语音解释关键步骤,Claude 就能将过程整理成可重复执行的结构化技能。

这项更新由 Claude 官方账号在 7 月 21 日公布,目前面向 Claude Pro、Max 以及 Teams 订阅用户开放体验。按照官方展示的交互方式,用户可以在 Claude 桌面应用的加号菜单中选择“录制技能”,随后像平时工作一样操作电脑,不必预先编写脚本,也不必把流程拆成几十条提示词。

**录制技能是一种通过观察用户操作和听取语音说明,自动生成可复用 Agent Skill 的教学方式。**系统会在录制期间追踪屏幕活动、鼠标移动、键盘操作和语音讲解,再把这些信息汇编成存入个人技能库的结构化工作流。

这不是一次普通的录屏功能更新,而是 Anthropic 在尝试改变人类向 AI 传授工作方法的方式。过去用户要把“我是怎么做这件事的”翻译成文字规则,现在 Claude 试图直接观看示范,再自行完成这层翻译。

Cowork 的目标不是陪聊,而是接手桌面工作

**Claude Cowork 是 Anthropic 为 Claude 打造的桌面协作环境,定位是让 AI 访问文件、调用应用并完成多步骤工作,而不只是生成一段回答。**它位于 Claude Chat 与 Claude Code 之间:比聊天窗口更能动手,又比终端和代码工具更适合不写程序的知识工作者。

Cowork 的核心价值在于把模型的推理能力接到真实工作环境里。用户可以授权 Claude 读取指定文件、结合持久上下文理解任务,并通过工具连接其他应用,让它完成整理文件、汇总材料、更新表格或生成周期性报告等操作。

这种产品形态解决的是聊天机器人长期存在的“最后一公里”问题。模型可以告诉用户应该如何处理一批发票,但真正耗时的工作仍然是打开文件、识别字段、填入表格、按照规则重命名,再把异常项单独标记出来;Cowork 想做的,是直接完成后半段。

录制技能又补上了另一块短板:用户未必能准确描述自己的流程。很多办公室工作依赖隐性经验,例如“遇到这种格式先看备注”“客户名称不一致时以合同为准”“金额超过某个范围要留给主管确认”,操作者自己很熟悉,却很难一次写成没有歧义的提示词。

一次录制,大致经历四个阶段

录制技能的交互流程并不复杂,但后台做的事情远多于保存一段视频。

  1. **启动录制。**用户在 Claude 桌面应用的加号菜单中选择“录制技能”,并确认需要共享的屏幕或应用范围。
  2. **执行示范。**用户正常移动鼠标、输入内容、切换窗口和处理文件,同时通过语音解释目的、判断规则及例外情况。
  3. **抽取流程。**Claude 将视觉画面、点击位置、击键动作和语音说明组合起来,识别任务目标、步骤顺序、输入输出以及条件分支。
  4. **生成技能。**系统把演示整理成可复用的结构化技能,并保存到用户个人库中,供后续任务按需调用。

真正重要的是第三步,因为鼠标轨迹本身并不等于工作规则。用户点击表格的第六列,Claude 需要理解那一列代表“付款状态”,而不是死记某个像素坐标;用户跳过一封邮件,Claude 也需要判断这是业务规则,还是演示时偶然漏掉了操作。

语音讲解因此不是可有可无的旁白,而是帮助模型区分“动作”与“意图”的语义层。比如用户一边筛选订单一边说“只处理已经付款、但还没有物流单号的记录”,这句话比鼠标点击更接近可迁移的规则,也更容易适应下一次界面或数据变化。

Agent Skill 像数字版入职手册

**Agent Skill 是一种把业务流程、操作说明、脚本和相关资源封装为模块化能力的开放构建标准。**智能体执行任务时可以按需加载某项技能,不必在每次对话中重新获得完整的背景说明。

如果把大模型视为刚入职的通才员工,Skill 就像按岗位整理的入职手册。模型本身知道怎样读文件、归纳文本和调用工具,但它不知道某家公司的周报格式、审批规则和文件命名规范;Skill 负责补上这些组织特有的知识。

传统创建方式要求用户用文字明确写出步骤,有时还要提供脚本、模板和资源文件。对开发者来说,这种方式更容易审查、测试和版本管理;对财务、运营、行政或教师等非技术用户来说,制作成本依然偏高。

录制技能把 Skill 的入口从“写规范”改成了“带着 AI 做一遍”。这种变化类似于让资深员工现场带教,而不是要求他先写一本标准作业程序。对于规则清晰但描述繁琐的任务,录制往往更符合真实的知识传递习惯。

| 方案 | 创建方式 | 技术门槛 | 面对界面变化的适应性 | 可审查性 | 更适合的任务 | |---|---|---:|---|---|---| | Claude 录制技能 | 屏幕演示加语音讲解 | 低 | 理论上较强,取决于模型理解 | 中,需检查生成结果 | 跨应用、包含语义判断的知识工作 | | 手写 Agent Skill | 文本规则、脚本和资源文件 | 中至高 | 高,可主动维护规则 | 高 | 稳定业务流程、团队标准化操作 | | 传统 RPA | 录制点击、选择器或流程图 | 中 | 通常较弱,界面改版可能导致失败 | 高,步骤较确定 | 规则固定、结构稳定的大批量操作 | | 单次提示词 | 自然语言临时描述 | 低 | 取决于上下文 | 低 | 低频、一次性任务 |

这张表也说明,录制技能并不会直接淘汰传统 RPA 或手写脚本。它最有吸引力的地方是创建速度和语义理解,而传统自动化的优势仍然是确定性、审计能力和稳定吞吐量。

最有价值的场景,是“重复但不完全机械”的工作

录制技能最适合规则基本固定、每次输入又略有差异的桌面任务。纯机械点击可以交给宏或 RPA,完全开放的复杂决策则仍需要人工负责;介于两者之间的流程,才是 AI Agent 最容易体现价值的位置。

内容运营可以演示如何从选题表读取主题、检索内部资料、按照固定结构生成草稿,再把结果放入指定文件夹。教师可以展示如何汇总学生提交文件、检查命名格式、提取缺交名单并生成通知。销售团队则可以训练 Claude 整理会议纪要、更新客户记录,并按照企业规则生成跟进事项。

录制技能对“长尾自动化”尤其有意义。企业通常只愿意为高频核心流程采购和实施 RPA,大量每周执行一两次、每次耗时二三十分钟的小任务,因为开发回报不够高而长期依赖手工处理;如果录制一次就能形成初版技能,这些流程才可能进入自动化范围。

个人用户也能借此建立自己的工作方法库。一个成熟的技能不只是替用户点击按钮,还能保存文件组织方式、输出模板、检查清单和异常处理习惯,使 Claude 的结果从“通常可用”变成“更接近这个用户的做法”。

它比传统录制宏聪明,但也没有聪明到可以盲信

录制技能与传统宏最大的差别,是 Claude 理论上可以理解界面元素和任务语义,而不是只复现固定坐标。按钮从页面左侧移动到右侧时,坐标宏可能立即失效;具备视觉理解的 Agent 则可能根据按钮文字、页面结构和当前目标重新定位。

这种灵活性同时带来了不确定性。传统脚本在相同输入下通常沿固定路径执行,而生成式 Agent 可能因为页面内容、上下文或模型判断差异选择不同操作。它更像一个会随机应变的助理,而不是一台每次都走同一轨道的机器。

用户因此不应把“一次示范”理解成“一次示范后永不出错”。复杂流程至少需要用多组输入测试,尤其要覆盖空数据、字段缺失、页面加载失败、同名文件、权限不足和格式变化等边界情况。

一个可靠的技能还应明确停止条件和升级条件。例如金额高于某个阈值时不自动提交,收件人属于外部域名时先请求确认,识别不到客户编号时只做标记而不自行猜测。真正决定自动化是否安全的,往往不是正常路径,而是异常发生时 AI 是否知道停下来。

屏幕、键盘和语音都可能包含敏感信息

录制技能引入的最大风险不是模型能力不足,而是录制范围可能覆盖密码、客户信息和内部系统数据。屏幕画面、击键操作与语音解释组合起来,能够还原相当完整的业务上下文,也可能包含组织最不希望外泄的内容。

个人用户在录制前应关闭无关窗口和通知,避免在演示中输入真实密码、身份信息或支付数据。更稳妥的做法是使用测试账号和脱敏样本完成教学,再让技能在受控权限下处理正式任务。

Teams 用户则需要关注更细的治理问题,包括录制数据保存在哪里、保留多长时间、谁能查看或编辑技能、技能能否跨成员共享,以及运行记录是否支持审计。现有公开信息尚未完整说明录制内容的存储与处理细节,涉及敏感业务的团队不应仅凭功能演示就默认它满足自身合规要求。

最小权限原则仍然适用于桌面 Agent。Claude 只应获得完成任务所必需的文件夹、应用和账号权限,高风险动作则应保留人工确认,特别是发送外部邮件、删除文件、修改生产数据、提交订单和执行支付。

Anthropic 真正争夺的是企业流程入口

录制技能表面上降低了自动化门槛,背后争夺的却是企业内部工作方法的沉淀入口。谁能让用户最方便地把流程教给 Agent,谁就更有机会成为组织日常工作的默认执行层。

模型能力正在快速趋同,但组织专属的 Skill 库不会自动趋同。一家公司积累的审批规则、分析模板、客户处理方法和异常案例,会形成迁移成本,也会让 AI 产品从可替换的聊天工具变成嵌入业务的基础设施。

Anthropic 选择把 Skill 做成模块化、可复用和可版本管理的能力,也是比“超长提示词”更务实的方向。提示词适合个人即时使用,技能才适合团队维护、权限管理、重复调用和持续迭代。

不过,录制只是生成初稿的捷径,不是流程治理的终点。企业最终仍然需要知道一个技能由谁创建、依据什么规则、测试过哪些样本、修改了哪些内容,以及模型或应用升级后是否需要重新验证。

这次更新好用,但价值取决于后续能否“可测试”

录制技能是 Claude Cowork 目前最值得关注的产品更新之一,因为它把构建 Agent 的最低操作单位从“写提示词和脚本”降到了“示范一遍”。对大量不会编程、却非常熟悉自身业务的用户来说,这比模型跑分提升几个百分点更直接。

这项功能能否从惊艳演示走向生产环境,取决于 Anthropic 是否补齐测试、权限、日志、版本回滚和异常处理能力。如果用户只能录制和运行,却不能查看 Claude 总结出的规则、逐步修正误解并比较不同版本,技能库很快会变成难以维护的黑箱。

现阶段最合理的使用方式,是先让 Claude 接手低风险、可复核、失败成本较低的流程。文件整理、资料汇总、草稿生成和表格预处理适合作为起点,而涉及资金、外部发布和生产系统修改的任务仍应设置人工审批。

Claude Cowork 正在把“教 AI 工作”从一句营销口号变成具体交互。过去人们学习机器的语言来写自动化,现在机器开始通过观看和听讲来学习人的流程;这一步没有彻底解决 Agent 的可靠性问题,但确实让更多人的工作经验第一次有机会被直接封装成可执行的软件。

参考来源

相关推荐

查看全部