AI 快讯CUA-S1开源:电脑代理先快起来
模型上新

CUA-S1开源:电脑代理先快起来

2026-09-19T20:04:12.929Z
CUA-S1开源:电脑代理先快起来

Try Cua 开源面向 Computer Use 的 CUA-S1,尝试用 System 1 模型承担高频桌面操作。它不是更会深思熟虑的通用代理,而是要让执行层更快、更便宜、更容易本地部署。

Try Cua 近日开源了 CUA-S1,把 System 1 模型引入 Computer Use Agent 的执行环节。截至 2026 年 9 月 19 日,这个项目最值得关注的地方不是又多了一个能点击鼠标的视觉模型,而是它试图重新划分电脑代理内部的工作:复杂规划交给慢模型,高频操作交给快模型。

**CUA-S1 是一个面向 Computer Use 场景的 System 1 模型,目标是根据屏幕状态和任务上下文快速生成下一步电脑操作。**这里的 Computer Use,指模型像人一样读取屏幕,并执行点击、输入、滚动、快捷键和应用切换等动作,而不是调用软件预先提供的结构化接口。

这条路线听起来没有长链推理那么性感,却可能更接近电脑代理真正落地时的工程需求。一个代理完成十分钟的跨应用任务,可能要观察屏幕、判断状态和执行动作几十次;如果每次点击都调用一次昂贵的大模型,延迟、成本和错误会被循环不断放大。

CUA-S1 在 Computer Use Agent 中的位置示意图,左侧为用户任务,中间为负责规划的 System 2 模型,右侧为快速读取屏幕并执行点击、输入、滚动的 CUA-S1,底部连接 macOS、Windows、Linux 和 Android 沙箱

CUA-S1要解决的不是“会不会”,而是“能不能连续做”

**当前 Computer Use Agent 的主要瓶颈已经从单步识别转向长流程执行。**模型识别一个登录按钮通常不算难,难的是打开网站、处理弹窗、切换标签页、填写表单、上传文件、检查提交结果,并在页面布局变化时继续完成任务。

传统视觉语言模型通常会走一条很重的路径:读取截图、描述界面、分析任务、生成推理过程,再决定点击哪里。单独看每一步都合理,但在需要 30 次甚至 100 次交互的任务里,这种方式很像让高级项目经理亲自决定每一次鼠标移动——判断能力足够,工作方式却不经济。

**System 1 是一种强调快速、直觉式状态判断与动作选择的模型范式。**这个名称借用了认知科学中“系统一”的概念,与负责复杂分析和长期规划的 System 2 相对;放进电脑代理后,它更接近一个经过视觉训练的熟练操作员,看到界面就能迅速做出下一步动作。

CUA-S1 因而不应该被简单理解为一个缩小版通用模型。它更合理的定位,是 Computer Use 架构中的动作策略模型:上层代理负责理解“整理本月发票并提交报销”这类目标,CUA-S1 负责把目标落实为点击侧栏、选择日期、上传附件和确认提交等连续操作。

**这种分层架构的价值在于把昂贵推理从每一步操作中剥离出来。**如果任务方向没有改变,执行层没有必要反复重新理解完整目标;只有遇到登录失败、权限不足、页面结构异常或任务状态不一致时,系统才需要把控制权交还给更强的规划模型。

它和普通视觉语言模型有什么不同

**CUA-S1 与通用视觉语言模型的区别主要体现在优化目标,而不只是参数规模。**通用模型需要回答图片内容、解释图表、识别物体并进行开放式对话;Computer Use 模型则更关注界面状态变化,以及动作能否让任务向目标推进。

一个模型能准确说出“页面右上角有蓝色提交按钮”,不代表它能稳定点击按钮。实际执行还涉及坐标映射、缩放比例、滚动位置、遮挡关系、窗口焦点、加载状态和动作后的反馈验证,这些问题共同构成了 GUI 自动化中的 grounding,也就是把语义目标准确落到界面元素和操作位置上。

**Grounding 是把“要操作什么”转换为“在屏幕哪里操作”的定位过程。**它是 Computer Use 最容易被低估的一层,因为聊天演示通常只展示成功案例,而真实桌面中存在浏览器缩放、系统字体、响应式布局和动态广告等大量变量。

CUA-S1 的方向,是让模型更专注于观察到动作的短路径映射。这个思路类似机器人领域的视觉动作策略:高层系统说清楚要拿哪个杯子,底层策略负责连续调整机械臂,而不是每移动一厘米都重新做一次完整任务规划。

下面的对比能更清楚地说明它的位置:

| 方案 | 核心定位 | 决策方式 | 单步速度预期 | 长任务规划 | 本地部署 | 典型用途 | |---|---|---|---|---|---|---| | CUA-S1 | Computer Use 快速执行模型 | 根据屏幕与上下文生成下一步动作 | 以低延迟为主要目标,官方参考资料未披露统一毫秒数据 | 不是主要强项,适合配合规划器 | 开源路线更有利于本地化 | 高频点击、输入、滚动与状态跟踪 | | 通用视觉语言模型 | 通用图像理解与推理 | 先理解、推理,再输出动作 | 通常更慢,且上下文越长成本越高 | 较强 | 取决于模型和硬件 | 异常处理、复杂页面理解、任务重规划 | | OpenCUA 类研究模型 | 端到端电脑代理研究 | 多图历史、反思式推理与动作预测 | 更强调成功率而非极低延迟 | 较强 | 可研究、可微调 | 基准测试、训练方法与长程任务研究 | | 传统 RPA | 固定规则和流程脚本 | 按坐标、控件或预设条件执行 | 很快 | 几乎没有 | 可以 | 页面稳定、规则明确的重复流程 |

**CUA-S1 并不是要用一个快模型取代所有慢模型。**更现实的组合是 System 2 负责每隔若干步骤检查目标和风险,System 1 负责执行可预测的局部动作;这与自动驾驶系统中规划层和控制层的分工类似。

Try Cua正在补齐的不只是一个模型

**Try Cua 是一个面向 Computer Use Agent 的开源基础设施项目。**其官方 GitHub 仓库 不只关注模型,还覆盖桌面沙箱、计算机控制、Agent 运行与评估等组件,目标是让开发者不必从虚拟机、截图和输入驱动开始重复造轮子。

这项基础设施的重要性不低于模型本身。让 AI 操作电脑并不等于给模型两张截图和一个鼠标工具,开发者还要处理环境创建、系统镜像、应用安装、权限隔离、状态重置、任务回放和失败恢复;缺少这些能力,模型演示很容易退化成无法复现的一次性 Demo。

**沙箱是把代理操作限制在隔离计算环境中的运行机制。**一个拥有鼠标、键盘、浏览器和文件系统权限的 Agent,本质上已经具备相当高的破坏能力,因此生产环境不能让它直接接管员工主机,更不能默认开放密码管理器、企业聊天记录和本地凭据。

Try Cua 此前已经围绕 macOS、Linux、Windows 和 Android 等环境搭建 Computer Use 基础设施,并强调后台驱动、MCP 接入和模型评估。CUA-S1 加入后,这套项目从“为其他模型提供电脑”进一步走向“自己提供执行模型”,产品边界因此明显向上扩展。

**从基础设施进入模型层,会让 Try Cua 获得更完整的性能优化空间。**当沙箱、驱动、动作格式、截图策略和模型由同一套体系协同设计时,系统可以减少图像传输、上下文拼接和动作转换中的额外开销,而不是把多个通用组件临时粘在一起。

开源的价值,是把执行层从黑箱里拆出来

**CUA-S1 的开源意义在于开发者可以审查、替换和针对特定软件优化执行模型。**对于企业内部系统而言,界面往往高度固定,任务也集中在少数 ERP、CRM、财务和工单软件中;此时一个经过垂直数据微调的小型动作模型,可能比通用云端模型更稳定。

本地化也能缓解屏幕数据外传的问题。Computer Use 的截图可能包含客户姓名、订单信息、医疗记录、源代码和财务数据,把每一帧界面都发送到外部服务,风险远高于普通聊天;如果执行模型能在私有环境运行,敏感画面就不必持续离开企业边界。

**开源项目不等于训练过程完全透明。**判断 CUA-S1 的开放程度,仍要分别检查模型权重、推理代码、训练配方、数据来源和许可证;一个能下载的权重,并不自动意味着训练数据可审计,也不意味着企业可以不受限制地商业使用。

这也是现阶段需要保持克制的地方。参考资料尚未给出一组足以横向验证的完整数字,包括参数规模、端到端动作延迟、显存需求、OSWorld 成功率、不同分辨率下的定位精度以及连续任务中的人工接管率,因此暂时不能下结论说它已经超过 Claude、OpenAI 或其他 Computer Use 系统。

CUA-S1真正需要证明的五个指标

**Computer Use 模型不能只用单步点击准确率证明自己。**一个模型即使每一步有 95% 的成功概率,连续执行 30 步且不考虑纠错时,理论上的整条任务成功率也只有约 21.5%,因为 (0.95^{30}≈0.215)。长任务会把看似很小的误差迅速放大。

因此,CUA-S1 后续最需要公开的是以下五类数据:

  1. **端到端任务成功率。**OSWorld、WindowsAgentArena 或同类基准上的完整成功率,比按钮定位准确率更有参考价值。
  2. **单步动作延迟。**应分别报告截图预处理、模型推理和动作执行时间,而不是只给模型首 token 延迟。
  3. **单位任务成本。**Computer Use 是多轮循环系统,单次推理便宜不代表完成一项任务便宜。
  4. **错误恢复能力。**模型点错、页面未加载或弹窗遮挡后,能否识别状态没有按预期变化并主动修正。
  5. **跨环境泛化能力。**同一任务换成不同操作系统、分辨率、主题、语言和浏览器后,性能下降多少。

**人工接管率比演示视频更能反映生产价值。**如果代理每执行五分钟就需要人类解除一次死循环,它更像半自动遥控工具;如果可以在高风险动作前请求确认,并在普通异常中自行恢复,它才有机会成为可靠的数字执行者。

CUA-S1不会立刻取代RPA,但会吃掉RPA最难维护的部分

**传统 RPA 的优势是确定性强、速度快、行为容易审计。**对于页面结构稳定、规则明确且异常很少的流程,固定脚本仍然比视觉模型更便宜,也更容易满足合规要求。

CUA-S1 类模型更适合接管 RPA 脆弱的部分。比如供应商后台更换按钮位置、网页临时增加提示框、表单字段顺序调整,基于固定坐标的脚本可能直接失效,而视觉动作模型可以根据文字和布局重新找到目标。

**最有现实价值的方案很可能是 RPA、System 1 模型和 System 2 模型三者混合。**稳定步骤交给脚本,界面变化交给 CUA-S1,复杂异常交给通用推理模型;系统不必为了“端到端智能”放弃所有确定性工具。

这种组合也会改变企业自动化的成本结构。过去上线一条 RPA 流程,需要业务人员、实施顾问和开发者共同维护大量规则;未来的重点可能变成制作高质量任务轨迹、设置权限边界,以及定义哪些动作必须由人类确认。

现在适合谁尝试

**CUA-S1 当前更适合 Computer Use 开发者和自动化团队,而不是只想找一个桌面助手的普通用户。**它的价值需要在沙箱、规划器、状态记录和评估体系中体现,单独运行一个模型并不会自动得到可用的电脑代理产品。

值得优先测试的场景包括:

  • 在固定企业软件中批量录入或核对数据;
  • 为现有 Agent 增加低延迟 GUI 执行层;
  • 对比不同 Computer Use 模型的动作速度和成功率;
  • 在敏感数据环境中验证本地桌面代理;
  • 将代码代理延伸到安装软件、运行桌面工具和检查图形界面;
  • 研究快模型执行、慢模型监督的双层代理架构。

不适合直接交给它的场景也很明确:转账、删除生产数据、修改权限、发送对外邮件和提交不可撤销的审批。这些动作不能因为模型更快就降低确认标准,反而需要更完整的审计日志、最小权限和操作前确认。

判断:CUA-S1方向正确,但数字比概念更重要

**CUA-S1 抓住了 Computer Use 从演示走向生产时最现实的问题:执行层不能一直依赖又大、又慢、又贵的通用模型。**把快速动作策略独立出来,有机会降低每一步操作的延迟和成本,也让企业可以针对内部软件训练更小、更专门的模型。

这条路线的风险同样明显。System 1 的优势是快,弱点也是快——当模型缺乏充分检查时,错误动作可能更迅速地连续发生;如果没有可靠的状态验证、风险分类和 System 2 兜底,它只会把“偶尔点错”升级成“连续点错”。

**CUA-S1 现阶段更像一次值得关注的架构提案,而不是已经被跑分证明的新王者。**Try Cua 已经拥有跨平台沙箱和 Agent 基础设施,这让它比单独发布权重的项目更有机会把模型做成可运行系统;但在官方补齐延迟、成本、基准成功率和长期稳定性数据之前,对其能力仍应保持工程上的谨慎。

真正重要的变化是,Computer Use 的竞争正在从“谁能让模型点一下按钮”进入“谁能让代理连续操作一小时”的阶段。CUA-S1 给出的答案是:不要让最聪明的模型处理每一次点击,而要让规划与执行各自使用合适的模型。如果这套分工能被公开数据验证,它可能比再堆一个更大的端到端电脑代理更有用。

参考来源

  • Try Cua 官方 GitHub 仓库:CUA-S1 与 Cua 开源 Computer Use 基础设施的主要项目入口,可用于核对代码、文档、许可证及后续更新。
  • 知乎:CUA 开源基础设施介绍:介绍 Cua 在 macOS、Linux、Windows 和 Android 沙箱,以及 Agent、驱动与评估工具方面的整体定位。

相关推荐

查看全部