NanoMuse开源,Agent跨屏了

开源项目 NanoMuse 试图让一个 AI Agent 在手机与电脑之间连续执行任务。它展示了跨设备智能体的新方向,但距离稳定接管真实工作流,仍有权限、安全和可靠性三道硬门槛。
2026 年 10 月 7 日,开源项目 NanoMuse 进入开发者视野,它把 AI Agent 的操作范围从单一电脑或单一手机,扩展到了手机与电脑两个终端。
NanoMuse 是一个面向手机和电脑的开源 AI Agent 项目,目标是让用户通过自然语言交代任务,再由智能体理解屏幕、规划步骤并执行设备操作。相比只会回答问题的聊天机器人,NanoMuse 更接近一个能够真正点击、输入、切换应用和推进工作流的数字执行者。
这次开源最值得关注的地方,不是又多了一个自动点击工具,而是 Agent 的运行边界正在从“一个应用”跨到“多台设备”。过去一年,手机 Agent、电脑 Agent 和远程控制 Agent 分别发展得很快,但它们大多各自为战;NanoMuse 想解决的是同一个任务如何在手机和电脑之间连续流转。

NanoMuse真正改变了什么
AI Agent 是一种能够理解目标、拆解步骤、调用工具并根据执行结果继续行动的软件系统。传统聊天模型把答案交给用户,Agent 则试图把任务结果直接交给用户,两者的差别类似于“告诉你怎么订票”和“替你完成订票流程”。
跨设备 Agent 是能够在两种或更多终端环境中维持任务上下文,并协调各设备完成同一目标的智能体。这里的关键不只是远程连接,而是任务状态能否延续:手机收到指令后,Agent 是否知道电脑当前打开了什么文件、进行到哪一步,以及下一步应该在哪个设备上执行。
NanoMuse 的价值正在于把“手机入口”和“电脑执行端”放进同一套 Agent 叙事中。一个典型场景是,用户在外面通过手机发出指令,让家中或办公室电脑整理资料、运行任务,再把结果同步回手机;另一个场景是,任务先在手机应用中获取信息,随后切换到电脑完成文档编辑、文件管理或网页操作。
这种跨屏能力比单设备自动化更接近真实工作。用户的一项任务往往不会被限制在一个应用里:会议通知可能来自手机,附件存放在电脑,数据需要通过网页后台查询,最终结果还要回到移动端确认。单设备 Agent 即使每一步都能操作,也会在设备边界前停下来。
NanoMuse 目前更适合被视为一个开源技术预览,而不是已经成熟的个人助理产品。项目展示了跨设备控制的实现方向,但仅凭“能跑通一次”的演示,还不能证明它能稳定处理账号登录、弹窗、网络波动、界面改版和长任务恢复等真实环境问题。
跨设备操作的技术难点不在“点击”
屏幕理解是跨设备 Agent 的第一层能力,它要求模型从截图或界面结构中识别按钮、输入框、列表、弹窗和当前应用状态。手机界面密度较高,电脑界面窗口更多,两者的坐标体系、交互习惯和信息结构并不相同,因此同一个视觉模型未必能在两端保持相同精度。
动作执行是跨设备 Agent 的第二层能力,它把模型生成的计划转换为点击、滑动、键盘输入、窗口切换和文件操作。传统自动化脚本依赖固定坐标或控件标识,而视觉 Agent 更像人一样根据当前画面判断下一步,这提高了适应性,也引入了误点和状态判断错误。
任务状态是跨设备 Agent 的第三层能力,它记录任务已经完成什么、当前在哪台设备上运行,以及失败后应该从哪里恢复。没有可靠状态管理的 Agent,一旦手机锁屏、电脑弹出更新窗口或网络短暂中断,就可能重复发送消息、覆盖文件,甚至从头执行整个任务。
权限边界是跨设备 Agent 最难处理的一层能力,因为手机和电脑承载着不同级别的敏感信息。手机通常包含短信、支付确认和即时通信,电脑则保存文件、浏览器会话和开发环境;当一个 Agent 同时获得两端操作权时,它拥有的权限已经接近用户本人。
因此,跨设备 Agent 不能只依赖模型“自己判断是否安全”。成熟方案至少需要设备级权限隔离、危险动作确认、凭据保护、执行日志、紧急停止和会话过期机制,并且要明确区分读取、编辑、发送、删除和支付等不同风险级别的动作。
它与Mobile-Agent、AutoGLM和ToDesk AI有什么不同
NanoMuse、Mobile-Agent、AutoGLM 与 ToDesk AI 都在尝试让 AI 操作图形界面,但四者的产品重心并不相同。NanoMuse 强调开放代码与手机、电脑协同;Mobile-Agent 更偏向移动端 GUI Agent 研究;AutoGLM 强调消费级手机 Agent 与云端设备;ToDesk AI 则从远程桌面工具切入,让用户通过手机向远端电脑下达任务。
| 项目或产品 | 主要控制对象 | 典型运行方式 | 是否开源 | 当前优势 | 主要限制 | |---|---|---|---|---|---| | NanoMuse | 手机与电脑 | 跨设备 Agent 协同 | 是 | 覆盖两个终端,便于开发者检查和改造 | 公开资料尚不足以证明大规模任务稳定性 | | Mobile-Agent | 以手机 GUI 为主 | 视觉理解加动作规划 | 是 | 研究体系较完整,适合验证移动端 GUI Agent | 重点不在个人电脑与手机的统一工作流 | | AutoGLM | 手机、云手机及云电脑 | 消费级应用与云端执行 | 部分能力以产品形式提供 | 用户门槛较低,任务不必持续占用本机屏幕 | 云端账号、数据边界和长期成本需要评估 | | ToDesk AI | 远端电脑 | 手机发指令、电脑执行 | 核心远控产品并非完整开源项目 | 继承成熟远程桌面链路,适合办公电脑管理 | 更接近 AI 加远控,手机本身不是主要执行环境 |
NanoMuse 与传统远程桌面的根本区别是,远程桌面只传输画面和操作,而 Agent 还要理解目标并自主决定下一步。用户使用普通远控时,依然需要亲自找到文件、打开应用和输入内容;使用 Agent 时,用户只描述结果,系统负责完成中间步骤。
NanoMuse 与纯手机 Agent 的差别则是任务空间更大。手机 Agent 擅长处理外卖、地图、社交和移动电商等应用,但在批量文件处理、代码运行、复杂表格和多窗口操作上,电脑仍然更合适;跨设备方案理论上可以让任务自动选择更适合的终端。
NanoMuse 与云端设备方案的差别主要体现在控制权和部署方式。开源项目允许开发者检查设备通信、模型调用与动作执行逻辑,也更容易部署到自有环境;代价是用户需要自己处理安装、设备连接、权限设置、模型成本和故障排查。
现在谈“接管设备”仍然太早
跨设备 Agent 当前最大的短板是端到端成功率,而不是单步识别能力。一个包含 20 个步骤的任务,即使每一步成功率达到 95%,全部一次通过的理论概率也只有约 35.8%;如果单步成功率是 98%,整体成功率也只有约 66.8%。长任务会把很小的单步误差迅速放大。
公开演示也很容易低估真实界面的复杂度。演示环境通常已经完成登录,网络稳定,页面版本固定,而且不会突然出现验证码、系统升级提醒、权限弹窗或同名文件;真实用户环境中的任何一个变化,都可能让 Agent 的视觉判断失效。
NanoMuse 目前公开信息中更缺少可横向验证的量化指标。判断这类项目是否实用,至少应当公布任务成功率、平均完成时间、每项任务的模型成本、失败恢复率、支持的系统版本以及危险操作拦截率;如果没有这些数字,“同时操控手机与电脑”仍然主要是能力描述,而不是工程质量证明。
延迟同样会直接决定产品体验。Agent 通常需要经历截图、上传、模型推理、动作下发和结果复核五个环节,如果每一步都等待数秒,一个十几步的任务就可能持续数分钟;这类产品不能只展示最终成功,还需要说明用户究竟等了多久,以及中间调用了多少次模型。
开源让安全问题更容易被审查,但不会自动解决安全问题
开源的直接价值是让开发者能够检查 NanoMuse 如何获取截图、发送任务、保存状态和执行设备动作。对于具备高权限的 Agent,可审计性不是附加卖点,而是建立信任的前提,因为用户需要知道哪些数据离开了本机、哪些命令可以被远程触发。
开源并不等于默认安全。实际风险仍取决于部署配置、依赖供应链、远程连接方式、模型服务、日志内容和设备权限;即使核心代码没有恶意逻辑,过宽的系统权限、暴露的控制端口或未经验证的第三方插件,也足以造成严重问题。
提示注入是跨设备 Agent 尤其需要防范的攻击方式。提示注入是攻击者把恶意指令藏在网页、聊天消息、文档或图片中,诱导 Agent 把外部内容误当成系统命令;当 Agent 只能阅读网页时,损失可能是回答错误,而当它能控制两台设备时,损失可能扩大为发送文件、修改配置或泄露会话信息。
开发者在测试 NanoMuse 这类项目时,应当先使用独立测试账号和隔离设备。更稳妥的权限策略包括默认只读、发送前确认、删除前确认、限制可访问目录、隐藏密码输入区域、设置单次任务时限,以及保留完整但经过脱敏的动作日志。
NanoMuse真正值得关注的是“连续性”
NanoMuse 的短期意义是为跨设备 Agent 提供一个可检查、可修改的实验入口。它未必在每一种手机或电脑任务上都优于已有方案,但开发者可以围绕自己的工作流调整感知、规划、设备连接和权限策略,而不必完全依赖封闭产品的功能边界。
NanoMuse 的长期意义是把个人设备重新定义为一组可由 Agent 调度的执行节点。未来用户面对的可能不再是手机助手、电脑助手和浏览器助手三个孤立产品,而是一个持有统一任务状态、能够选择合适设备并随时请求人工确认的个人智能体。
这个方向真正成熟的标志不会是 Agent 能同时点亮两块屏幕,而是它能可靠地完成跨屏任务。它需要知道什么时候使用手机、什么时候转到电脑、什么时候暂停并询问用户,以及发生错误后如何撤销操作;这些能力比单纯扩大控制范围更重要。
NanoMuse 因此是一个值得开发者关注、但暂时不宜过度神化的开源项目。它说明 AI Agent 正从网页和单机沙盒走向真实个人设备,也同时提醒行业:当模型获得更多“手脚”之后,评估标准必须从“看起来能操作”升级为“可验证、可恢复、可约束”。
参考来源
- NanoMuse GitHub 仓库:项目源代码、安装说明与最新开发进展的主要来源。
- Mobile-Agent GitHub 仓库:阿里巴巴团队开源的移动端 GUI Agent 项目,可用于对比手机界面感知与操作路线。



