AI 快讯AI Agent比印度外包更便宜了
开发心得

AI Agent比印度外包更便宜了

2026-08-12T11:04:12.866Z
AI Agent比印度外包更便宜了

计算机操作型 AI Agent 的小时成本已降至 6—8 美元,低于印度离岸 BPO 的约 10 美元。成本与任务完成率同时越过临界点,Agent 开始从演示产品变成可部署的生产力。

AI Agent 同时越过了能力和成本两条线

AI Agent 在 2026 年 8 月第一次显露出替代部分离岸外包岗位的完整经济条件:不仅能操作真实软件完成工作,小时成本也已经低于印度 BPO 人员。

当地时间 8 月 10 日,硅谷风险投资机构 Andreessen Horowitz(a16z)合伙人 Fabrizio Serafini 公布了一组来自生产团队和行业报告的数据。计算机操作型 Agent 的完全运行成本约为每小时 6—8 美元,低于印度离岸 BPO 人员约每小时 10 美元的完全成本;与此同时,领先模型在 OSWorld-Verified 桌面任务中的完成率已经达到 85%,高于人类测试者约 72% 的水平。

**计算机操作型 Agent 是能够读取屏幕、识别界面元素,并通过点击、输入和滚动来完成跨软件任务的 AI 系统。**它和传统 RPA 的关键区别在于,RPA 依赖预先录制的坐标、选择器和固定规则,而 Agent 可以根据截图理解当前状态,在按钮位置变化、页面结构调整或流程出现异常时重新规划动作。

这组数字的意义不在于“AI 全面超过人类”,而在于企业第一次可以认真算一笔替代账。过去,Agent 演示通常只回答“它能不能做”;现在,企业更关心的是“每成功处理一张工单要多少钱”“失败后由谁接管”以及“它能不能连续运行六个月”。

AI Agent与印度BPO人员的小时成本、任务完成率对比图,突出6—8美元、10美元、85%和72%四个数字

85%完成率不等于85%可靠性

OSWorld-Verified 是一套评估 AI Agent 在真实桌面环境中操作应用程序能力的基准,覆盖 Ubuntu、Windows 和 macOS 工作流,并按照成功完成的任务比例计分。该项目的公开实现与任务设计可以在 OSWorld GitHub 仓库 中查看。

2026 年的关键变化是桌面操作能力不再以每年几个百分点的速度爬升。参考报道援引的数据显示,2025 年初最强计算机操作模型在相关任务上的得分约为 42%,到 2026 年 6 月,领先模型 Claude Fable 5 已达到 85%。一年多时间提高了 43 个百分点,相对增幅约为 102%。

| 指标 | 2025年初领先模型 | 2026年6月领先模型 | 人类测试者 | |---|---:|---:|---:| | OSWorld-Verified任务完成率 | 42% | 85% | 约72% | | 变化 | 基准值 | 提高43个百分点 | 比领先模型低13个百分点 | | 可用性判断 | 适合演示和受控试点 | 可以进入明确协议的生产流程 | 仍擅长异常判断与模糊任务 |

85%的基准完成率不能直接换算成生产环境中的85%可靠性。基准测试通常具有明确起点、任务目标和验收条件,而企业系统还会遇到验证码、权限过期、网络抖动、弹窗遮挡、字段含义变化、数据污染以及无法预料的业务例外。

生产系统真正需要计算的是端到端成功率。假设一个流程需要连续完成登录、检索、复制、校验和提交五个步骤,如果每一步的独立成功率都是97%,整条链路一次成功的概率也只有约86%。步骤越长,错误越容易累积;重试虽然可以提高最终完成率,却会同时增加模型调用、截图处理和人工复核成本。

因此,85%更像一张“允许进入生产试验区”的门票,而不是一张“可以撤掉人工团队”的许可证。它证明模型已经有能力处理大部分常规桌面任务,却没有证明模型能够独立承担开放式责任。

真正的突破是Agent开始会“修路”

当前最有价值的能力不是让 Agent 像人一样逐帧点击,而是让它在传统自动化失效时诊断问题并恢复流程。企业软件长期存在一个尴尬现实:大量后台、供应商门户和政府网站没有稳定接口,即使提供接口,也未必覆盖人工可以完成的全部操作。

传统爬虫和 RPA 像一列运行在固定轨道上的火车,速度快、成本低,但页面结构一改就可能脱轨。计算机操作型 Agent 更像携带地图的司机,它通常没有火车快,却能在道路封闭后观察标识、绕开障碍,甚至找出原有自动化失败的原因。

一家消费品数据平台已经把这种能力用于每月约1500万至2000万次门户交互。当零售商调整网站界面、导致手写爬虫失效时,Agent 会读取新页面、诊断故障并维持数据提取,工程师随后再固化新的确定性逻辑。该公司部署后,把专门维护爬虫的工程团队规模缩减了一半,并将人员转移到其他工作流。

这个案例揭示了更现实的部署模式:Agent 不是全程替代代码,而是成为代码的自愈层。稳定、重复、可预测的部分继续交给脚本和工作流引擎,只有页面变化、异常恢复和语义判断等非确定性环节才调用模型。

另一家全球系统集成商已经上线27条计算机操作工作流,每天处理约1500至2100张 IT 工单。其目标不是立即裁掉同等比例的员工,而是把低利润托管服务合同中20%—25%的人力重新部署到更复杂的支持、客户沟通和流程设计岗位。

招聘后台同样是适合 Agent 的典型场景。一家机构在候选人面试结束后,由 Agent 自动整理信息并写入申请人跟踪系统,而且使用的不是最昂贵的前沿模型。这个细节很重要:企业需要的不是在所有任务上最聪明的模型,而是在特定流程中达到验收线的最低成本模型。

每小时6—8美元,拐点是怎么算出来的

完全成本是完成一项业务工作所需的全部直接与间接支出,包括模型推理、重试、运行环境、监控和必要的人工处理,而不只是模型标价。Serafini 给出的计算机操作型 Agent 典型完全成本为每小时6—8美元,折合人民币约40.6—54.1元。

| 执行方式 | 典型完全成本 | 参考区间 | 相对Agent典型成本 | 主要成本来源 | |---|---:|---:|---:|---| | 计算机操作型AI Agent | 6—8美元/小时 | 3—15美元/小时 | 基准 | 模型推理、截图、上下文、重试、运行环境 | | 印度离岸BPO人员 | 约10美元/小时 | 8—15美元/小时 | 高约25%—67% | 工资、福利、管理、培训、办公与人员流动 | | 美国本土后台员工 | 30—45美元/小时 | 视地区和岗位而定 | 约为4—7倍 | 工资、福利、管理与合规成本 |

按照典型值计算,Agent 相比每小时10美元的印度离岸人员便宜20%—40%。这已经足以改变低毛利后台服务的采购决策,但远没有社交媒体流传的“只有印度人力十分之一”那么夸张。

Agent 的3—15美元实际区间也说明成本优势并非自动成立。截图越频繁、上下文越长、工作流越复杂,推理费用就越高;如果模型经常失败并从头重试,单次失败照样消耗计算资源,表面上的低小时价格可能变成更高的成功任务价格。

更合理的指标是“每个成功结果成本”,而不是“每小时推理成本”。如果某 Agent 每小时成本为8美元,每小时尝试10个任务,一次成功率为80%,那么不计人工复核时,每个成功任务的成本约为1美元;如果一次成功率降至40%,同样的运行费用会把单个成功任务成本推高到2美元。

企业还必须把人工接管计入成本。假设1000个任务中有150个需要人工复核,每次复核耗时5分钟,即使 Agent 本身很便宜,额外产生的12.5个人工小时仍可能吃掉大部分节省空间。

这也是为什么按结果计费最终可能比按 Token 或按小时更受企业欢迎。按任务或按结果计费会把失败、重试和模型选择风险留给服务提供方,客户则可以直接把价格与原有 BPO 合同进行比较。

可部署的Agent不是一个模型,而是一套控制系统

生产级 Agent 是由模型、确定性代码、状态管理、验证器、权限控制和人工接管共同组成的执行系统。只把一个视觉模型接到虚拟机上,然后允许它自由点击,通常只能得到昂贵且不可审计的演示。

一套更稳妥的企业架构至少需要六层:

  1. 任务入口层:把邮件、工单、队列或业务事件转换成结构化任务,并明确输入、目标与截止时间。
  2. 确定性执行层:优先使用稳定接口、数据库查询和固定脚本处理可预测步骤,避免让模型重复做机械点击。
  3. Agent操作层:只有在缺少接口、界面变化或需要理解页面语义时,才让模型读取屏幕并执行动作。
  4. 结果验证层:使用订单号、状态字段、金额校验、页面回执或数据库记录判断任务是否真正完成。
  5. 异常与人工接管层:对低置信度、权限异常、高价值交易和连续失败设置暂停机制,由员工从当前状态继续处理。
  6. 审计与评估层:记录截图、动作、模型版本、耗时、成本和失败原因,持续计算成功率及单任务成本。

验证器是这套系统中最容易被忽视、也最重要的组件。Agent 可能点击了“提交”按钮,却遇到页面超时;也可能看到绿色提示,却把数据写入了错误客户的记录。没有独立验证,系统记录的只是动作完成,不是业务完成。

最有效的优化原则是“代码走高速公路,Agent 负责绕路”。一个零售订单流程如果有80%的步骤可以由确定性程序完成,就不应该让前沿模型观察全程;模型只需处理剩余20%的网页异常,整体成本和出错面都会明显下降。

哪些任务现在值得上,哪些仍然不该上

明确协议、重复频繁、结果可验证的任务已经适合规模化试点。这类任务的共同点是执行路径虽然可能变化,但企业能够用机器规则判断结果对错。

当前较合适的场景包括:

  • 更新 CRM 客户记录,并校验字段是否写入成功;
  • 登录政府、保险和供应商门户,下载指定文件或提交表单;
  • 从数据库和监管网页提取结构化数据;
  • 处理零售订单、退货状态和库存信息;
  • 按清单检查合同字段,但不让 Agent 独立作出法律判断;
  • 在 ServiceNow 等系统中分类、补充和流转标准 IT 工单;
  • 在招聘面试结束后整理资料并更新候选人系统。

高风险、开放式且无法即时验收的任务仍然不适合无人值守。涉及大额付款、删除生产数据、终止合同、医疗结论、法律承诺或复杂客户争议时,Agent 可以准备材料和提出建议,但最终动作应由获得授权的人确认。

协议遵循型任务是当前主战场,而价值判断型任务仍然是明显短板。当工作目标是“把这20个字段录入系统”时,Agent 很容易被测试;当目标变成“判断这个客户是否值得破例”时,正确答案可能依赖公司政治、长期关系和隐性风险,模型既难获取完整信息,也很难承担责任。

印度外包不会消失,但低价人海模式会先受压

AI Agent 对印度外包的冲击更可能是业务结构重组,而不是整个产业被一次性替代。BPO 是业务流程外包的简称,通常指企业把客服、数据录入、财务后台、IT支持等标准化流程交给外部服务商执行。

最先受到冲击的是低利润、强流程、按工时出售的后台岗位。因为这类业务的价值主要来自更低的人力成本,而当机器成本降到每小时6—8美元后,离岸团队原有的工资差优势就开始失效。

更复杂的系统集成、行业咨询、客户沟通、异常处理和 Agent 运营反而可能增加需求。企业上线计算机操作型 Agent 后,仍然需要有人梳理流程、设计验收条件、处理权限、搭建审计系统,并持续修复模型无法解决的长尾问题。

印度本身也可能成为这轮自动化的受益者。当地拥有庞大的 IT 服务人才和成熟的流程交付体系,如果外包企业能从“出售人时”转向“交付自动化结果”,它们具备比纯模型公司更强的业务知识、客户关系和实施能力。

真正危险的是继续把人数规模当成收入护城河。未来的托管服务合同可能不再比较谁能派出更多低成本员工,而是比较谁能用更少人工完成更多可审计结果。

这次拐点比跑分更值得关注

2026 年 8 月的变化不是 Agent 突然变得无所不能,而是它终于在一批狭窄但巨大的任务市场里同时满足了“能做”和“更便宜”。85%的桌面基准完成率证明能力开始跨过部署线,6—8美元的小时成本则证明采购部门有理由推动上线。

开发者现在最值得投入的工作也不再是制作一个更炫的点击演示,而是建设评估集、验证器、重试策略、权限边界和人工接管机制。模型能力会继续趋同,真正的产品差异将来自谁掌握了企业内部流程、谁能定义正确结果,以及谁能把失败安全地关进笼子里。

Agent 从演示走向生产的标志,从来不是它完成了一次复杂任务,而是它能以可预测成本连续完成一百万次简单任务。对离岸外包行业来说,这条线已经不再遥远;对开发者来说,竞争也已经从提示词技巧转向系统工程。

参考来源

相关推荐

查看全部