Anthropic把评测席交给埃森哲

Anthropic首次引入驻场评估方,埃森哲将深度参与Claude评测。它能补上企业场景短板,也让评估独立性成为新的争议焦点。
埃森哲不只卖Claude,也要进入Claude的评测现场
Anthropic正在把Claude的一部分评测工作交给更懂企业流程的人。9月18日披露的消息显示,埃森哲将成为Anthropic首个“驻场评估方”,深度参与Claude模型的测试、反馈与企业场景验证。
**驻场评估方是嵌入模型公司评测流程、持续提供真实业务测试与反馈的外部机构。**这里的“驻场”不一定只是派人坐进Anthropic办公室,更重要的是组织与流程上的嵌入:评估方不再等模型发布后写一份报告,而是在模型迭代期间持续设计任务、发现问题,并把结果反馈给产品和研究团队。
这不是一笔普通的咨询合同。埃森哲此前已经与Anthropic建立多年合作关系,双方成立了专门的Accenture Anthropic Business Group,并计划培训约3万名掌握Claude的专业人员,其中包括进入客户环境推进部署的工程师。Claude Code也将向埃森哲数以万计的开发者开放。
现在,埃森哲又从Claude的实施伙伴向评测参与者迈进一步。它既帮助企业采用Claude,也参与判断Claude能不能胜任企业工作,这正是这次合作最有价值、同时也最敏感的地方。

“驻场评测”要解决的,是基准测试看不到的问题
**模型评测是通过标准任务、真实工作流和安全测试衡量模型能力、可靠性与风险的过程。**传统评测通常包括公开基准、内部测试、外部红队和客户试点,但这些方式都存在明显盲区。
公开基准擅长回答“Claude会不会写代码、做数学题、理解长文本”,却很难回答更具体的问题:它能不能遵循一家银行的信贷审查规则?能不能在医院流程中正确处理权限边界?能不能修改一个拥有数百万行代码、文档不完整的旧系统?
企业真正关心的也不是一次回答得了多少分,而是模型连续工作数小时后会不会偏离目标、能不能保留审计记录、遇到信息不足时是否主动停下来,以及错误发生后是否容易被人发现。
这类问题很难用一套公开题库解决。埃森哲的优势在于,它长期参与金融、医疗、制造、政府和大型IT系统改造,手上有大量关于组织流程、遗留系统和合规要求的经验。Anthropic缺少的并不是更多通用测试题,而是这些贴近生产环境的失败案例。
| 评测方式 | 主要参与者 | 最适合发现的问题 | 主要局限 | |---|---|---|---| | 内部评测 | 模型研发与安全团队 | 通用能力、安全边界、版本回归 | 容易受内部假设限制 | | 公开基准 | 学术机构、评测平台 | 数学、代码、知识与推理能力 | 可能被训练数据覆盖,距离业务较远 | | 外部红队 | 安全专家、研究机构 | 越狱、滥用、极端失败模式 | 通常是阶段性项目,难以持续反馈 | | 客户试点 | 企业客户与模型厂商 | 具体部署问题、用户接受度 | 样本分散,方法不统一 | | 驻场评估 | 深度嵌入的外部专业团队 | 行业工作流、长期任务、合规与组织风险 | 独立性和利益冲突需要额外治理 |
驻场评估的核心价值,是把零散的客户反馈变成可重复执行的测试。比如,一家保险公司发现Claude在理赔材料不完整时容易过早给出判断,这不应只作为一张工单结束,而应该被抽象成测试集,在后续模型版本中反复验证。
如果这个机制真正运转起来,埃森哲带给Anthropic的就不只是“客户说模型不好用”,而是清楚指出模型在哪一类任务中失败、失败概率是多少、触发条件是什么,以及新版本是否修复了问题。
Claude Code可能是最先受益的产品
Claude Code很可能是这次驻场评估最直接的落点。Anthropic与埃森哲此前的合作已经把代码智能体放在重要位置,埃森哲也将让数以万计的开发者接触Claude Code。
代码智能体的难点早已不只是补全一段函数。进入大型企业后,它必须理解跨越多年积累的代码库,在权限受限的环境中调用工具,遵守内部开发规范,并与测试、代码审查、部署和安全扫描系统协同。
一个在公开编程基准上表现优秀的模型,可能仍会在企业环境里犯低级错误。例如,它可能生成可以运行但不符合公司架构规范的代码,也可能为了修复局部问题而破坏另一个模块。更麻烦的是,企业遗留代码往往缺少测试和文档,模型给出的修改看起来合理,却没有足够证据证明安全。
埃森哲的驻场团队有机会把这些问题转化为更接近生产环境的评测任务:
- 在大型单体仓库中定位跨模块故障,而不是解答孤立算法题;
- 在缺少文档的情况下判断何时继续、何时向人类确认;
- 按企业既有架构和安全规范修改代码,而不是自由生成方案;
- 验证智能体长时间运行后是否出现目标漂移;
- 测试模型能否生成可供审计的操作记录和变更说明;
- 衡量Claude Code带来的工时节省是否会被后续审查成本抵消。
这类评测对于智能体产品尤其重要。聊天机器人答错一句话,用户通常可以立即发现;代码智能体在几十个文件中完成修改后,错误可能直到上线才暴露。任务越长、工具权限越高,传统单轮问答跑分的参考价值就越低。
3万名从业者,是渠道规模,也是数据入口
约3万名接受Claude培训的埃森哲专业人员,构成了双方合作中最值得关注的数字。这批人不只是潜在用户,也可能成为规模庞大的场景反馈网络。
这些人员包括埃森哲所称的“reinvention deployed engineers”,其角色接近前沿模型公司常说的forward deployed engineers,即直接进入客户环境,将通用模型改造成可运行的业务系统。与普通售前团队不同,他们会接触数据权限、系统集成、流程设计和最终用户行为。
对于Anthropic而言,这意味着Claude可以更早接触真实企业需求。模型实验室通常知道模型在标准题目上的表现,却不一定知道企业为什么最终没有上线:问题可能不是回答质量,而是审批链太长、身份权限无法映射、审计记录不完整,或者模型输出无法接入原有系统。
对于埃森哲而言,提前进入评测流程也能降低交付风险。咨询公司最怕的不是模型在演示中表现不好,而是已经向客户承诺转型效果后,项目才发现模型无法稳定完成核心任务。越早把部署经验反馈给Anthropic,埃森哲越有机会避免在项目末端替模型能力不足买单。
不过,双方尚未公开驻场评估团队的具体人数、合同金额、模型访问级别、评测结果是否对外发布,以及埃森哲能否影响Claude发布决策。这些信息将决定该机制到底是严格的外部评估,还是更紧密的产品顾问安排。
最大争议:评估者也是实施者
埃森哲的双重角色会带来无法回避的利益冲突。它一方面参与推广和部署Claude,另一方面又可能参与评价Claude是否适合部署。
**评估独立性是指评测结论不被销售目标、合作关系或产品发布时间不当影响。**驻场评估天然比一次性的外部审计更了解模型,但嵌入越深,评估方与被评估方的利益也越容易绑定。
风险并不抽象。假设埃森哲正在争取一个大型金融客户,它是否会完整披露Claude在该场景下的失败率?如果评测发现某项关键能力短期内无法达到生产要求,这一结论是否会影响双方的商业目标?Anthropic又是否允许其他独立机构复核结果?
这也是为什么驻场评估不能被等同于第三方认证。埃森哲可以帮助Anthropic发现企业场景中的问题,但只要双方存在联合市场拓展和交付关系,其结论就不应自动被视为独立安全背书。
| 关键问题 | 当前已知情况 | 仍需披露的信息 | |---|---|---| | 团队关系 | 埃森哲成为首个驻场评估方 | 团队向谁汇报,是否设独立治理机制 | | 人员规模 | 双方整体合作将培训约3万人 | 实际参与评测的人数与资质要求 | | 评测对象 | 预计覆盖Claude及企业应用场景 | 是否接触发布前模型、系统提示和安全机制 | | 结果用途 | 用于改进模型和企业落地 | 是否影响模型发布,是否向客户公开 | | 商业利益 | 埃森哲同时是Claude重要实施伙伴 | 如何隔离销售、交付和评测团队 | | 数据治理 | 可利用行业与客户场景经验 | 客户数据能否进入评测集,如何脱敏和授权 |
真正可靠的做法,是把驻场评估与独立红队、内部安全评测和客户验收并行使用。埃森哲提供场景深度,独立机构提供外部监督,Anthropic承担最终的模型治理责任,三者不能相互替代。
另一个隐患,是模型逐渐学会“考试”
**评估污染是指测试题、评分规则或高度相似的数据进入训练流程,导致模型分数提高却没有获得相应的通用能力。**驻场团队与模型研发团队长期协作后,如何防止评测集被过度针对,可能成为实际操作中的难题。
如果埃森哲持续提供银行、医疗或软件工程任务,Anthropic当然可以据此优化Claude。但当模型反复针对同一批企业流程调优时,测试成绩的提升可能只是对已知模式的适应,而不是面对新客户、新法规和新系统时仍能稳定工作。
一套成熟机制至少需要保留隐藏测试集、定期更换任务,并把参与测试设计的人与直接优化模型的人适度隔离。对于高风险行业,还应由不同机构使用独立数据复测,避免单一咨询公司的客户结构决定模型对“企业需求”的理解。
客户数据的边界同样重要。埃森哲接触的许多项目涉及商业机密、个人信息和受监管数据,这些内容不能因为“用于评测”就自动获得新的使用权限。哪些数据只在客户环境运行,哪些可以被抽象成匿名测试,哪些结果能够反馈给Anthropic,都需要明确的合同和技术隔离。
这是一场企业AI评测模式的实验
Anthropic选择埃森哲,说明前沿模型公司的竞争已经从跑分扩展到“谁更理解企业现场”。当Claude开始承担编程、网络安全、数据分析和长时间智能体任务时,实验室里的评测已经无法覆盖全部风险。
与OpenAI、Google等对手相比,Anthropic一直强调安全、可控性和企业可信度。Claude目前也通过Amazon Bedrock、Google Cloud Vertex AI和Microsoft Azure等主要云平台触达企业客户。云渠道解决的是模型如何进入企业,驻场评估解决的则是模型进入之后是否真的可靠。
这套模式如果有效,可能会推动更多模型公司引入咨询机构、行业专家和大型客户共同参与发布前评测。未来的模型卡也可能不再只列数学、代码和安全跑分,而是增加金融审查、软件迁移、医疗行政和安全运营等工作流指标。
但Anthropic需要证明,所谓驻场评估不是联合销售的包装。衡量这次合作是否成功,不应只看Claude通过埃森哲拿下多少客户,而要看双方是否公开更具体的方法、失败数据和治理边界。
对企业用户而言,现阶段最合理的态度是把埃森哲的参与视为Claude企业适配能力增强的信号,而不是安全性已经获得认证的证明。客户仍然需要建立自己的验收集,用真实数据测试准确率、人工接管率、任务完成时间和错误修复成本。
驻场评估值得肯定,因为它把模型研发拉近了真实工作。驻场评估也必须被监督,因为距离商业利益太近的评估,很容易从发现问题变成解释问题。
参考来源说明
- TechCrunch,2026年9月18日报道:披露埃森哲将成为Anthropic首个驻场评估方。原始域名不在本文允许保留的链接白名单内,因此未附外链。
- Anthropic官方合作公告:介绍Accenture Anthropic Business Group、约3万名受训人员及Claude Code企业推广计划。原始域名不在本文允许保留的链接白名单内,因此未附外链。
- 埃森哲官方新闻稿:说明双方多年合作、受监管行业方案及企业AI部署计划。原始域名不在本文允许保留的链接白名单内,因此未附外链。



