AI 快讯Anthropic漏筛1.33亿次对话
行业快讯

Anthropic漏筛1.33亿次对话

2026-08-16T13:03:16.656Z
Anthropic漏筛1.33亿次对话

Anthropic 披露,一条面向外部承包商的流量路径近一年未启用生物安全分类器,约 1.33 亿次对话未经筛查。事件尚无实际滥用证据,但暴露出前沿模型安全机制在部署覆盖和持续审计上的明显短板。

Anthropic漏筛1.33亿次对话

Anthropic 的生物安全过滤系统曾在一条外部承包商流量路径上失效近一年,约 1.33 亿次模型对话因此没有经过预定的风险分类器筛查。

据 Anthropic 当地时间 8 月 14 日发布的最新安全报告,以及 IT之家对报告的整理,这段控制缺口持续于 2025 年 5 月至 2026 年 4 月,涉及约 5 万名由外部供应商管理的反馈承包商。Anthropic 表示,内部调查暂未发现相关请求被实际用于滥用的证据,并已提高对外部承包商及供应商的安全要求。

这不是“1.33 亿次生物武器提问”,而是“1.33 亿次本应接受生物安全筛查的对话没有经过筛查”。两种表述的风险含义完全不同:前者意味着海量恶意活动,后者意味着一道关键控制措施长期没有覆盖指定流量。Anthropic 目前披露的是后者。

Anthropic 生物安全分类器失效时间线,标注 2025 年 5 月至 2026 年 4 月、约 5 万名承包商和 1.33 亿次对话

失效的不是模型拒答,而是一层实时分类器

**生物安全分类器是一套独立于主模型的风险识别系统,用来判断输入或输出是否涉及可能促进危险生物活动的信息。**它通常位于用户与模型之间:先检查提示词,再检查模型生成的内容,命中高风险规则后执行拦截、拒答、降级处理或转交其他模型。

这类分类器与 Claude 自身的安全训练不是一回事。模型可以在训练阶段学会拒绝危险请求,但面对提示词混淆、角色扮演、多轮拆解、专业术语替换和越狱攻击时,仅依赖模型“自觉拒答”并不稳妥。实时分类器相当于机场安检,而模型内置拒答更像乘务人员发现异常后的处置;两者都重要,但不能互相替代。

**CBRN 是化学、生物、放射性和核风险的统称,也是前沿模型公司重点防范的高后果风险类别。**Anthropic 的多层防护体系包括输入分类、输出分类、离线监测、红队测试和漏洞赏金等环节。本次事件并不意味着整套 CBRN 防护全部停摆,而是外部承包商产生的一部分流量没有被接入预定的生物安全分类器。

从工程角度看,这更像一条绕过安检的内部通道,而不是安检设备对所有乘客完全失灵。问题依然严重,因为内部评测、数据标注和人工反馈环境往往会集中出现边界测试、危险能力评估以及故意构造的对抗性提示词,其风险密度可能高于普通用户流量。

近一年、5万人、1.33亿次,规模不能轻描淡写

**此次控制缺口的持续时间和覆盖规模都超过了普通配置事故。**按照 Anthropic 披露的数据计算,约 5 万名承包商在近 12 个月内产生 1.33 亿次对话,平均每名承包商对应约 2660 次交互,折合每月约 222 次。

| 指标 | Anthropic 披露情况 | 应如何理解 | |---|---:|---| | 失效时间 | 2025 年 5 月至 2026 年 4 月 | 持续近一年,并非短时故障 | | 涉及人员 | 约 5 万名外部承包商 | 人员由外部供应商负责管理和审核 | | 涉及对话 | 约 1.33 亿次 | 未经过指定分类器,不等于全部具有危险内容 | | 平均交互量 | 约 2660 次/人 | 根据公开总量计算,并非官方单独披露指标 | | 已确认滥用 | 暂未发现 | 不代表能够证明风险从未发生 | | 影响范围 | 外部承包商相关流量 | 目前没有证据表明所有 Claude 公共流量均受影响 |

**1.33 亿次是控制覆盖量,不是已确认危险请求量。**Anthropic 尚未公开其中有多少对话涉及生物或化学内容,也没有给出如果分类器正常运行,预计会拦截多少次请求。因此,外界目前无法计算漏拦截率、危险请求占比或者实际暴露程度。

这一数据口径决定了事件不能被渲染成“Claude 回答了 1.33 亿次生物武器问题”,但也不能被降格为无关紧要的后台故障。安全系统的价值恰恰在于处理未知风险;如果必须先证明已经发生滥用,才能承认过滤链路失效是严重问题,那么安全措施就只剩事故后的取证意义。

承包商通道为什么会成为盲区

**外部承包商是 AI 公司训练和评估流程中的关键基础设施,而不是普通意义上的临时客服。**他们可能承担回答质量排序、安全边界测试、拒答判断、数据标注和人工反馈等任务,产生的数据会用于评估模型,部分结果还可能间接影响后续训练。

外包体系的风险在于,模型公司控制着核心系统,却不一定直接控制每一名工作人员的身份核验、设备环境、访问权限和行为审计。供应商可能继续分包,人员可能跨地区工作,安全培训和背景筛查也容易出现标准不一致。对于一般内容标注,这些问题主要影响数据质量;对于 CBRN 等高风险能力测试,它们会直接变成安全边界的一部分。

**此次事件暴露出的核心问题是安全策略没有做到“默认覆盖所有流量”。**成熟的高风险系统通常采用默认拒绝或默认启用控制措施的设计,即新流量路径只有在明确通过审查后才能豁免。若分类器需要团队逐条把不同客户端、评测平台和承包商环境接入,新增入口就可能在配置变化中成为漏网之鱼。

Anthropic 尚未在公开摘要中完整解释具体技术根因。外界目前无法确认问题来自路由配置、权限分组、供应商平台集成、分类器版本部署,还是监控告警失效。缺少根因细节也意味着,外界暂时无法独立判断修复措施能否防止同类问题再次发生。

ASL-3 的承诺,败在了部署细节

**ASL-3 是 Anthropic 面向具备较高危险能力模型设置的 AI 安全等级,重点限制模型协助获取或开发 CBRN 能力的风险。**Anthropic 在 2025 年 5 月发布 Claude Opus 4 时启用了 ASL-3 防护措施,而本次过滤缺口也从同月开始出现,时间上的重合尤其刺眼。

ASL-3 并不意味着模型绝对无法输出危险信息,而是要求公司在部署、访问控制、监测和响应层面建立更严格的保护。实时提示词分类器和输出分类器正是其中的关键组成部分:前者试图在模型回答前识别意图,后者则检查生成结果是否越过安全边界。

| 防护层 | 主要作用 | 本次事件反映的问题 | |---|---|---| | 模型安全训练 | 让模型主动拒绝危险请求 | 无法保证应对全部越狱与混淆方式 | | 输入分类器 | 在推理前识别高风险提示词 | 部分承包商流量未被覆盖 | | 输出分类器 | 阻断已经生成的危险内容 | 同一流量路径可能失去第二道检查 | | 离线监测 | 事后发现异常模式 | 是否及时识别该缺口仍缺少细节 | | 红队测试 | 主动寻找可绕过方式 | 无法替代生产流量覆盖审计 | | 人员与供应商管理 | 限制高风险环境的访问者 | Anthropic 承认原有筛查流程不足 |

**安全等级写得再严格,也必须落实到每一条数据路径。**前沿模型公司的安全报告经常详细讨论模型能力、红队结果和拒答率,但真正容易出事故的地方往往更朴素:某个环境变量没有启用、某类账户被错误豁免、某个供应商平台没有接入监测,或者告警长期无人处理。

这也是本次事件最值得行业警惕的地方。Anthropic 一直将安全能力视为与 OpenAI、Google 等公司竞争的重要差异点,但“更重视安全”的品牌定位,反过来意味着它需要接受更高标准的工程审查。过滤器偶尔误判可以理解,指定流量近一年完全没有进入过滤流程,则很难仅用模型安全仍在发展来解释。

没发现滥用,不等于证明没有发生

**Anthropic 的调查结论只能说明目前没有找到实际滥用证据,不能证明 1.33 亿次对话中不存在危险输出。**这是安全事件中常见但必须区分的两个概念:证据缺失可能意味着确实没有滥用,也可能意味着日志粒度、保留周期、调查范围或检测能力不足。

要判断事件的真实风险,至少还需要回答四个问题:

  1. 1.33 亿次对话中有多少涉及生物和化学主题?
  2. 如果分类器正常运行,历史回放预计会命中多少输入和输出?
  3. 相关日志是否完整保留,能否覆盖整个 2025 年 5 月至 2026 年 4 月?
  4. 承包商是否能够复制、下载或在受控环境之外传播模型输出?

**历史流量回放是验证修复效果最直接的方法之一。**Anthropic 可以用修复后的分类器重新扫描保留的对话记录,统计理论命中数量,再由具备专业背景的审核团队区分正常科研、教育讨论和真正具有可操作性的危险请求。如果公司只修复在线路由,却不公布历史回放结果,外界仍无法知道这道缺口究竟放过了什么。

Anthropic 同样需要说明它如何发现问题。若缺口来自自动化覆盖审计,说明监测系统虽然迟到但最终发挥了作用;若问题是在其他事故或外部质疑后由人工排查发现,则意味着持续近一年的常规审计没有识别出关键控制缺失。

更严格的过滤也会误伤正常研究

**生物安全分类器的难点不是简单识别敏感词,而是在危险可操作性与正常科研需求之间划线。**同一个病原体名称可能出现在高中教材、药物研发论文、医院诊断记录和恶意实验设计中,仅靠关键词封禁会产生大量误报。

Anthropic 在 2026 年 7 月披露 Claude Fable 5 的安全措施时也承认,过于严格的分类器会影响正常的生物和化学研究请求。按照公司当时的安排,Fable 5 遇到大量相关请求时会将任务交给 Claude Opus 4.8 处理,并计划随着安全机制完善逐步缩小限制范围。

**模型降级或转交是当前较现实的折中方案。**系统不必在“完全回答”和“彻底拒绝”之间二选一,而是可以把敏感请求交给能力边界更可控的模型,限制输出细节,或者只提供高层次解释。这样做会增加延迟和计算成本,也可能降低专业任务完成度,但比让高能力模型在分类器缺席时直接处理所有请求更稳妥。

本次事故却说明,讨论误报率之前首先要确保分类器确实在运行。一个准确率只有 95% 的分类器还有优化空间,而一条没有接入分类器的流量路径,其实际覆盖率就是 0%。前者是模型性能问题,后者是部署治理问题,两者不能混为一谈。

Anthropic 的补救还不够透明

**Anthropic 已提高对外部承包商的安全要求,但单纯加强人员筛查不足以修复系统性缺口。**更严格的背景审查可以降低恶意人员进入的概率,却无法解决正常承包商无意接触危险输出、分类器路由配置错误或监控告警失效等问题。

更有效的整改至少应包括以下措施:

  • 对所有生产、评测、标注和承包商流量建立统一资产清单;
  • 让 CBRN 分类器默认启用,豁免必须经过审批并设置到期时间;
  • 持续比对总推理量与分类器处理量,出现差额立即告警;
  • 定期抽样回放历史对话,验证输入和输出两端的拦截效果;
  • 限制外部人员复制、导出和长期保存高风险模型输出;
  • 公布事故根因、发现方式、历史回放结果和防复发措施。

**最关键的监控指标应当是分类器覆盖率,而不只是分类器命中率。**命中率回答“安检拦下了多少异常”,覆盖率回答“有多少人真正经过安检”。如果企业只盯着误报率、拒答率和用户投诉,却没有核对总流量与受检流量是否一致,就可能在仪表盘一切正常的情况下漏掉整条通道。

这次事件比一次过滤器故障更值得重视

**此次披露表明,前沿 AI 安全的薄弱环节正在从模型本身转向围绕模型运行的组织和基础设施。**模型能力越强,参与评测的人员越多,数据管线和供应商越复杂,任何权限、路由或审计缺口都会被放大。

Anthropic 主动披露事件值得肯定,因为透明报告至少为行业提供了可以讨论和追责的事实基础。但主动披露不能代替对持续近一年失效的解释,尤其是在 ASL-3 已经被用作高能力模型部署依据的情况下。

**对 Anthropic 而言,这次事故削弱的首先是其安全治理信誉,而不是 Claude 的模型跑分。**公司需要证明的不只是分类器已经重新上线,而是它能够持续知道每一类用户、每一个评测环境和每一条推理路径是否都处于保护之下。

**对整个行业而言,1.33 亿次漏筛给出的教训很直接:安全措施存在于政策文件中不算完成,进入每一次真实推理链路才算完成。**前沿模型公司可以不断提高分类器准确率,也可以发布更复杂的安全等级,但如果无法对部署覆盖率进行实时验证,再漂亮的安全框架也可能被一个长期未发现的配置缺口架空。

参考来源

相关推荐

查看全部