AI 快讯Claude误报凶杀案,报警机制失灵
行业快讯

Claude误报凶杀案,报警机制失灵

2026-10-09T22:03:32.245Z
Claude误报凶杀案,报警机制失灵

Anthropic一款模型近日向费城警方提交了一条虚假的凶杀案线索,但公司直到两个月后才发现问题。事件暴露出AI安全系统在“宁可误报”逻辑下,可能把模型幻觉直接转化为执法线索。

Claude误报凶杀案,报警机制失灵

Anthropic的一款AI模型近日向美国费城警方提交了一条虚假的凶杀案线索,而Anthropic直到两个月后才发现这次误报。

这不是普通的聊天机器人胡说八道。模型的错误输出经过安全系统或相关人工流程,被转化成了面向现实执法机构的正式线索。它意味着,生成式AI的幻觉已经不只是在回答框里制造错误事实,而是可能进入警方、学校、医院、雇主等现实机构的工作流,并对当事人产生直接影响。

警方接收AI生成线索的概念示意图,画面包含聊天窗口、风险预警和警察局信息台

发生了什么

据10月9日公开报道,Anthropic旗下AI模型曾向费城警方提交一条有关凶杀案的虚假线索。Anthropic并没有在事件发生后立即发现异常,而是在模型提交虚假信息超过两个月后,才确认这次行为。

目前公开信息没有完整披露这条线索的具体内容、触发路径、警方采取了哪些行动,也没有说明涉事模型的准确型号。因此,不能简单断言这是Claude在用户对话中直接“报警”,也不能确定线索是由模型自动发送,还是经由Anthropic的安全团队、外部合作系统或其他人工流程提交。

但有一点已经足够明确:模型生成的错误判断,曾经跨过产品边界,进入警方的案件处理体系。

这类事件的风险不在于模型偶尔会答错,而在于错误被赋予了行动权限。一个普通聊天回答出错,用户通常还能通过搜索、常识或第二个模型进行验证;一条被发送给警方的凶杀线索,则可能触发实地核查、人员盘问、案件登记,甚至影响无辜者的名誉与人身安全。

“宁可误报”正在制造新问题

AI安全风控系统是用于识别危险内容、升级人工审核并在必要时联系执法机构的系统。它的核心目标通常不是判断一个人是否已经犯罪,而是尽可能提前发现可能导致现实伤害的风险。

这种系统天然倾向于“宁可误报,不要漏报”。在真正的枪击威胁、自杀风险、儿童伤害和恐怖袭击面前,漏掉一次高可信度预警的代价可能极高。因此,平台会对暴力关键词、具体地点、时间、目标人物和行动计划等信号进行组合判断,并把高风险内容交给人工团队。

问题在于,大语言模型并不是事实核查引擎。模型的工作机制是根据上下文预测最可能出现的内容,而不是像侦探一样确认事件是否真实发生。它可能把小说片段、角色扮演、新闻摘要、用户转述、梦境记录和现实陈述混在一起,也可能在信息不完整时自动补足地点、人物和事件经过。

当这种模型负责安全分流时,系统面对的就不再是单纯的“是否包含暴力词”,而是三个不同问题:

  1. 用户是否真的表达了暴力意图?
  2. 模型是否准确理解了用户的原话和上下文?
  3. 即使存在风险,是否已经达到向执法机构披露信息的门槛?

这三个问题不能由同一个分类器一次性解决。第一个问题涉及文本理解,第二个问题涉及事实和语境核验,第三个问题则涉及法律、隐私和公共安全判断。任何一层出错,都可能导致误报;而模型越强、能够处理的上下文越长,系统越容易产生一种“它应该已经理解了全部情况”的错觉。

费城这起事件最值得关注的地方,正是它显示出安全系统可能在没有完成事实确认的情况下,让模型输出被当成了外部世界的可靠信号。模型给出的不是“这里可能存在风险,请进一步核实”,而是被处理成了警方可以接收的线索。

这和佛州报警事件不是一回事

最近另一宗美国案件也把Claude的内容审核机制推到了公众视线中,但两起事件的性质完全不同。

10月5日,美国佛罗里达州李县一名30岁女子因涉嫌在与Claude的对话中写下针对当地警长办公室的枪击威胁而被捕。当地报道显示,相关内容触发Anthropic的安全机制,随后进入人工审核,并被提交给执法部门。警方称,这名女子后来解释说,她把AI当作“日记”使用;案件是否最终构成犯罪,仍需由法院裁定。

这起佛州案件至少存在一个明确的风险对象和暴力表述,平台可以据此启动人工审查。费城事件则相反,已知信息显示,AI向警方提交的是一条虚假的凶杀线索。前者讨论的是平台是否应当对潜在威胁采取行动,后者讨论的是平台如何把错误信息送进执法流程。

| 对比项目 | 佛州案件 | 费城事件 | |---|---|---| | 已知触发内容 | 用户涉嫌写下针对警长办公室的枪击威胁 | AI模型提交虚假的凶杀案线索 | | 信息真实性 | 威胁是否构成犯罪仍由法院判断 | 公开报道已确认线索为虚假信息 | | 处置路径 | 触发安全机制、人工审核并联系警方 | 线索进入费城警方体系,具体路径尚未完全披露 | | 主要争议 | AI对话的隐私边界与紧急披露 | 模型幻觉、事实核验和执法误报 | | Anthropic发现时间 | 事件发生后较快进入处置流程 | 提交虚假线索超过两个月后才发现 |

把两起事件放在一起看,Anthropic的安全机制面临的是一组相互拉扯的目标:既不能在明确的现实威胁面前保持沉默,也不能把模型猜测当成事实提交给警方。

两个月后才发现,说明监控链条存在盲区

Anthropic在超过两个月后才发现这条虚假线索,首先暴露的是可追溯性问题。

一个涉及执法机构的高风险动作,理论上应当具备完整的审计记录:哪一个模型生成了内容,原始上下文是什么,哪个安全规则被触发,哪个系统或人员批准了升级,发送给警方的原文是什么,警方是否回传了结果,以及事后如何确认线索真假。如果这些记录存在并且被持续监控,错误通常不应当等到两个月后才暴露。

这并不意味着每次报警都能即时判断对错。警方可能需要时间核实线索,模型公司也不一定能直接获得案件结果。但“发现事件发生”和“判断线索是否真实”是两件事。平台至少应该能在动作发生时确认:系统向外部执法机构发送了什么、基于什么理由发送、风险等级是多少、是否经过人工复核。

从工程角度看,这类系统不能只记录最终的报警结果,还必须保留决策链。日志至少应包含以下信息:

  • 模型版本、系统提示词和安全策略版本;
  • 触发风控的原始文本及完整上下文;
  • 模型生成的判断、置信度和不确定性说明;
  • 人工审核人员是否介入,以及审核意见;
  • 信息披露的法律依据、紧急程度和接收机构;
  • 后续核查结果、误报标签和纠正措施。

如果平台无法回答这些问题,它就很难判断错误来自模型本身、分类器、人工审核,还是外部自动化流程。更严重的是,团队可能在没有找到根因的情况下,只修补触发词或下调某个阈值,下一次错误仍会沿着同一条链路发生。

AI能不能拥有“报警权”

生成式AI是否应当拥有直接联系警方的能力,答案不应由模型能力单独决定,而应由风险分级和责任边界决定。

对于明显、具体、迫在眉睫的现实威胁,平台在法律允许范围内向执法部门披露信息,存在公共安全上的合理性。但“模型认为有风险”和“平台确认存在迫在眉睫的危险”之间,必须保留人工判断环节。尤其当信息来自日记、创作、新闻转述或虚构对话时,平台需要先完成语境核实,而不是把关键词直接映射成报警动作。

更合理的系统应该采用分层处置:低风险内容只进行模型内提醒,中风险内容进入人工审核,高风险内容才考虑紧急披露;即使是最高等级,也应该把模型判断、原始文本和不确定性一并提交给审核人员,而不是只输出一个“可能发生凶杀案”的结论。

同时,系统应当区分“向用户提示求助渠道”和“向警方提供用户信息”。这两个动作的后果完全不同。前者是产品交互,后者涉及隐私、程序正义和潜在执法后果,不能共用一套阈值。

对AI产品开发者的三个提醒

第一,安全分类器不能替代事实核查。

模型可以帮助发现风险线索,但不能独立证明事件真实发生。涉及刑事案件、医疗诊断、儿童安全和金融欺诈的场景,都需要外部证据或人工核验。即使模型给出了很高的置信度,也不等于现实世界中的事实概率同样高。

第二,外部行动必须拥有可撤销和可追责机制。

模型可以生成草稿、标记风险、整理证据,但一旦动作会影响第三方,就必须明确谁拥有最终批准权。对于发送给警方、学校或雇主的信息,系统还应提供纠正、补充说明和通知机制,避免错误内容在机构内部长期留存。

第三,安全效果不能只看“拦截了多少危险内容”。

如果平台只用拦截量衡量安全能力,系统就会被激励去扩大误报范围。更完整的指标应包括真实威胁识别率、误报率、平均人工审核时间、错误披露次数、事后纠正时间,以及不同群体受到不成比例影响的情况。

Anthropic近年来一直强调模型安全、使用政策和滥用监测,但费城事件说明,安全系统不是越敏感越好。真正成熟的安全机制,必须同时控制漏报和误报,并能够证明每一次高影响动作为什么发生。

对普通用户意味着什么

用户把Claude等聊天机器人当作日记本、咨询助手或私人记录工具,并不意味着对话一定享有类似律师与委托人之间的保密特权。平台通常会依据服务条款、使用政策和适用法律,对部分内容进行自动检测或人工审核;在涉及紧急人身伤害的情况下,平台也可能根据相应程序向政府机构披露信息。

这并不意味着用户不能讨论暴力、创伤或黑暗主题,而是意味着用户需要理解:聊天机器人不是绝对私密的本地笔记软件。小说创作、角色扮演和真实威胁在模型眼中可能共享大量语言特征,用户如果确实是在创作或转述,最好提供清晰的上下文;平台则有责任避免仅凭几个关键词就作出高影响判断。

费城这起事件的核心教训,最终不是“AI会犯错”这么简单。模型犯错早已是已知事实,真正的新问题是:当模型犯错时,谁把它的错误变成了现实行动?谁负责核验?谁通知被误报的人?谁承担后果?

在这些问题没有明确答案之前,让AI直接参与刑事线索提交,仍然是一个风险远高于收益的产品决策。安全系统可以帮助人类发现异常,但不能因为它使用了更先进的模型,就自动获得把猜测交给警方的权力。

相关推荐

查看全部