AI 快讯Claude攻破OpenAI员工账户
行业快讯

Claude攻破OpenAI员工账户

2026-09-18T07:08:06.099Z
Claude攻破OpenAI员工账户

安全研究团队借助 Claude 入侵一名 OpenAI 员工的 ChatGPT 账户,并接触私有代码库文档,最终获得 6500 美元赏金。事件真正暴露的,是 AI 正在压缩漏洞利用从发现到落地的时间。

Claude 帮白帽黑客拿下了 OpenAI 员工账户

安全研究团队 Hacktron AI 借助 Anthropic Claude,成功入侵一名 OpenAI 员工的 ChatGPT 账户,并获得访问该公司私有软件代码库文档的能力。OpenAI 已确认此次攻击涉及两个安全问题,相关漏洞、登录令牌与受影响会话均已处理,研究团队则通过漏洞赏金计划获得了 6500 美元奖励,约合人民币 4.37 万元。

这不是一次单纯的模型越狱,也不是让 Claude 输出一段恶意代码那么简单。**漏洞赏金计划是企业授权安全研究人员在明确范围内测试系统,并按照漏洞影响支付奖励的安全机制。**Hacktron AI 此前已经参与 OpenAI 的漏洞赏金计划,因此整个过程属于获得安全港保护的白帽研究,团队发现问题后也迅速向 OpenAI 提交了报告。

但事件仍然值得警惕,因为研究人员最终突破的不是一个用于演示的靶场,而是真实运行中的 OpenAI 账号和内部资源访问链路。

Claude、Discourse 社区论坛与 OpenAI 员工 ChatGPT 账户之间的攻击路径示意图,展示图片上传漏洞、登录令牌和内部文档访问三个环节

攻击从一张特殊图片开始

此次入侵的起点,是 OpenAI 社区论坛所使用的第三方服务 Discourse。Discourse 是一套广泛用于开发者社区和企业论坛的开源讨论平台,负责处理用户账号、帖子、附件与图片上传等功能。

7 月 23 日,Hacktron AI 研究人员发现,Discourse 在处理特定图像文件时存在异常。相关漏洞编号为 CVE-2026-45788,其核心问题位于 Discourse 的安全上传机制:攻击者在满足特定条件时,可以绕过原本针对受保护上传文件设置的访问限制。

研究人员随后使用面向合格网络安全从业者开放的 Claude Opus 4.8 特殊版本,要求模型协助编写漏洞利用代码。第一次尝试没有成功,但 Anthropic 当晚发布 Claude Opus 5 后,研究人员在次日再次测试,新模型找到了可行的利用方式。

这个时间线比最终拿到 6500 美元更重要。一个原本需要安全研究员手工阅读代码、构造文件、调整请求并反复调试的过程,被压缩到了大约一天之内,而且关键进展恰好发生在模型升级之后。

| 时间 | 事件 | 安全意义 | |---|---|---| | 7 月 23 日 | Hacktron AI 发现 Discourse 图片处理异常 | 找到外部服务的初始攻击面 | | 7 月 23 日 | Claude Opus 4.8 首次生成利用方案失败 | 模型已有分析能力,但尚未完成可用利用链 | | 7 月 23 日晚 | Anthropic 发布 Claude Opus 5 | 模型能力升级改变漏洞利用结果 | | 7 月 24 日 | Claude 找到可行利用方法 | 从漏洞线索推进到可执行攻击 | | 9 月 16 日 | OpenAI 披露此前未报告的安全事件并更新报告政策 | 公司开始调整安全事件透明度与响应机制 | | 9 月 18 日 | 事件经媒体报道进入公众视野 | AI 辅助真实攻击的风险被进一步放大 |

真正危险的是两处问题被串成了一条链

单个文件上传漏洞通常不等于员工账户失守,而此次事件的严重性来自两个问题被连接在一起。OpenAI 确认,其中一处问题位于托管社区论坛的 Discourse,另一处则涉及 OpenAI 自身系统。

**攻击链是攻击者将多个看似独立的弱点依次组合,最终获得高于单个漏洞影响的攻击路径。**在这次事件中,第三方论坛是入口,OpenAI 自身的身份与权限边界则决定了入口能够向内部延伸多远。

OpenAI 没有公开完整利用细节,这符合漏洞修复后的常规披露节奏,但其处置说明已经暴露了关键问题。公司表示,已经缩小社区登录 token 的权限范围,并撤销受影响的 token 和会话。

**登录 token 是服务器签发给已认证用户的数字凭证,用来证明当前请求已经完成身份验证。**如果一个社区系统签发或接触到的 token 可以被用于访问权限更高的 ChatGPT 账户或内部资源,那么第三方服务中的普通漏洞就可能升级为身份劫持。

OpenAI 的修复动作说明,此前部分社区登录 token 的权限范围过大。攻击者不一定需要知道员工密码,也未必需要绕过多因素认证,只要能够获取可复用的有效会话,就可能以员工身份访问后续系统。

这正是现代云服务最难防的一类问题:密码没有泄露,认证系统本身也可能正常工作,但已经登录的会话被夺走了。

研究人员接触到的是文档,不等于拿走了全部源代码

此次攻击使研究人员得以获取 OpenAI 私有软件代码库的相关文档,但现有公开信息不能证明其下载了完整模型源代码、训练数据或模型权重。将事件描述为“Claude 窃取 OpenAI 全部代码”并不准确,也会掩盖真正需要讨论的权限设计问题。

私有代码库文档依然可能包含高价值信息。架构说明、部署流程、内部服务名称、依赖关系、测试环境地址和权限配置,都可能帮助攻击者绘制企业内部系统地图,为后续横向移动提供线索。

**横向移动是攻击者进入一个账户或系统后,继续利用已有身份访问其他内部资源的过程。**对于拥有大量模型基础设施、内部评测系统和专有研究项目的 AI 公司而言,一份权限过高的员工会话,价值可能远高于某个孤立服务器的控制权。

值得注意的是,OpenAI 披露的是“接触私有代码库文档”,而非模型权重泄露。两者风险等级不同,但前者已经足以证明身份边界出现了不应存在的穿透路径。

Claude 没有独立完成攻击,但大幅降低了门槛

Hacktron AI 首席技术官 Mohan Pedhapati 对事件的概括很直接:“我们只是三个拥有 Claude 和 Codex 订阅的人。”这句话的重点不是安全研究已经不需要专业知识,而是小团队获得了过去只有大型攻防团队才具备的代码分析与漏洞开发杠杆。

此次攻击仍然由人类研究人员主导。研究人员负责发现异常、选择目标、设计验证路径、判断模型输出是否有效,并在授权范围内完成报告;Claude 扮演的是漏洞分析和利用开发加速器,而不是完全自主行动的黑客代理。

不过,“不是自主攻击”并不意味着风险有限。AI 在网络安全场景中的现实价值,恰恰不是一键攻破所有系统,而是同时处理大量低概率线索,快速改写利用代码,并根据报错持续迭代。

| 能力环节 | 传统人工方式 | AI 辅助方式 | 本次事件体现 | |---|---|---|---| | 漏洞理解 | 阅读源码、公告与请求日志 | 快速解释代码路径和边界条件 | Claude 协助分析上传机制 | | 利用代码编写 | 手工编写并持续调试 | 根据错误信息反复生成和修正 | Opus 4.8 首次失败,Opus 5 次日成功 | | 攻击链推演 | 依赖研究员个人经验 | 同时枚举多种身份与权限路径 | 第三方论坛问题延伸至 OpenAI 账户 | | 所需团队规模 | 往往需要多名专项专家 | 少量专家配合模型即可推进 | 团队仅有三名主要参与者 | | 防守窗口 | 漏洞公开后仍有一定缓冲期 | 利用生成速度明显加快 | 发现到形成可行利用约一天 |

此次事件最值得安全团队重视的变化,是模型升级可以直接改变漏洞是否可利用。Opus 4.8 没能完成的任务,Opus 5 很快找到了路径,这意味着静态判断“当前模型还做不到”几乎没有长期参考价值。

6500 美元不算高,事件价值却远超赏金

OpenAI 最终支付了 6500 美元漏洞赏金,这一数字更像是对合规报告的奖励,而不是漏洞潜在黑市价值的定价。OpenAI 早期公开的漏洞赏金计划曾给出普通问题最低 200 美元、特殊严重漏洞最高 2 万美元的奖励区间,但具体金额还会受到漏洞可复现性、影响范围和攻击前置条件影响。

6500 美元没有达到历史最高档,可能意味着攻击链依赖特定条件,也可能与研究范围、实际数据暴露程度及两个问题的责任边界有关。由于入口位于第三方 Discourse 服务,而后续影响涉及 OpenAI 自身权限控制,漏洞等级并不能只按照“员工账户被入侵”这一结果判断。

但从企业风险看,6500 美元是相当便宜的发现成本。如果相同路径首先落入国家级攻击团队或商业间谍手中,对方不会提交漏洞报告,也不会在访问文档后主动停止。

Pedhapati 的判断并不夸张:国家支持的高级网络团队确实可能使用同类模型窥探美国 AI 公司的技术机密。顶级模型公司拥有高价值算法、推理优化方案、算力调度系统与未发布产品路线,是天然的情报目标。

第三方服务已经成为 AI 公司的薄弱边界

此次事件再次证明,AI 公司最先进的模型能力,并不会自动转化为最稳固的企业安全。模型实验室可以拥有全球顶尖的研究员和安全团队,却仍然需要依赖论坛、客服、身份认证、协作平台与代码托管等外部软件。

供应链安全的难点并不是第三方软件一定比自研系统差,而是不同系统之间经常存在被低估的信任关系。社区论坛本应只处理公开讨论,但如果其登录凭证能够触达员工 ChatGPT 会话或内部资料,论坛就不再只是论坛,而是企业身份基础设施的一部分。

OpenAI 此次采取了两项关键措施:缩小社区登录 token 的权限范围,以及撤销受影响的 token 和会话。前者是在降低未来攻击的爆炸半径,后者是在清除已经可能泄露的凭证。

**最小权限原则是每个账户、令牌和服务只能获得完成当前任务所必需的最低权限。**按照这一原则,社区论坛 token 应当只能访问论坛相关资源,不应天然继承员工身份,更不应成为内部代码库文档的通行证。

对其他 AI 公司而言,更实际的检查清单包括:

  • 重新审计论坛、客服和工单系统使用的单点登录权限;
  • 禁止外部社区会话直接复用为内部员工会话;
  • 为代码库、模型评测平台和生产控制台设置独立的二次认证;
  • 缩短高权限 token 的有效期,并绑定设备、网络与使用场景;
  • 对文档批量访问、陌生设备登录和会话跨区域复用设置告警;
  • 使用 AI 模型主动测试自家系统,而不是只防范攻击者使用 AI。

OpenAI 正把更多工程资源调往安全

事件披露发生在 OpenAI 安全压力快速上升的背景下。9 月 16 日,OpenAI 披露了此前未报告的安全事件,并宣布新的安全事件报告政策;OpenAI 总裁格雷格·布罗克曼随后表示,公司已从原有项目中抽调约 25% 的生产工程师,用于安全防护和架构加固。

25% 是一个很重的资源投入比例。生产工程师通常负责服务稳定性、部署系统、基础设施和线上故障处理,将四分之一人员转向安全,意味着公司判断现有风险已经无法只靠独立安全团队解决。

9 月 13 日,OpenAI CEO 萨姆·奥尔特曼及多名行业人士还呼吁暂缓 AI 开发,理由是技术推进速度过快,可能对全人类带来危害。与宏大的模型安全讨论相比,这次账户入侵展示了更迫近的问题:在超级智能真正到来之前,现有模型已经可以加速攻击现实系统。

AI 安全因此需要被拆成两个层面。一个层面是模型是否会失控、欺骗或造成系统性风险;另一个层面是攻击者是否会使用模型,更快攻破账号、云服务和企业基础设施。前者决定长期上限,后者已经进入日常安全运营。

这次事件的分水岭,是漏洞利用开始跟着模型版本迭代

这次入侵并没有证明 Claude 可以自主攻破任何公司,但它证明了前沿模型已经能够成为真实漏洞利用链中的有效生产工具。尤其值得注意的是,模型版本更新不只影响写作、编程和推理跑分,也可能在一夜之间提升攻击代码的可用性。

对于防守方而言,过去按季度进行一次渗透测试的节奏正在失效。攻击能力可能随着模型更新按周甚至按天变化,而一个昨天无法利用的边界条件,明天就可能被新模型补全。

对于模型公司而言,简单封锁“黑客”关键词也不是答案。安全研究员和恶意攻击者会使用相同的代码分析能力,区别主要来自授权、目标和行为边界。Anthropic 向合格安全从业者提供特殊模型版本,体现了其试图在能力开放与风险控制之间做分层,但此次结果也说明,任何高能力安全模型都需要更严格的身份审核、日志留存和目标授权机制。

这起事件最终以 6500 美元赏金和漏洞修复收场,已经是最理想的结局。下一次使用 Claude、Codex 或其他模型找到同类路径的人,未必会选择联系厂商。

参考来源

相关推荐

查看全部