AI 快讯OpenAI给ChatGPT文本加隐形水印
产品更新

OpenAI给ChatGPT文本加隐形水印

2026-10-05T22:06:52.563Z
OpenAI给ChatGPT文本加隐形水印

OpenAI宣布将在未来几周为欧盟符合条件的ChatGPT和Codex文本输出加入机器可识别的隐形水印,以配合《欧盟人工智能法案》的内容透明要求。全球API客户则可选择为部分模型开启水印。

OpenAI给ChatGPT文本加隐形水印,先从欧盟开始

OpenAI将在未来几周为欧盟地区符合条件的 ChatGPT 和 Codex 文本输出加入机器可识别的隐形水印,这是 OpenAI 为配合《欧盟人工智能法案》内容透明要求推出的最新产品更新。

这项技术名为 textGrain。textGrain 是一种通过调整语言模型选词概率、在生成文本中嵌入统计信号的文本水印系统,读者肉眼无法看到,但专用检测器可以判断一段文本是否带有 OpenAI 模型水印。

OpenAI 于当地时间 2026 年 10 月 5 日公布了这项方案。首批覆盖的是欧盟用户,且不会在发布时将文本水印设为全球 ChatGPT 默认配置。与此同时,全球 API 客户可以从即日起选择为部分模型开启文本水印功能。

OpenAI textGrain 文本水印工作原理示意图,展示模型选词、统计信号和检测器之间的关系

这不是给文字加标记,而是改变模型的选词倾向

textGrain 的核心机制,是利用语言模型生成文本时本来就存在的概率选择空间。

语言模型每生成一个 token,都会从一组候选结果中进行概率采样。很多时候,不同词语表达的意思接近,例如“快速”“迅速”和“很快”都可能适合放在同一个句子里。模型并不总是被迫选择唯一答案,而是会在多个语义和语法都成立的候选项之间做取舍。

textGrain 会在这个过程中引入由密钥控制的统计偏好,让模型在足够长的文本里更频繁地选择某些符合水印规则的 token 组合。单个词看不出异常,但多个句子累积后,文本会呈现出检测器能够识别的统计信号。

这种机制更像是在整篇文章里埋下一组只有检测器能读懂的统计规律,而不是把某个可见标签贴在文章末尾。用户复制、粘贴文本后,水印仍可能保留;但如果对文本进行大规模改写、翻译、压缩,或者只截取很短的一段,检测信号就可能减弱甚至消失。

OpenAI没有公开 textGrain 的完整算法、密钥管理方式和检测阈值。按照目前披露的信息,检测器需要识别文本中是否存在 OpenAI 水印,但检测结果不会透露用户身份、提示词或对话内容。

为什么先在欧盟上线

欧盟的监管要求,是这次更新首先落地欧洲的直接原因。

《欧盟人工智能法案》对生成式人工智能系统提出了内容透明要求,相关义务包括让用户能够识别由人工智能生成或处理的内容。文本此前相较于图片、视频和音频更难做来源标记,因为文本可以被轻易复制、截取、翻译和重新编辑,且不同模型生成的文字在表面上很难区分。

OpenAI选择先在欧盟部署 textGrain,实质上是在监管义务、检测效果和产品体验之间寻找一个可操作的落点。它没有直接把水印推向全球默认,而是先在法规要求更明确的地区验证系统的稳定性,再决定是否扩大范围。

这也意味着,未来几周内,同一个 ChatGPT 功能可能因用户所在地区不同而产生不同输出。欧盟用户生成的部分文本会带有 OpenAI 水印,其他地区用户则暂时不会默认获得同样处理。对于需要跨地区协作的企业来说,这种差异可能会影响内容审计、内部合规和检测流程。

OpenAI声称效果接近或优于同类方案

OpenAI表示,textGrain 在内部评估中“达到或超过”了 Google DeepMind 的 SynthID for text 等其他文本水印方案。

SynthID 是 Google DeepMind 推出的生成内容标记技术,核心思路同样是在模型生成过程中嵌入统计信号。Anthropic 在 2026 年 8 月公布的文本水印方案也被报道采用了相近的技术路线。几家公司都没有把水印设计成用户可见的字符或固定标签,而是试图让内容在不明显损害可读性的情况下具备机器可检测的来源信号。

OpenAI还公布了若干 AI 基准测试结果,用于说明带水印文本与不带水印文本在模型表现上的相近程度。不过,截至 2026 年 10 月 5 日,公开资料没有给出一套足够完整、可由外部研究者复现的统一评分表,因此“水印不影响质量”目前更接近产品方的评估结论,而不是已经被独立验证的行业共识。

| 方案 | 发布方 | 主要覆盖范围 | 水印形式 | 当前公开状态 | 主要限制 | | --- | --- | --- | --- | --- | --- | | textGrain | OpenAI | 欧盟 ChatGPT、Codex;全球 API 可选 | 不可见统计信号 | 2026 年 10 月起逐步推出 | 短文本、翻译、改写等场景可能降低检测效果 | | SynthID for text | Google DeepMind | 由 Google 相关产品和服务逐步采用 | 生成过程中的统计标记 | 已公开技术路线 | 需要检测器,文本编辑可能影响信号 | | Claude 文本水印方案 | Anthropic | 相关 Claude 使用场景 | 基于生成概率的隐形标记 | 2026 年 8 月公布 | 公开细节和跨场景检测能力仍有限 |

从技术路线看,OpenAI的方案并没有改变文本水印的基本难题:检测准确率、文本质量、编辑鲁棒性和误判率之间必须做取舍。水印越强,越容易在文本分布中留下可检测信号;水印越弱,越不影响写作质量,但也越容易被改写抹掉。

它能证明一段文字是AI写的吗

水印检测结果只能提供“文本可能经过某个 OpenAI 系统生成或处理”的信号,不能证明作者身份,也不能证明文本内容真实。

这是理解 textGrain 最重要的边界。即使检测器报告存在 OpenAI 水印,也无法回答以下问题:这段内容由谁输入了提示词、谁修改了文章、用户是否完整采用了模型输出,以及文章中的事实是否正确。水印解决的是来源识别问题,不是事实核查问题,也不是版权归属认证问题。

OpenAI也承认,textGrain 并不能保证所有场景都能成功检测。短文本包含的统计样本太少,检测器很难区分水印信号与自然语言随机波动。数学公式、代码、列表和高度结构化文本的可选词空间更小,模型没有足够的自由度去嵌入稳定信号。翻译和改写则可能重构原始 token 分布,让原有水印显著减弱。

例如,一篇数千字的英文说明文可能更适合进行统计检测;一句由 ChatGPT 生成的产品标题、一道数学证明题或一段经过人工重写的中文摘要,则不能期待同样可靠的结果。对编辑、教师和企业审核人员来说,检测器的结果应当是风险提示,而不是自动定罪依据。

API客户可以选择开启,开发者获得更多控制权

OpenAI将文本水印设计成 API 客户可选择开启的功能,而不是在全球范围内强制默认开启。

从 10 月 5 日开始,全球 API 客户可以为部分模型选择启用水印文本输出。这样做的价值在于,企业可以根据自己的透明度义务、内容审核流程和用户体验决定是否使用,而不是被平台统一改变所有生成结果。

对内容平台、教育软件、企业知识库和自动化写作工具来说,水印可能成为现有审计系统的一部分。例如,平台可以将模型生成内容与人工编辑记录、发布时间和内容版本关联起来;教育机构可以把检测结果作为论文审查中的一个辅助信号;企业则可以在对外发布前标记哪些文本由模型起草、哪些内容经过人工复核。

但 API 可选也带来一个现实问题:如果不同服务商、不同模型和不同地区采用不同的水印策略,跨平台检测会变得复杂。一个检测器通常只能可靠识别它知道算法和密钥体系的水印,不能把所有 AI 生成文本统一判断出来。没有水印并不等于不是 AI 生成,有水印也不等于文本未经人工修改。

OpenAI表示,正在与云服务合作伙伴合作,未来几周将为通过这些服务访问的 OpenAI 模型输出提供水印能力。这意味着企业最终能否使用该功能,还取决于云平台的接入方式、模型范围和控制台配置,而不只取决于 OpenAI 本身。

检测器不会立即向所有人开放

OpenAI计划先向研究人员和专家组织提供检测器访问权限,而不是把检测工具直接开放给公众。

获批的研究机构和专家组织可以从 10 月 5 日起申请访问。按照 OpenAI公布的安排,早期访问会根据行为准则逐案审批,目标是支持文本来源评估、检测效果研究和系统改进。检测器只会报告是否识别到 OpenAI 水印,不会公开用户身份、提示词或对话内容。

这种开放节奏有一定合理性。文本水印检测器如果被广泛公开,攻击者可以反向测试不同改写方式,寻找最快速的去水印方法;但如果开放过于谨慎,外部研究者又无法充分评估误报、漏报以及不同语言之间的公平性。

尤其需要关注非英语文本和非母语写作者受到的影响。已有讨论担心,某些语言中的自然写作风格、词汇选择和句法分布可能让检测器更容易产生偏差。如果检测系统把“不像 OpenAI 水印”的文本误判为人工写作,或者把正常的二次编辑误判为可疑内容,教育、招聘和内容审核场景都可能出现新的争议。

对开发者和重度用户意味着什么

对开发者而言,textGrain首先是一项合规和内容治理能力,而不是一个新的模型能力。

如果产品在欧盟提供 ChatGPT 或 Codex 相关功能,需要重新检查生成文本的告知方式、内容记录、人工复核和用户申诉流程。不能简单地把水印检测结果直接映射为“AI 生成”或“人工生成”两个绝对标签,更不能把检测器当作版权、学术诚信或事实准确性的最终裁判。

对使用 Codex 的软件团队来说,代码、提交信息、技术文档和 issue 回复可能涉及不同的文本结构。自然语言说明更可能保留统计水印,代码本身则可能因为语法约束、变量命名和格式要求而难以稳定嵌入信号。企业若要追踪 AI 辅助开发过程,版本控制记录和开发者声明仍然比单一水印更可靠。

对 ChatGPT 重度用户来说,最直接的变化可能不是界面上出现一个标识,而是某些输出在离开 ChatGPT 后仍可能被检测到。用户把文本翻译、改写或重新组织后,检测结果可能改变;因此,水印不是一种永久附着在文字上的数字指纹。

我的判断是,textGrain 的价值主要在于建立一套可扩展的内容来源信号,让平台和监管机构有工具可用,但它不会终结 AI 文本检测争议。它比可见标签更适合大规模产品部署,也比单纯依赖风格分类器更容易解释;然而,它对短文本、代码、数学内容和二次改写的覆盖有限,决定了它只能作为证据链中的一环。

真正值得观察的不是 OpenAI是否能让所有文本都带上水印,而是三个后续问题:第一,欧盟用户的实际文本质量和延迟是否发生可测量变化;第二,独立研究者能否验证 OpenAI所称的检测性能;第三,Google、Anthropic、Meta等厂商是否会推动跨模型、跨平台的统一内容来源标准。

如果这些问题没有答案,文本水印就更像是满足法规要求的产品机制,而不是一套能让互联网内容恢复“可验证来源”的完整基础设施。OpenAI这次更新的意义,在于它把 AI 内容溯源从图片和音频进一步推向文本;但距离可靠、普适、可审计的文本来源证明,仍有明显距离。

参考来源

相关推荐

查看全部