AI 快讯DeepMind给AI蛋白质加水印
产品更新

DeepMind给AI蛋白质加水印

2026-10-01T00:04:51.471Z
DeepMind给AI蛋白质加水印

Google DeepMind推出SynthID Bio,为AI生成的蛋白质序列和三维结构嵌入可验证信号。初步实验显示,水印没有明显损害蛋白质功能,但距离真正用于生物安全筛查仍有距离。

DeepMind给AI蛋白质加水印:蛋白质也要有“生成标记”

Google DeepMind在9月30日推出SynthID Bio,一套用于识别AI设计蛋白质的水印方法。它可以把可检测信号嵌入蛋白质序列或预测的三维结构中,并在合成出实体蛋白质后继续验证其来源。

SynthID Bio是Google面向生物设计数据提出的水印技术,目标是在不明显改变蛋白质功能的前提下,判断一个蛋白质设计是否由AI模型生成。DeepMind目前将其定位为概念验证,而不是已经完成部署的生物安全基础设施。

这件事的意义在于,AI生成内容的“来源证明”正在从文本、图片和视频延伸到生物分子。过去,一段蛋白质序列进入数据库后,研究人员通常只能根据序列相似度、实验记录或提交者说明判断它从哪里来;如果设计过程没有留下完整日志,后续很难证明它是否由某个模型生成。SynthID Bio试图把来源信息直接写进生物设计本身。

SynthID Bio将水印嵌入蛋白质序列与三维结构,并通过检测器识别AI生成来源的示意图

蛋白质水印不是在序列末尾加一串标签

蛋白质水印是嵌入氨基酸序列或分子结构中的统计信号,它需要能被检测器识别,同时尽量不改变蛋白质的折叠、结合和生物活性。

对于数字图片,水印可以藏在像素的细微变化里;对于蛋白质,问题要难得多。蛋白质由氨基酸组成,序列中的一个替换有时不会产生明显影响,有时却可能让整个分子无法正确折叠。一个看似轻微的结构坐标调整,也可能改变结合界面,降低蛋白质与目标分子的亲和力。

DeepMind采用了两条路线。

第一条路线针对蛋白质序列。团队使用启用SynthID Bio的ProteinMPNN版本,在生成蛋白质序列时对氨基酸选择进行细微引导。ProteinMPNN是一种根据蛋白质骨架反推氨基酸序列的模型,常用于蛋白质设计和结构优化。水印不是以一段可读字符串的形式出现,而是体现在大量序列选择形成的统计模式中。

第二条路线针对蛋白质三维结构。团队对AlphaFold 3扩散网络的一小部分进行微调,将水印功能嵌入模型权重,使模型输出的原子坐标携带可检测信号。这里的重点是,水印不依赖某个应用层插件。如果用户直接运行经过调整的模型,生成的结构坐标仍可能带有这一签名。

这两种方式对应了生物设计流程中的两个关键对象:一个是“蛋白质由哪些氨基酸组成”,另一个是“这些原子在空间中如何排列”。对于只保存序列的数据库,序列水印更容易使用;对于依赖结构预测的设计流程,结构水印则提供了另一层来源证据。

三类蛋白质目标完成湿实验验证

DeepMind在三种蛋白质结合剂上测试了SynthID Bio,这些结合剂由AlphaProteo设计,并通过启用SynthID Bio的ProteinMPNN生成序列。

蛋白质结合剂是能够选择性识别并结合另一种目标蛋白质的分子,可以理解为“分子层面的定制连接器”。它们被用于药物研发、诊断和基础研究,也是AI蛋白质设计较容易展示成果的场景,因为设计结果可以通过体外实验直接测量。

团队选择的三个目标分别是VEGF-A、SARS-CoV-2病毒刺突蛋白受体结合域(RBD)和PD-L1。实验比较了带水印设计与未带水印设计在命中率、结合亲和力和序列多样性方面的表现。

DeepMind称,带水印版本与未带水印版本的表现相匹配,且在湿实验中观察到的蛋白质结合剂保持了生物功能。换句话说,加入水印没有让模型生成一批“能被检测、却不能用”的蛋白质。

结合亲和力通常以解离常数KD衡量,KD数值越低,代表结合越强。DeepMind在公告中强调了两组设计之间的整体匹配,但目前公开材料没有给出一组足够完整的逐个目标KD数据,也没有披露命中率和序列多样性的全部原始数值。因此,“不影响性能”更准确的表述是:在这组三目标、有限规模的验证中,没有观察到明显的功能代价,而不是所有蛋白质设计任务都能无损嵌入水印。

| 对比维度 | 带SynthID Bio水印的设计 | 未带水印设计 | 当前公开结论 | |---|---|---|---| | 目标蛋白 | VEGF-A、SARS-CoV-2 RBD、PD-L1 | 相同目标 | 采用同一组目标进行比较 | | 结合剂来源 | AlphaProteo设计,ProteinMPNN生成 | AlphaProteo设计流程 | 设计流程可直接加入水印步骤 | | 命中率 | 与对照组匹配 | 作为基准 | 未披露完整原始数据 | | 结合亲和力 | 与对照组匹配 | 作为基准 | 未披露全部KD明细 | | 序列多样性 | 与自然序列和对照设计相匹配 | 作为基准 | 未观察到明显下降 | | 生物功能 | 在湿实验中保持功能 | 作为对照 | DeepMind称结果相匹配 |

这个结果很关键,因为生物水印最现实的失败方式并不是检测器失灵,而是水印首先破坏了设计质量。如果加入水印会显著降低结合能力,研究人员和企业很快就会绕开它。SynthID Bio至少证明了一条可行路径:在特定蛋白质设计任务中,水印可以藏在模型的生成偏好里,而不是粗暴地修改最终序列。

AlphaFold 3的水印更接近“模型级签名”

AlphaFold 3结构水印是SynthID Bio中更有野心的部分,因为它试图把检测能力放进模型本身。

AlphaFold 3是一种用于预测生物分子复合物结构的模型,输出包括蛋白质等分子的三维原子坐标。DeepMind对其扩散网络的一小部分进行微调,让输出坐标带有可检测信号,同时保持预测准确性和关键结构特征分布。

根据DeepMind披露的结果,经过微调的模型保持了AlphaFold 3的预测准确性,水印检测表现接近完全可检测,并且能够抵抗数字噪声和轻微的坐标变化。所谓数字噪声,可以理解为文件转换、数值精度变化或坐标的轻微扰动;如果模型输出只要被重新保存一次就无法检测,水印就很难用于真实数据流转。

不过,这里仍然需要区分“检测输出带有水印”和“证明某个蛋白质一定由AI生成”。前者是技术检测问题,后者是证据链问题。一个带有SynthID Bio信号的结构,可能说明它来自经过水印处理的模型;但没有水印,不能自动证明它由人类设计,也不能排除它经过了后处理、重建或部分修改。

水印更像是在文件上盖了一个难以察觉的印章,而不是为蛋白质建立不可伪造的身份证。只要设计者拥有足够强的优化工具,就可能对带水印序列进行重采样、突变、重设计或结构重建,从而削弱检测信号。DeepMind也把抵御有意篡改列为后续挑战。

Evo 2和噬菌体实验:从蛋白质走向基因组

SynthID Bio的应用范围并没有停留在单个蛋白质上。DeepMind表示,团队已经将相关方法集成到基因组模型Evo 2中,并与斯坦福大学Hie实验室及Arc Institute合作,为Evo 2设计的噬菌体基因组加入水印。

噬菌体是能够感染细菌的病毒。与单个蛋白质相比,噬菌体基因组包含更多遗传信息,水印可以嵌入的空间更大,但同时也要面对基因之间的相互作用、复制效率和宿主适应性等问题。

DeepMind称,早期细菌培养实验显示,带水印的噬菌体仍然具有功能。这个结果目前只代表早期实验室验证,尚不足以说明水印能在各种病毒、宿主和环境条件下稳定工作。团队计划在后续技术手稿中披露更多细节,包括嵌入方式、检测性能和实验范围。

如果这条路线成熟,它可能覆盖从蛋白质序列、蛋白质结构到更大规模基因组设计的多个层级。AI生物设计的来源追踪也因此有机会从“模型日志”扩展到“分子本体”。

它能为生物安全解决什么问题

SynthID Bio的直接价值,是给生物安全筛查增加一个来源信号。

今天,合成生物学服务商通常会对客户提交的DNA序列进行筛查,判断其中是否包含已知的高风险片段。这个过程主要依赖序列比对、风险数据库和客户背景信息。如果一个AI系统生成了一个全新的蛋白质或经过改写的序列,传统数据库可能没有完全对应的条目。

水印无法判断一个设计是否危险,但可以补充回答另一个问题:这个设计是否来自某个AI模型。对于合成供应商来说,如果检测到某类模型水印,就可以要求更多来源信息,或者把样本送入更严格的审查流程。对于模型开发者来说,这也有助于追踪设计是否来自自家系统,并在出现异常传播时进行溯源。

DeepMind把这种思路放进“分层防御”框架中。所谓分层防御,是指用多个互相补位的安全措施降低单点失效风险。水印可以和序列筛查、访问控制、实验室安全规范、来源元数据以及数据库记录结合,而不应被当成一个单独的安全闸门。

DeepMind还提到,SynthID Bio未来可以与类似C2PA的来源元数据方法结合。C2PA是一套用于记录数字内容来源和编辑历史的标准。把模型、用户、时间、版本和实验记录写入元数据,再将水印嵌入蛋白质或基因组本身,可能形成“外部记录加内部信号”的双重证据链。

这比单纯给AI生成序列贴标签更有用,因为真实的生物研发流程通常会经历多轮设计、筛选、突变和实验验证。元数据记录流程,水印保留在分子或结构中,两者结合后,才能更接近可审计的研发链路。

最大问题是:谁来控制检测器和水印标准

SynthID Bio目前最值得警惕的限制,是它仍然依赖检测器、密钥和模型方的基础设施。

如果只有Google能够运行检测器,其他研究机构、合成供应商和监管机构就很难独立验证结果。检测器是否开放、误报率如何计算、不同版本模型是否使用不同签名,以及检测结果能否作为合规证据,都需要明确的技术和治理安排。

水印检测本身通常是概率判断,而不是数学上的绝对证明。检测器可能输出“带水印”“不带水印”或“不确定”等状态,也需要在假阳性和假阴性之间做取舍。对于普通数字内容,这种不确定性已经会引发争议;对于涉及药物、病原体或监管审批的生物设计,证据标准会更高。

另一个问题是互操作性。如果Google、其他模型公司和开源社区各自设计一套不兼容的水印,供应商就需要部署多个检测器,研究者也可能因为流程复杂而不使用它。未来是否会出现公开的水印格式、独立检测标准和跨模型验证机制,将决定这项技术能否从概念验证进入产业流程。

开源模型的情况尤其复杂。一个模型权重公开后,任何人都可能继续微调、量化或蒸馏它。模型输出的水印能否在这些转换后保留,水印是否会被恶意移除,以及下游模型是否还应承担来源责任,都是现阶段没有答案的问题。

DeepMind这次发布到底值不值得关注

SynthID Bio的价值不在于它已经解决了AI生物设计的安全问题,而在于它把“来源验证”推进到了生物分子层面。

从产品成熟度看,它仍是概念验证:公开实验覆盖的目标数量有限,许多关键指标没有完整披露,针对主动攻击和大规模实际部署的测试也不充分。从技术方向看,它抓住了一个真实痛点——AI生成的蛋白质不是一张可以随时回溯生成记录的图片,设计一旦被复制、合成或进入数据库,来源信息可能迅速丢失。

从实际应用看,序列水印目前更接近可落地的工程组件,因为ProteinMPNN等设计流程本来就会集中生成大量候选序列;结构水印则展示了模型级嵌入的可能性,但要进入不同软件、不同结构预测模型和不同文件格式组成的生产环境,还需要更多验证。

它与传统内容水印的最大区别,也在于生物功能约束。图片水印通常只需满足视觉不可察觉,蛋白质水印还必须通过折叠、结合和实验活性检验。DeepMind在VEGF-A、SARS-CoV-2 RBD和PD-L1结合剂上的结果,至少说明这条路线没有立刻撞上不可逾越的功能墙。

接下来真正值得观察的是三件事:第一,水印是否能抵抗有意突变、重采样和模型蒸馏;第二,检测器能否由第三方独立运行并给出可复核结果;第三,合成供应商和生物数据库是否愿意把水印检测纳入现有筛查流程。

如果这三个问题都能得到解决,SynthID Bio可能成为AI生物设计的来源标记层;如果解决不了,它更可能停留在研究演示阶段。就目前的信息看,DeepMind发布的是一个方向正确、证据初步但还没有资格被当作安全保证的技术原型。

参考来源

本文事实依据包括Google DeepMind于2026年9月30日发布的《Introducing SynthID Bio》以及Ars Technica对该项目的报道;由于本文按发布要求仅保留指定域名链接,原始公告和报道链接未列入文末链接清单。

相关推荐

查看全部