AI首次设计出可存活病毒
斯坦福团队用基因组语言模型 Evo 1 和 Evo 2 生成约 5.4kb 的完整噬菌体基因组,并从 302 个候选中验证出 16 个可存活、可感染大肠杆菌的噬菌体。
AI首次设计出可存活病毒:基因组语言模型开始生成完整噬菌体
据 2026 年 8 月 7 日公开报道,斯坦福大学研究团队使用基因组语言模型 Evo 1 和 Evo 2,从头生成了完整的噬菌体基因组,并在实验室中验证出 16 个能够存活、复制和感染大肠杆菌的噬菌体。这是目前公开报道中,基因组语言模型首次在完整病毒基因组尺度上完成生成式设计并通过实验验证。
这件事的关键不在于 AI 写出了一段看起来像 DNA 的序列,而在于这段序列被合成为真实 DNA 后,能够组装成具有生物活性的病毒。研究团队测试了约 302 个 AI 设计候选,最终 16 个候选表现出可检测的噬菌体活性,成功率约为 5.3%。
**基因组语言模型是以 DNA 或 RNA 序列为主要训练对象、通过预测序列上下文来学习基因组结构和功能规律的生成模型。**它和 ChatGPT 的共同点是都在预测序列,区别在于 ChatGPT 预测的是词和句子,Evo 这类模型预测的是碱基及其背后的遗传结构。

从预测基因片段,到生成一整套病毒系统
过去几年,AI 在生命科学领域的突破主要集中在蛋白质结构预测、蛋白质序列设计、抗体优化和单个基因调控元件生成。完整基因组则是另一种难度:它不是多个零件的简单拼装,而是一套相互耦合的遗传系统。
**完整基因组设计是指在不直接复制天然基因组的情况下,生成一条包含编码区、调控元件、基因重叠关系和复制所需结构的可运行遗传序列。**对病毒而言,单个基因的功能正确并不够,所有序列还必须在长度、阅读框、表达时序、蛋白互作和 DNA 包装等层面同时成立。
本次研究选择的模板是噬菌体 ΦX174。ΦX174 是一种感染大肠杆菌的微小噬菌体,基因组长度约为 5,400 个碱基对,包含多个基因、调控区域和重叠编码关系。它的基因组很短,适合进行 DNA 合成和实验筛选,但结构并不简单。
在 5.4kb 的序列中,一个碱基可能同时处于某个基因的编码区、另一个基因的重叠区域,或者影响启动子、终止信号和 RNA 转录结构。传统的随机突变或模块化改造,很容易让病毒失去复制能力。换句话说,设计一个能感染细菌的噬菌体,不是把几个有效基因拼到一起,而是要让整台分子机器同时启动。
这也是为什么此前 AI 可以设计新蛋白,却很少能直接设计出可存活的完整病毒。蛋白质往往可以在局部尺度上优化;完整基因组则要求模型学习跨越数千个碱基的长期依赖关系。
Evo 1 和 Evo 2 做了什么
**Evo 1 和 Evo 2 是面向生物序列的生成式基础模型,训练目标是从大规模 DNA 序列中学习基因组的统计规律、结构关系和潜在功能。**根据研究团队披露的信息,模型训练数据覆盖病毒、细菌、植物和人类等多类遗传序列,其中包括超过 200 万个噬菌体基因组或相关序列。
研究流程大致分为四个阶段。
第一步是测试模型的基础生成能力。团队使用不同的病毒类别标签引导 Evo 1 和 Evo 2 生成序列,再通过病毒识别、序列相似性、编码密度、蛋白结构预测和噬菌体蛋白家族注释等方法,判断这些序列是否具有合理的噬菌体特征。
第二步是进行领域适配。研究团队围绕 Microviridae 类噬菌体对模型进行微调,并将 ΦX174 作为起始提示和设计模板。微调并不是让模型机械复制 ΦX174,而是让它更熟悉这一类病毒的基因组组织方式、基因重叠模式和宿主感染相关特征。
第三步是加入遗传架构约束。模型生成的序列需要满足一系列生物学条件,包括基因组长度、编码区排列、开放阅读框、启动和终止信号、DNA 包装相关区域,以及与目标宿主大肠杆菌的潜在匹配关系。
第四步是进行实验筛选。团队从接近 300 个候选设计中选出 302 个最有潜力的序列合成并测试,最终获得 16 个可存活噬菌体。这里的实验结果非常重要:模型输出的不是计算机评分意义上的可行序列,而是真正能够完成感染和复制循环的生物实体。
| 对比维度 | 传统噬菌体改造 | Evo 基因组生成设计 | |---|---|---| | 设计对象 | 天然噬菌体上的单点或模块修改 | 从头生成近完整基因组 | | 主要依据 | 已知功能基因和实验经验 | 大规模基因组预训练与序列约束 | | 设计尺度 | 通常是基因、启动子或局部区域 | 约 5.4kb 的完整 ΦX174 类基因组 | | 实验筛选 | 依赖定向突变和多轮验证 | 先计算生成,再合成约 302 个候选 | | 最终结果 | 取决于天然骨架是否容忍改造 | 16 个候选被验证为可存活噬菌体 | | 创新方式 | 在自然序列上做局部搜索 | 探索天然进化之外的序列组合 |
16 个噬菌体证明了什么
**可存活噬菌体是指能够进入宿主细胞、完成基因组复制和病毒组装,并产生可检测感染性后代的噬菌体。**这一定义比模型判定序列像病毒严格得多。
实验结果显示,16 个 AI 设计噬菌体都能够感染目标大肠杆菌菌株 E. coli C,但没有抑制另外 6 种测试菌株的生长。这个结果说明,模型不仅生成了具有感染能力的病毒,还在一定程度上实现了预期的宿主范围控制。
不过,需要准确区分宿主感染和治疗效果。噬菌体能感染某个实验室菌株,并不等于它已经具备临床治疗价值。真实感染环境中还会受到细菌表面受体、免疫系统、组织分布、噬菌体清除速度以及细菌耐药突变等因素影响。
研究团队还观察到,候选序列越接近已知天然基因组,越容易在实验中存活。这一结果并不令人意外,但它揭示了当前模型的实际工作方式:Evo 可以探索自然序列附近的可行区域,却还没有完全摆脱天然基因组的统计分布。
也就是说,这次突破更像是在一张已经存在的生命地图上开辟新路线,而不是凭空创造一套完全陌生的生命语法。模型能够生成非天然的基因组合,但这些组合仍然受到自然界长期演化形成的约束。
Evo-Φ36:新蛋白组合比病毒本身更值得关注
在多个候选中,Evo-Φ36 展现出较有代表性的结构创新。冷冻电镜结果显示,Evo-Φ36 能够形成新的蛋白兼容组合,其中包括来自远缘噬菌体的 DNA 包装相关蛋白组合。
**蛋白兼容性是指不同蛋白在同一病毒生命周期中能够正确折叠、互相识别并协同工作的能力。**这类兼容性长期以来很难从序列层面直接预测,因为蛋白之间的关系不只取决于单个蛋白是否稳定,还取决于它们是否能在正确的时间、正确的位置共同完成复制、包装和释放。
Evo-Φ36 的结果说明,基因组语言模型可能正在学习一种比基因注释更深的关系:哪些序列可以共同存在,哪些蛋白组合虽然在天然病毒中没有出现,却可能在物理和功能上兼容。
这也是生成模型相对传统同源搜索的优势。同源搜索倾向于寻找自然界已经出现过的相似序列,而生成模型可以在已知序列分布的基础上重新组合模块,提出自然演化尚未采样到的候选方案。
AI 设计的噬菌体能否对抗耐药细菌
这项研究最直接的应用方向是噬菌体治疗。**噬菌体治疗是利用能够特异性感染细菌的病毒来抑制或清除细菌感染的一类治疗策略。**与广谱抗生素相比,噬菌体通常具有更强的宿主特异性,但也因此更容易受到细菌受体变化和耐药突变影响。
研究团队测试了 AI 生成噬菌体混合物对 ΦX174 抗性大肠杆菌的作用。公开报道显示,AI 生成噬菌体混合物经过 1 至 2 次传代后,就能够抑制抗性菌株生长;相比之下,天然 ΦX174 类噬菌体混合物在 5 次传代后仍未产生同样效果。
这个结果值得关注,但不能简单理解为 AI 设计噬菌体已经全面超过天然噬菌体。传代实验反映的是特定实验条件下的适应和抑菌表现,尚不能替代动物实验、药代动力学研究或临床试验。更合理的判断是:AI 可能帮助研究人员更快找到能够绕开某些细菌耐药机制的序列组合。
未来的噬菌体鸡尾酒也许不再只是从环境样本中筛选天然病毒,而是由天然噬菌体、模型生成序列和实验进化结果共同组成。模型负责扩大搜索空间,实验负责判断真实功能,测序和再训练则把新的结果反馈给模型。这会形成一个典型的设计—合成—测试—学习闭环。
这不是病毒设计的终点,而是尺寸门槛的第一次松动
ΦX174 基因组约为 5.4kb,属于结构相对紧凑的噬菌体。作为参照,最小的自由生活细胞基因组通常约为 50 万个碱基对,人类基因组约为 30 亿个碱基对。此次结果证明的是 AI 可以在小型病毒基因组尺度上完成生成式设计,并不代表模型已经能设计复杂细胞或大型病毒。
更大的基因组会带来三个明显问题。
第一是搜索空间呈指数级扩大。基因组长度从 5kb 增加到 50kb,并不只是多了 10 倍碱基,而是增加了更多基因、调控关系、结构依赖和潜在冲突。
第二是 DNA 合成和组装成本上升。较长基因组通常需要分段合成、拼接和多轮质量控制,任何一个片段的错误都可能让最终构建失败。
第三是功能验证更加昂贵。小型噬菌体可以通过相对清晰的宿主裂解实验筛选,大型基因组则可能涉及复杂的复制周期、结构蛋白组装、宿主范围和环境稳定性。
研究团队已经将更大的噬菌体作为后续方向,例如约 48kb 的 λ 噬菌体。但从 5.4kb 迈向 48kb,不是简单把上下文窗口扩大几倍,而是要让模型具备层级化的基因组规划能力:先安排模块,再协调模块之间的调控和物理约束,最后检查全基因组是否闭合。
Evo 1 和 Evo 2 与蛋白质模型不是同一条路线
这项研究也说明,基因组语言模型和蛋白质语言模型虽然都使用 Transformer 或类似的序列建模思想,但处理对象不同。
蛋白质模型通常关注氨基酸序列与三维结构、结合位点或功能之间的关系。基因组模型则需要处理更长距离的依赖,包括基因之间的方向关系、重叠阅读框、调控元件、复制起点和宿主相互作用。
从工程角度看,蛋白设计更像设计一个零件,完整基因组设计更像设计一台能自己启动、复制和组装的机器。零件性能优秀,并不意味着整机可以运行。
目前公开结果也没有证明 Evo 能够稳定预测每个候选的具体表型。302 个候选中只有 16 个被验证为可存活,意味着实验验证仍然是不可替代的瓶颈。AI 把候选搜索从手工设计和随机突变,推进到了更大规模、更有方向性的生成,但没有消除湿实验。
这可能是当前最准确的技术判断:AI 正在把基因组设计从低效率的试错问题,转化为模型引导的候选搜索问题,但它还没有把生物学变成确定性工程。
生物安全问题不能等到应用阶段再处理
完整病毒基因组生成能力带来的风险,也比单个蛋白或单段 DNA 设计更加复杂。噬菌体只感染细菌,通常不直接感染人类,但用于生成噬菌体的模型和方法具有可迁移性,未来可能被尝试应用于更广泛的病毒或病原体序列。
研究团队强调了实验安全和生物安保的重要性,并在研究设计中加入宿主范围筛选、序列注释、候选过滤和实验室安全控制。不过,生物安全不能只依赖模型内部的拒答机制。
**生物安保是防止生物技术被恶意使用、误用或失控扩散的一整套制度、技术和实验流程。**对于全基因组生成项目,它至少应覆盖数据集处理、模型训练、候选生成、DNA 合成、实验验证、样本保存和结果发布等全生命周期。
具体来说,模型开发者需要明确哪些序列类别不应被生成,合成机构需要对订单进行风险筛查,实验室需要限制宿主范围和实验条件,研究论文则需要在开放科学与避免提供可直接滥用的操作细节之间取得平衡。此次研究的价值之一,正是把这些问题从假设性的讨论推到了真实案例面前。
OpenAI Hub 判断:重要转折,但还不是人工生命
我们认为,这项工作的技术意义高于它的新闻标题。
“AI 设计病毒”容易让人联想到模型已经能够自由创造生命,但实际情况更克制:研究对象是结构紧凑、宿主明确的噬菌体;模型生成的候选仍然需要严格的生物学过滤和实验筛选;16 个成功候选来自约 302 个合成测试对象,成功率约 5.3%;目前也没有证据表明这些噬菌体已经可以直接用于人体治疗。
但从技术路线看,这确实是一个重要转折。此前 AI 主要帮助人类理解生命系统,或者优化生命系统中的单个组件;这次研究进一步展示了 AI 生成完整遗传系统的可能性。它把模型的作用范围从基因、蛋白和调控元件,推进到了能够自洽运行的病毒基因组。
短期内,最现实的价值是加速噬菌体发现和耐药菌筛选。研究人员可以针对特定宿主、受体或耐药机制,生成更多候选,再通过实验快速淘汰无效序列。中期看,基因组模型可能成为合成生物学中的设计工具,与 DNA 测序、合成和编辑平台形成闭环。长期看,真正的挑战则是把这种能力扩展到更大、更复杂、更加可控的生物系统。
这次研究并没有宣告生命已经被完全编程,却清楚地表明:基因组正在从只能被读取和编辑的生物文本,变成可以被模型生成、被实验检验的设计空间。AI 设计生命的时代,至少已经从概念验证进入了早期实验阶段。
关键数据一览
- 模型: Evo 1、Evo 2
- 设计对象: ΦX174 类噬菌体完整基因组
- 基因组长度: 约 5,400 个碱基对
- 候选数量: 约 302 个 AI 设计基因组
- 实验验证结果: 16 个噬菌体可存活并具备感染活性
- 目标宿主: 大肠杆菌 E. coli C
- 特异性测试: 未抑制另外 6 种测试菌株生长
- 抗性菌株实验: AI 生成噬菌体混合物经 1 至 2 次传代即可抑制 ΦX174 抗性大肠杆菌;天然 ΦX174 类混合物 5 次传代后仍未出现同样效果
- 最终定位: 小型完整病毒基因组的生成式设计验证,不等同于临床治疗或复杂生命体设计
参考来源
- Reddit / MachineLearning:Generative design of novel bacteriophages with genome language models —— 研究论文线索及摘要信息。
- 知乎:Nature 新闻|全球首个 AI 设计的病毒问世 —— 关于基因组语言模型生成噬菌体的中文背景介绍。
- IT之家相关报道 —— 2026 年 8 月 7 日关于 AI 生成完整噬菌体基因组的新闻报道入口。



