AI 快讯苹果 SimpleDesign:蛋白质序列结构一起生成
模型上新

苹果 SimpleDesign:蛋白质序列结构一起生成

2026-09-12T04:07:37.438Z
苹果 SimpleDesign:蛋白质序列结构一起生成

苹果研究人员发布蛋白质设计模型 SimpleDesign,以单阶段、无分词器的端到端 Transformer 联合生成氨基酸序列与三维结构。模型使用超过 200 万组序列—结构配对数据训练,但目前仍缺少湿实验验证。

苹果把蛋白质设计做成了一个联合生成问题

苹果研究人员近日公布了蛋白质设计模型 SimpleDesign,它可以在同一个端到端模型中,同时生成蛋白质的氨基酸序列和三维结构。相关论文已于 2026 年 9 月初以预印本形式发布,研究结果显示,SimpleDesign 在联合设计、结构生成和序列生成基准上取得了具有竞争力的表现。

这件事真正值得关注的地方,不是苹果又发布了一个蛋白质模型,而是它进一步押注了“少做几层中间转换”的路线:不先把结构压缩成离散符号,再交给另一个生成模型处理,而是直接让一个模型同时理解序列和连续三维坐标。对蛋白质设计来说,这相当于从“先翻译、再创作”改成了直接在原始材料上创作。

但需要先把预期放在正确位置:论文目前报告的是计算机评估结果,尚未证明模型生成的蛋白质能够在实验室中稳定折叠、执行预期功能,或者在生物系统中安全运行。SimpleDesign 是一个值得关注的研究方向,不是已经可以直接交付给药物研发团队的自动化蛋白质工厂。

SimpleDesign 同时生成氨基酸序列与蛋白质三维结构的流程示意图

SimpleDesign 是什么

SimpleDesign 是一种直接在氨基酸序列与连续三维坐标上训练、联合生成蛋白质序列和结构的端到端模型。 它不依赖传统流程中的结构离散化中间表示,也不需要先训练一个自编码器把蛋白质结构“翻译”成模型专用的符号。

蛋白质可以粗略理解为一条由氨基酸组成的链,但它真正发挥功能时,必须折叠成特定的三维形状。氨基酸序列决定了这条链的化学组成,三维结构则决定了它如何与其他分子结合、催化反应或构成细胞部件。只看序列,像是只看建筑材料清单;只看结构,又像是只看建筑外形而不知道用了什么材料。

蛋白质折叠是指氨基酸链从线性序列形成稳定三维结构的过程;逆折叠则是根据目标三维结构寻找可能对应的氨基酸序列。前者回答“这条序列会长成什么样”,后者回答“要得到这个形状,应该怎样设计序列”。SimpleDesign 的目标,是让模型在这两个方向之间共享信息,并进一步处理序列与结构同时不完整的设计任务。

它绕开了传统多阶段管线

传统蛋白质联合生成模型常常需要先把结构编码成离散潜在表示,再训练生成模型处理这些表示。 这种方法并非没有价值,但每增加一个中间环节,就增加了一次信息压缩和误差传递的机会。

一个典型流程大致是:先用自编码器读取蛋白质结构,将连续的原子坐标或几何关系压缩成一串离散 token;然后训练语言模型或扩散模型生成这些 token;最后再把 token 解码回三维结构,并检查结构是否与生成的序列一致。它类似于先把一张高清医学影像压缩成一段低分辨率描述,再根据描述重建影像。压缩做得好,效率会很高;压缩做不好,细节就可能在后续环节中丢失。

SimpleDesign 的取舍更直接:模型使用氨基酸序列和连续三维坐标作为训练对象,采用单阶段端到端 Transformer 架构。这里的“无分词器”并不意味着模型不处理序列,而是指它不需要像自然语言模型那样,先把蛋白质结构转换成一套额外的离散词表。

这种设计的优点有三点。第一,序列和结构从训练开始就处于同一个学习过程,模型有机会直接捕捉二者之间的对应关系。第二,省去了自编码器、结构 token 化和解码器等组件,系统更容易训练和分析。第三,同一模型可以通过改变序列与结构的破坏程度,覆盖折叠、逆折叠和联合设计等不同任务。

它的代价同样明确:连续三维坐标比离散 token 更难建模,蛋白质的旋转、平移、局部几何约束和长距离相互作用都会增加学习难度。架构更简单,不等于问题更简单。SimpleDesign 的价值,更多在于证明简化后的通用模型可以成为有竞争力的方案,而不是证明所有专业化组件都已经没有必要。

一个模型覆盖三种蛋白质任务

SimpleDesign 通过分别扰动序列和结构的程度,把多个蛋白质任务统一到同一个训练框架中。 训练时,研究人员会随机遮盖氨基酸序列中的部分内容,同时向对应的三维结构加入噪声。模型需要根据剩余信息,恢复被破坏的部分。

具体来看:

  • 当氨基酸序列基本完整、三维结构受到较大干扰时,任务接近蛋白质折叠,即根据序列恢复结构。
  • 当三维结构基本完整、氨基酸序列被大量遮盖时,任务接近逆折叠,即寻找能够形成目标结构的序列。
  • 当序列和结构都只保留部分信息时,模型需要在两类线索之间反复协调,完成序列与结构的协同设计。

这种训练方式与文本领域的掩码建模有些相似,但难度更高。文本中的 token 通常有离散边界,而蛋白质结构是连续的三维几何对象。一处氨基酸替换可能改变局部相互作用,局部变化又可能在长链上累积为整体折叠差异。因此,模型生成一条看起来合理的序列,并不意味着这条序列一定能稳定形成目标结构。

从产品化角度看,统一任务是 SimpleDesign 的重要卖点。研究人员不必为折叠、逆折叠和联合生成分别维护完全不同的模型;使用者也可以把它理解成一个“序列—结构双向编辑器”:给定更多序列信息,模型偏向补全结构;给定更多结构信息,模型偏向设计序列。

数据规模超过 200 万组,但数据质量仍是关键

SimpleDesign 使用了超过 200 万组蛋白质序列与结构配对数据,主要来自 AFESM 数据集。 相关数据整合了 AlphaFold 数据库的预测结构和其他样本,为模型学习序列与结构之间的统计关系提供了规模基础。

200 万组配对数据听起来很多,但蛋白质设计并不是简单的数据量竞赛。不同蛋白质家族之间存在严重的数据分布差异,训练集中的同源序列、重复结构和预测结构质量,也会影响基准测试的可信度。一个模型如果在与训练数据高度相似的样本上表现很好,并不代表它能够设计自然界中没有出现过的全新蛋白质。

另一个需要留意的问题是结构标签来源。AlphaFold 结构预测对推动蛋白质研究非常重要,但预测结构并不等同于实验测得的晶体结构、冷冻电镜结构或核磁共振结构。对于结构质量高、构象相对稳定的蛋白质,预测结果可能相当有用;对于柔性区域、多构象蛋白质和复杂复合物,预测误差可能直接影响设计判断。

因此,SimpleDesign 的数据规模说明它具备较强的训练基础,却不能单独证明生成质量。真正决定应用价值的,还包括测试集是否严格去重、是否按蛋白质家族划分、是否评估结构置信度,以及生成结果能否通过实验筛选。

与 SimpleFold 的关系:从结构预测走向结构设计

SimpleDesign 延续了苹果 SimpleFold 的核心思路:用相对简洁的通用模型直接处理蛋白质结构问题。 SimpleFold 的任务是根据给定氨基酸序列预测蛋白质三维结构,SimpleDesign 则把问题向前推进了一步——不仅要预测结构,还要尝试生成能够形成相应结构的序列。

SimpleFold 采用流匹配模型,从带噪声的初始状态逐步得到结构坐标。流匹配可以理解为学习一条从“噪声”走向“目标结构”的连续路径:模型不必一次性猜出所有原子的位置,而是学习在不同时间点应该如何修正当前结构。这个过程与生成图像时逐步去噪有相似之处,只是生成对象从像素变成了受物理和几何约束的三维分子结构。

此前公开资料显示,SimpleFold 的架构强调通用 Transformer,而不是大量依赖蛋白质领域专用模块。它没有把三角更新、成对表示和多序列比对等组件作为系统核心,尝试让模型从数据中学习结构规律。SimpleDesign 延续这种简化路线,重点从“序列到结构预测”扩展到“序列和结构联合生成”。

| 模型 | 主要任务 | 输入与输出 | 核心思路 | 当前应如何理解 | |---|---|---|---|---| | AlphaFold2 | 蛋白质结构预测 | 序列等信息 → 三维结构 | 大量结构感知模块与多序列信息 | 结构预测领域的重要基线 | | SimpleFold | 蛋白质结构预测 | 氨基酸序列 → 三维结构 | 通用 Transformer 与流匹配 | 探索简化架构能否完成折叠 | | SimpleDesign | 序列—结构联合设计 | 部分序列、部分结构 → 补全或生成二者 | 单阶段、端到端联合建模 | 从预测走向设计的研究方案 |

需要强调的是,上表不是同一测试条件下的全面跑分榜。参考资料没有提供 SimpleDesign 在各项基准上的具体分数、参数规模、训练成本或推理速度,因此不能据此宣称它全面超过 AlphaFold2、RoseTTAFold2 或其他专用设计模型。现阶段更准确的判断是:它在论文报告的多个任务上表现具有竞争力,技术路线比传统多阶段管线更简洁。

结果不错,但离“能用”还隔着实验室

SimpleDesign 目前最大的限制,是生成结果尚未经过湿实验验证。 论文显示,模型能够生成形态合理的蛋白质结构,生成序列的整体质量与多数竞品多模态模型相当或更好;但这些结论主要来自计算机评估。

蛋白质设计的最后一公里非常残酷。模型可以生成一条在序列指标上很漂亮的氨基酸链,也可以给出几何上闭合、没有明显碰撞的三维结构,但这条蛋白质仍可能在真实环境中无法表达、容易聚集、折叠不稳定,或者虽然折叠成功却没有目标功能。若设计目标涉及药物结合、催化效率、细胞定位或免疫反应,还需要更多针对性的实验。

更现实的应用路径,是把 SimpleDesign 当作候选生成器,而不是最终裁判。它可以在计算机中快速提出大量序列—结构候选,随后由结构打分、稳定性预测、功能筛选和实验验证逐层淘汰。这样做的意义在于扩大搜索空间、减少人工提出候选的时间,而不是取消实验。

安全性也不能被“结构合理”替代。生成蛋白质进入生物系统前,需要评估潜在毒性、免疫原性、非预期结合和环境释放风险。尤其当模型被用于具有生物活性的分子设计时,模型能力越强,越需要配套的访问控制、审查流程和实验室安全规范。

我的判断:架构简化有价值,指标之外还要看新颖性

SimpleDesign 的研究价值高于它当前的直接应用价值。 对研究者而言,一个能在原始序列和连续坐标上端到端工作的模型,降低了蛋白质生成系统的工程复杂度,也提供了一个更容易复现和扩展的基线。对行业而言,它说明蛋白质 AI 不一定只能沿着“添加更多领域模块”的路径发展,通用 Transformer 加合适的生成训练目标,也可能取得不错结果。

但“Simple”这个名字容易造成误解。模型结构简洁,训练数据、坐标表示、损失函数、采样策略和验证流程并不简单;更重要的是,蛋白质设计的难点并没有被架构名称消除。判断一个模型是否真正领先,不能只看生成结构是否像蛋白质,还要看它能否生成训练集之外的新颖序列,能否在目标功能上超过现有方法,以及实验成功率是否足够高。

如果后续研究能够补充以下证据,SimpleDesign 的影响力会明显上一个台阶:第一,公开严格去除同源样本后的测试结果;第二,报告参数规模、训练计算量和推理成本;第三,展示与实验结构的系统比较;第四,公布真实实验中的折叠率、可溶性、稳定性和功能命中率。没有这些数据,它更像一个方向清晰的研究原型,而不是已经完成验证的生产工具。

对开发者和深度用户意味着什么

SimpleDesign 最值得开发者关注的不是立即调用,而是它把蛋白质任务统一建模的方式。 这项工作提供了一个清晰范式:通过控制不同模态的噪声或遮盖程度,让同一个模型在条件生成、补全和双向设计之间切换。这个想法不局限于蛋白质,也可能启发 DNA、RNA、分子构象乃至材料结构的联合建模。

对于想进入 AI for Science 的团队,SimpleDesign 还说明了三个现实问题。

  1. 原始数据比漂亮的中间表示更重要。 中间 token 能让训练流程更像语言模型,但也可能隐藏连续几何信息。
  2. 统一模型不等于统一评价。 折叠准确率、序列可行性、结构新颖性和功能成功率是不同指标,不能用一个总分替代。
  3. 计算生成只是候选筛选的前半段。 真正的价值要由实验周期、命中率和可重复性来决定。

结语

苹果的 SimpleDesign 把蛋白质设计中的两个方向——“序列决定结构”和“结构反推序列”——放进了同一个端到端生成框架。它使用超过 200 万组序列—结构配对数据,直接处理序列与连续三维坐标,并通过不同程度的破坏统一训练折叠、逆折叠和联合设计任务。

这是一条值得关注的简化路线,但还不是蛋白质设计的终点。当前结果证明了模型在计算评估上的竞争力,却没有证明生成蛋白质已经具备稳定功能或生物安全性。更准确的结论是:SimpleDesign 降低了蛋白质联合建模的架构复杂度,下一步能否从“看起来像蛋白质”走到“在实验中有效”,才是决定它行业价值的关键。

参考来源

注:本文依据公开报道和论文预印本信息撰写。SimpleDesign 的公开结果目前以计算机评估为主,具体应用能力仍需等待可复现实验数据。

相关推荐

查看全部