AI 快讯Mol-JEPA发布:分子也做JEPA
模型上新

Mol-JEPA发布:分子也做JEPA

2026-09-03T21:06:16.345Z
Mol-JEPA发布:分子也做JEPA

Mol-JEPA尝试用联合嵌入预测架构统一学习分子的结构、性质与其他模态信息。方向值得关注,但目前更像研究路线验证,而不是已经胜出的通用分子模型。

Mol-JEPA把分子学习从单一结构推向多模态预测

Mol-JEPA近日公开了一套面向分子的多模态联合嵌入预测架构,核心目标是让一个模型同时理解分子的不同表示和属性,而不是只盯着SMILES字符串、二维化学图或单个三维构象。论文以arXiv:2608.22642发布,截至2026年9月3日已更新至v2版本,作者随后在Machine Learning社区分享了项目结果,并表示这项工作开发了约一年,后续仍需继续提升性能。

Mol-JEPA是一个多模态分子基础模型,其训练目标是在共享潜在空间中预测被遮蔽的分子信息。这里的重点不是把各种数据简单拼接到一起,而是学习它们之间能够相互解释的关系:模型看到部分结构或部分属性后,应当在表示空间内推断缺失模态对应的高层语义。

分子基础模型是通过大规模预训练学习化学结构、物理性质和生物功能规律,并可迁移到多种下游任务的模型。它与为单个数据集训练的性质预测器不同,后者通常只能回答一个窄问题,例如溶解度是多少;前者则试图形成一种可复用的分子表示,用于性质预测、虚拟筛选、相似性搜索和候选分子排序。

多模态分子学习是将同一分子的多种信息视为彼此关联但不完全等价的观察结果。一个分子可以写成SMILES,可以表示为二维原子—化学键图,也可以对应三维构象、量子化学性质和实验测量值;这些数据描述的是同一个对象,却包含不同的信息密度、噪声和归纳偏置。

Mol-JEPA架构示意图,展示二维结构、三维构象和分子性质等输入经过编码器进入共享潜在空间,并由预测器恢复被遮蔽模态

JEPA不重建原始数据,而是预测隐藏表示

JEPA是Joint Embedding Predictive Architecture的缩写,即联合嵌入预测架构。它不要求模型逐像素、逐词元或逐原子重建输入,而是让模型在潜在表示空间中预测被遮蔽部分的语义表示。

传统遮蔽建模更像一场填空考试。语言模型需要猜出被遮蔽的token,分子图模型需要恢复原子类型或化学键,三维模型可能需要重建坐标;当输入含有实验噪声、构象扰动或不影响功能的局部差异时,模型仍会被迫为这些细节消耗容量。

JEPA更接近让模型回答“缺失部分在语义上应该是什么”。如果上下文编码器已经看到分子的一部分信息,预测器需要估计目标编码器为另一部分信息生成的嵌入,而不必精确复刻每个原子坐标或描述符数值。这样做的潜在收益是减少对低层噪声的拟合,把学习压力集中到跨模态共享的化学规律上。

Mol-JEPA把这一思想扩展到了分子场景。模型通过遮蔽部分模态或特征,利用剩余上下文预测目标表示,从而迫使共享编码空间回答一个关键问题:二维连接关系、三维空间形状和性质信号之间,哪些信息是稳定且可以相互推断的?

这条路线与生成式分子模型并不相同。生成式模型的主要产物是新的SMILES、分子图或三维结构,Mol-JEPA当前更强调表征学习和下游预测;它可以成为筛选、排序和生成系统的编码器,却不应仅因为采用JEPA就被直接理解成可以自主提出药物候选的“分子世界模型”。

30%遮蔽比例是论文当前的关键配置

Mol-JEPA公开的超参数搜索结果显示,当前最佳配置采用512维隐藏表示、30%的遮蔽比例、0.7的损失权重系数和0.1的Dropout。优化器学习率为0.0005,权重衰减为0.01。

| 组件 | 搜索范围 | 论文报告的最佳值 | 代表的含义 | |---|---:|---:|---| | 学习率 | 0.01、0.005、0.001、0.0005 | 0.0005 | 更新更保守,适合对齐多个模态的表示空间 | | 权重衰减 | 0、0.0001、0.001、0.01 | 0.01 | 使用较强正则化,降低在有限分子数据上的过拟合 | | Transformer隐藏维度 | 32、128、512 | 512 | 为跨模态关系保留更大的表示容量 | | 遮蔽比例 | 0.1、0.3、0.6、0.9 | 0.3 | 每次隐藏30%的目标信息 | | 损失权重λ | 0.1、0.3、0.5、0.7 | 0.7 | 更强调对应目标项,但具体解释应结合论文损失定义 | | Dropout | 0.1、0.4、0.7 | 0.1 | 仅使用10%的随机失活,避免过强正则化损害表示能力 |

30%的最佳遮蔽比例说明分子多模态预测需要在难度与可辨识性之间取平衡。遮蔽比例只有10%时,任务可能过于简单,模型容易依赖局部捷径;遮蔽比例达到60%甚至90%时,剩余上下文又可能不足以确定目标,因为同一个二维结构可以对应多个三维构象,类似结构也可能表现出截然不同的生物活性。

512维隐藏层则表明过小的潜在空间可能难以同时承载拓扑、几何和性质信息。分子并不是把原子名称排成句子那么简单,手性、芳香性、电荷分布和构象变化都可能影响最终功能,因此跨模态共享表示需要足够容量,但512维仍属于可以被下游模型和检索系统实际使用的规模。

这些超参数只能证明当前实验设置下的最优点,不能证明30%遮蔽或512维对所有化学数据集都最优。数据规模、模态缺失率、分子大小和下游任务变化后,最佳点很可能迁移;尤其在高通量筛选数据中,实验标签的噪声结构与量子化学模拟数据完全不同。

多模态不是堆输入,而是解决信息不对称

Mol-JEPA真正有价值的地方,是承认任何一种分子表示都不完整。SMILES表达紧凑、数据量大,却不天然包含确定的三维几何;二维图保留原子和化学键关系,却无法完整表达构象;三维坐标包含空间信息,却依赖构象生成方法,而且一个分子通常不止一个稳定构象。

性质数据同样不是结构的简单附属品。溶解度、亲脂性、毒性、结合活性和量子化学指标来自不同实验或计算流程,它们的测量误差、适用范围和缺失模式并不一致。把这些数值粗暴拼接到结构向量后面,模型很容易记住数据集偏差,而不是学习可迁移规律。

JEPA提供了一种处理信息不对称的办法。训练时让模型根据可用模态预测缺失模态的潜在表示,理论上可以支持现实中常见的不完整输入:某个分子只有二维结构和少量计算性质,另一个分子有三维构象和实验活性,但两者仍可进入同一表示空间。

这一能力对药物发现的价值主要体现在早期筛选阶段。研究人员通常拥有数百万个只有廉价结构信息的分子,只有几万个分子有计算性质,真正具备高质量湿实验标签的样本可能更少;如果模型能够用便宜模态吸收规模,再用昂贵模态校正语义,它就可能改善低数据任务的样本效率。

与现有分子模型相比,Mol-JEPA赢在问题定义

Mol-JEPA目前最明显的差异不是参数规模,而是把跨模态预测设为预训练主任务。MoLFormer-XL侧重从大规模SMILES学习序列表征,Uni-Mol 2强化二维拓扑与三维几何建模,MolMIM和GenMol则更靠近分子生成与优化;Mol-JEPA优先解决的是多种分子信息如何进入一个可迁移的联合空间。

| 模型 | 主要输入或模态 | 核心训练方向 | 更适合的任务 | 性能比较口径 | 获取与价格 | |---|---|---|---|---|---| | Mol-JEPA | 多种分子结构与性质信息 | 遮蔽上下文下的潜在表示预测 | 表征学习、性质预测、跨模态迁移 | 当前论文实验,尚不能据此宣称全任务领先 | 研究项目,未公布商业价格 | | MoLFormer-XL | 以SMILES为主 | 分子语言模型预训练 | 分子表征、性质预测、检索 | 在SMILES相关基准上更成熟 | 按项目许可使用,无统一商业价格 | | Uni-Mol 2 | 二维拓扑与三维几何 | 几何感知分子预训练 | 三维性质、构象相关预测、虚拟筛选 | 3D建模已有更广泛基准验证 | 按项目许可使用,无统一商业价格 | | MolMIM | 以分子字符串及潜在表示为主 | 可控分子生成与优化 | 生成候选、潜在空间搜索 | 重点不是统一多模态表征 | 按NVIDIA相关平台与许可获取 | | GenMol | 分子生成相关表示 | 生成满足约束的新分子 | 从头生成、候选设计 | 与Mol-JEPA不属于同一直接赛道 | 按NVIDIA相关平台与许可获取 |

这张表也说明,Mol-JEPA暂时没有理由取代现有模型。只需要处理海量SMILES时,成熟的分子语言模型更简单;任务高度依赖三维坐标时,专门的几何等变网络或Uni-Mol类模型仍有更明确的归纳偏置;目标是直接生成新分子时,生成模型也更贴近最终产物。

Mol-JEPA更适合成为多模态系统的中间层。它可以先把异构信息压缩到共享表示,再把嵌入交给分类器、回归器、检索模块或生成器,相当于为不同化学数据建立一种共同语言,而不是包办从数据清洗到药物设计的全部环节。

目前的成绩不足以证明“分子世界模型”已经成立

Mol-JEPA现阶段更像一项有明确想法的研究原型,而不是已经完成规模验证的行业基础设施。作者在发布帖中也直接承认仍有性能改进空间,这比用少量基准结果包装成通用药物发现平台更可信。

分子领域的跑分尤其容易被数据划分方式误导。随机划分会把高度相似的分子骨架分配到训练集和测试集,使模型看起来泛化良好;骨架划分、时间划分和跨实验室外部验证更接近真实研发环境,通常也更难。不同论文如果没有使用相同数据清洗、构象生成和划分流程,几个百分点的差异未必有可比性。

多模态预训练还存在模态捷径问题。模型可能没有学会化学规律,只是发现某类实验标签常与特定数据来源、测量单位或缺失模式同时出现;如果训练集中的高活性分子主要来自某个项目,模型甚至可以利用项目偏差获得漂亮的内部结果。

目标编码空间也可能出现表示坍塌。表示坍塌是指不同输入被编码成相似甚至相同的向量,使预测损失看似稳定,但表示失去区分能力。JEPA类方法通常需要依靠目标编码器更新方式、正则约束或额外损失防止坍塌,而这些设计对分子这种高相似、低标签密度的数据尤其关键。

三维信息的不确定性是另一个尚未消失的问题。单个三维构象不能代表分子在溶液、蛋白口袋或不同温度下的完整状态;如果模型把某个计算生成的最低能构象当成唯一真值,它可能学到构象生成器的偏好,而不是分子的真实构象分布。

真正值得验证的是低数据迁移和缺失模态鲁棒性

Mol-JEPA未来最应该展示的不是更多平均分,而是严格场景下的迁移曲线。比如将标注样本从10000个减少到1000个、100个时,联合预训练能保留多少性能;或者测试阶段缺少三维构象和量子性质时,模型相对完整输入下降多少。

跨模态检索也是一个直接而有解释力的测试。给定一组性质约束,模型能否从结构库中找回满足条件的分子;给定二维结构,模型能否识别合理的三维或性质表示;这些任务能直接检验共享空间是否真的完成了语义对齐,而不只是给下游分类器提供了更大的向量。

外部验证将决定Mol-JEPA能否走出论文。模型需要在不同来源、不同化学空间和不同时间段的数据上测试,并报告置信区间、重复实验和失败案例;如果只在常用小型基准上微调,无法判断收益来自预训练架构,还是来自超参数搜索和数据重叠。

工程可用性同样取决于模型权重、预处理流程和数据许可。分子模型的复现成本不只来自GPU,标准化盐形式、处理电荷、生成构象和对齐实验单位都会影响结果;如果这些步骤没有完整开放,即使网络结构公开,第三方也很难复现论文数字。

判断:方向正确,但现在还不能叫统一答案

Mol-JEPA对分子AI的最大贡献,是把研究问题从“哪一种分子表示最好”改成“不同表示之间哪些信息可以互相预测”。这个问题更接近真实药物研发,因为研究人员面对的从来不是整齐、完整且同分布的数据,而是一组成本不同、质量不同、经常缺失的观测。

JEPA也确实适合处理分子模态之间的一对多关系。二维结构未必对应唯一构象,结构相似也未必带来相同活性,因此在潜在空间预测高层表示,通常比逐项重建原始输入更符合问题本身。

但Mol-JEPA距离“统一分子信息”仍有明显距离。它需要在更大数据规模、更多下游任务、严格骨架与时间划分、缺失模态测试以及真实实验闭环中证明收益,还需要说明共享表示不会牺牲几何精度或生成能力。

截至2026年9月3日,更合理的定位是:Mol-JEPA为多模态分子基础模型提出了一条值得继续扩展的预训练路线,而不是给出了已经击败MoLFormer、Uni-Mol或生成模型的通用替代品。对研究者而言,它值得复现和做消融;对药物研发团队而言,现在更适合进入技术观察清单,而不是直接改造生产管线。

参考来源

相关推荐

查看全部