NASA与IBM开源月球基础模型

NASA 与 IBM 发布面向月球研究的开源基础模型,冰区识别误差比 SwinV2-B 低 23%,并能以一半训练数据将陨石坑识别性能提高 19%。
NASA 和 IBM 给月球研究装上了一双 AI 眼睛
9 月 10 日,NASA 与 IBM 联合发布 NASA-IBM 月球基础模型,并通过 Hugging Face 向研究人员开放下载。该模型主要面向月球遥感影像,可识别潜在水冰分布区域、检测和分类陨石坑,还能从新旧影像中发现刚刚形成的撞击坑。
月球基础模型是一类预先从大规模月球观测数据中学习地形、纹理和光照规律,再针对不同科研任务进行适配的通用视觉模型。它与只能完成单一分类任务的传统模型不同:研究人员不必每次都从头训练,而是可以在同一个基础模型上继续开发冰区识别、撞击坑制图、地质单元分类和地表变化检测等应用。
这次发布的时间点并不偶然。今年春天,NASA 的阿尔忒弥斯 2 号任务完成载人月球掠飞,里德·怀斯曼、克里斯蒂娜·科赫、维克多·格洛弗与杰里米·汉森于 4 月 6 日抵达任务规划中的深空区域。随着后续阿尔忒弥斯任务推进,NASA 需要处理的月球影像会越来越多,依靠研究人员逐张标注已经不现实。

冰区识别误差降低 23%,但不是直接“看见水冰”
潜在月球冰区识别是该模型当前最有实际价值的能力。月球极区永久阴影坑可能保存水冰,而水既可以支持宇航员生存,也可以进一步分解成氢和氧,分别用于推进剂与呼吸系统,因此冰区位置会直接影响未来着陆区和月面基地的选择。
研究团队将模型预测结果与一套采用成熟科研流程生成的月球地图进行了对照。这套地图并非单纯依赖可见光照片,而是综合地形、温度及其他环境数据,用于判断哪些区域具备保存水冰的条件。
与常用视觉基线 SwinV2-B 相比,NASA-IBM 模型的冰区识别误差降低了 23%。SwinV2-B 是微软提出的分层视觉 Transformer 模型,经常被用作高分辨率图像分类、目标检测和语义分割任务的基准骨干网络。
| 测试任务 | NASA-IBM 月球基础模型 | SwinV2-B 基线 | 已公布结果 | |---|---|---|---| | 潜在冰区识别 | 面向月球数据预训练 | 通用高分辨率视觉模型 | 识别误差降低 23% | | 陨石坑识别与分类 | 仅使用基线一半的训练数据 | 使用完整对照训练数据 | 性能提高 19% | | 新撞击坑检测 | 成功识别与旧坑大面积重叠的新坑 | 未披露对应结果 | 首次输入即识别成功 | | 开放方式 | 可在 Hugging Face 下载 | 已有公开模型与研究实现 | NASA-IBM 模型面向科研开放 |
“误差降低 23%”不能直接等同于“准确率提高 23 个百分点”。截至 9 月 10 日的公开报道尚未说明这里使用的是均方误差、交并比、F1 分数还是其他任务指标,也没有给出测试集规模与置信区间,因此这个数字能够证明模型优于基线,但暂时不足以进行严格复现。
冰区预测也不等于直接确认月表存在水冰。模型识别的是与水冰保存条件相关的影像和环境模式,最终结论仍然需要光谱仪、雷达、钻探设备或取样返回任务验证;如果把一张 AI 生成的概率图当成资源储量地图,风险并不比忽略它更小。
一半训练数据,陨石坑性能反而高出 19%
陨石坑识别更能体现基础模型相较通用视觉模型的优势。NASA 与 IBM 在这项测试中只给新模型使用 SwinV2-B 一半的训练数据,其最终识别与分类性能仍然高出 19%。
较高的数据效率对行星科学尤其重要。互联网照片可以依靠海量用户和自动化工具标注,但高质量月球数据通常需要地质学家确认坑缘、喷射物、重叠关系和地质年代,一条专业标注的成本远高于普通图片分类标签。
8 月 5 日发生的一次月球撞击事件为模型提供了接近真实科研工作的测试机会。据发布信息,研究团队把撞击前后的影像输入模型后,模型一次就识别出新形成的陨石坑,即使新坑与原有陨石坑存在大面积重叠,也没有将两者混为一体。
新坑与旧坑重叠是一个比常规目标检测更困难的问题。对普通模型来说,重叠区域可能只是原有坑缘出现了一处亮度变化;对真正理解月表形态的模型来说,新出现的坑缘、阴影方向、喷射物纹理以及前后影像差异共同构成了一个新地质事件。
不过,“一次识别成功”目前仍是案例验证,而不是完整基准测试。要判断模型能否稳定用于自动巡检,还需要公布更多不同分辨率、不同太阳高度角、不同撞击坑直径和不同成像设备下的结果,并统计误报率与漏报率。
月球视觉最难的不是分辨率,而是阴影
月球影像的核心难点是极端光照会改变同一地形在照片中的外观。地球大气会散射阳光,环境光能够填充阴影,使山体和建筑阴影仍保留一定纹理;月球几乎没有大气,阴影边缘锐利,阴影内部的像素可能接近纯黑,无法提供有效地形信息。
同一个陨石坑在不同时间拍摄时,可能看起来像两个完全不同的目标。太阳入射角改变后,一侧坑壁会从高亮变成纯黑,坑底也可能彻底消失,模型如果只记住局部纹理,很容易把光照变化误判为地形变化。
标准计算机视觉预训练方法也未必适合直接搬到月球。以掩码图像建模为例,训练系统会主动遮住部分图像,再要求模型根据上下文还原内容;但在月球影像中,永久阴影本身就像一块天然掩码,模型必须区分“训练阶段人为遮挡”和“传感器确实没有获取到信息”这两种情况。
这也解释了专用基础模型为什么能在数据量更少时超过 SwinV2-B。SwinV2-B 擅长处理一般高分辨率图像,但它并不会天然理解月球坑缘、极区阴影和太阳高度角之间的物理关系;NASA-IBM 模型则有机会在预训练阶段先学习月表特有的数据分布,再将这种知识迁移到下游任务。
它不是聊天大模型,而是行星科学的视觉底座
这套模型更接近科研视觉底座,而不是能够对话的通用大语言模型。把它称为“基础大模型”容易让人联想到 GPT 一类产品,但其真正价值并不在生成文字,而在于用统一表征连接多个遥感分析任务。
对科研团队而言,模型可能带来三项直接收益:
- 减少人工制图工作量。 模型可以先批量圈出疑似冰区或陨石坑,再由研究人员复核,而不是从整幅影像中逐个寻找目标。
- 降低小样本任务门槛。 陨石坑测试只使用一半训练数据便领先基线 19%,说明专用预训练有机会减少昂贵的专家标注需求。
- 提高变化检测速度。 新旧影像可用于追踪撞击坑、滑坡和其他月表变化,为探测器运行与基础设施选址提供参考。
对月面任务规划者而言,模型的意义不止是“识图更准”。未来着陆器需要避开陡坡、巨石和不稳定地形,巡视器还要在通信延迟和算力受限的条件下导航;如果该模型后续能够压缩并部署到任务侧,它可能成为月面自主感知系统的一部分。
对普通开发者而言,这次开源提供了一个稀缺的行星视觉研究入口。开发者可以围绕模型开展迁移学习、特征可视化、跨传感器适配和轻量化研究,也可以测试它能否迁移到火星、谷神星等其他天体影像,但跨天体迁移不能被默认有效,因为不同天体的地质结构、反照率和大气条件差异很大。
开源值得肯定,关键细节仍需补齐
开源是 NASA-IBM 月球基础模型比单次科研演示更重要的地方。模型放到 Hugging Face 后,外部研究团队至少可以检查模型卡、权重、推理配置与训练说明,而不必只依赖发布会中的几组结果。
可下载并不自动意味着可以无条件商用。开发者在采用前仍需核对 Hugging Face 模型卡中的许可证、权重使用范围、数据来源、引用要求和潜在限制,尤其是后续用于商业遥感分析或航天任务决策时,不能把“开放权重”简单理解为“没有责任边界”。
真正决定这套模型科研价值的,还有几个尚待进一步披露的问题:
- 训练数据范围。 数据来自哪些月球轨道器、覆盖哪些纬度、空间分辨率是多少,目前公开报道没有给出完整清单。
- 模型规模与架构。 参数量、输入尺寸、预训练目标及计算成本尚未在参考资料中明确。
- 基准口径。 冰区误差降低 23% 和陨石坑性能提高 19% 分别对应什么指标,需要模型卡或论文进一步说明。
- 泛化能力。 模型能否适应不同传感器、不同轨道高度与极端太阳高度角,还需要跨数据集测试。
- 决策可靠性。 涉及着陆和资源勘探时,模型必须提供不确定性估计,并保留人工与传统物理模型复核环节。
NASA 需要的不是一个炫技模型,而是一条数据流水线
NASA 与 IBM 此次发布的真正看点,是把月球视觉任务从“每个项目单独训练一个模型”推进到“多个任务共享一个基础模型”。前者像是每画一张地图都重新培养一名分析员,后者则是先训练一个熟悉月球地貌的通才,再让它学习冰区、坑体或地表变化等具体工作。
目前公布的两项核心结果已经足够亮眼:潜在冰区识别误差比 SwinV2-B 低 23%,陨石坑任务只用一半训练数据仍领先 19%。但这套模型能否成为月球研究的标准底座,最终还要看权重与数据是否真正可复现、基准是否覆盖极端场景,以及其他研究团队能否得到相近结果。
总体来看,这是一次有明确科研用途的开源,而不是为了追逐“大模型”标签的包装。它不会替代地质学家,也不能直接证明哪里埋着水冰,但它有机会把海量月球影像先变成可检索、可比较、可复核的候选结果——对于即将进入高频探月阶段的 NASA 来说,这比做一个会描述月球照片的聊天机器人有用得多。
参考来源
- IT之家:NASA 与 IBM 联合发布开源月球研究基础大模型——介绍模型发布、冰区识别、陨石坑测试及月球影像训练难点。
- Hugging Face——NASA-IBM 月球基础模型的公开托管平台,具体权重、许可证和模型卡应以双方正式仓库为准。



