NASA与IBM研究院于2026年9月10日正式发布了首个面向月球科学的开源基础模型——NASA-IBM Lunar Foundation Model。这项由双方联合多家学术机构完成的研究,试图将月球勘测轨道飞行器(LRO)17年间积累的海量冰冷观测资产,转化成下游科研开箱即用的AI底座。

这绝非大众科技语境里渲染的“AI终于在月球找到了水冰”。从工程底色来看,这是一场针对深空遥感极端物理环境的无监督表征实验:它用显式光照几何解耦了月表的长阴影干扰,在百米级地质普查上展现出惊人的少样本迁移效率;但在米级高精度辨识的原地踏步、极小测试集的统计扰动,以及缺失测地坐标系的硬伤,清晰划定了它目前只是案头地质筛选工具,远未具备接入登月飞船制导系统的工程实战能力。

42.48TB沉睡资产出山:用物理几何重构月表无监督表征

人类数十年的深空探测留下了极其庞大的星表遥感数据,仅LRO单颗卫星的数据体量,就超过了以往NASA所有行星探测任务的总和。然而,长年困扰学术界的是“观测数据海量,高质量科学标注极度稀缺”的结构性矛盾。过往月球地质分析高度依赖针对特定传感器训练的专用小模型,一旦跨越仪器谱段,特征融合的成本便成倍上升。

为了打破这种碎片化研究,研发团队从头构建了迄今最大的空间对齐多模态月球语料库SomBench,总数据容量约为42.48 TB。该数据集涵盖11种预训练模态,横跨两级空间尺度,整合了包括窄角相机(NAC)约100万张1米/像素高分辨率图像、广角相机(WAC)近96.4万张100米/像素多光谱图像,以及GRAIL重力场、Lunar Prospector氢丰度和日本SELENE/Kaguya矿物学探测在内的9种科学仪器,汇聚成30多个空间对齐数据层。

月球基础模型的多模态物理注入机制 输入源:SomBench • 42.48 TB 对齐体量 • LRO 17年观测数据 • 1米 NAC 与 100米 WAC • 重力/氢谱/矿物等11模态 分区地理切割防数据泄露 核心层:物理特征解耦 • 借鉴 TerraMind 基础架构 • 显式光照几何 Token (太阳高度角/投射方向) • 独立分支通路处理异构层 • FlexiViT 自适应切片尺度 任务端:少样本迁移 • 百米级陨石坑高效框选 • 极地水冰潜在概率回归 • 不规则月海斑块特征分割 • 支持轻量化 LoRA 微调 注:无测地参考系不可导航

把地球遥感大模型直接搬到月球往往会遭遇水土不服。月球没有大气散射,地貌视觉呈现几乎完全被低入射角阳光与漆黑阴影所支配。过去的人工智能模型往往把阴影误判为真实地貌,而该模型吸收了地球观测模型TerraMind的演进经验,在切片输入阶段直接把成像几何、太阳方位角和入射高度作为显式先验Token注入编码器,不再让神经网络在像素内部猜测阴影成因。目前模型权重已在Hugging Face公开,推理与微调代码托管于GitHub并接入遥感工具库TerraTorch,不过用于超算训练的预训练完整代码尚未同步开源。

跑分背后的尺度断层:百米级泛化亮眼,米级辨识原地踏步

官方测试数据显示,该底座模型在粗粒度宏观普查中表现出极佳的标注效率。

在100米/像素广角相机(WAC)的陨石坑检测任务里,模型搭配参数高效微调方法LoRA,取得了0.2581±0.0017 mAP的检测精度,相比全参数微调的通用视觉基线SwinV2-B(0.2420±0.0047)提升了约6.7%。更关键的突破发生在数据供给不足时:当仅向该模型提供50%的人工标注切片时,其得分即可达到0.2541 mAP,直接持平甚至超越了使用100%全量标注训练的传统基准。这意味着行星地质学者可以用过去一半的人力标注量,完成同等精度的全月坑穴普查。

不同分辨率下陨石坑检测精度(mAP)对照 100米/像素 广角尺度 (WAC) - 大范围宏观表征优势明显 SwinV2-B 基线 (100% 标注) 0.2420 本模型 + LoRA (仅 50% 标注) 0.2541 本模型 + LoRA (100% 标注) 0.2581 (+6.7%) 1米/像素 窄角高精尺度 (NAC) - 视觉表征红利衰退 SwinV2-B 基线 0.1552 本模型 (NAC) 0.1543 (打平略低)

但在1米/像素窄角相机(NAC)的微观地貌识别中,预训练带来的代差瞬间消失。在检测细小陨石坑时,该模型的mAP仅录得0.1543±0.0098,与SwinV2-B基线的0.1552±0.0086打平,在统计涨落范围内甚至数字略低。在对揭示月球冷却历史极具价值的不规则月海斑块(IMP)分割上,模型虽然比SwinV2-B高出约3%,但两者的表现区间依然高度重叠。

  • 结论.百米尺度的跨模态大底座有效解决了多星谱段关联,但在逼近1米光学极限时,通用大模型预训练并未展现出对纯视觉卷积或注意力机制的绝对压制。

极地寻冰的代理游戏,与缺失坐标系的工程鸿沟

在成果发布时,传播最广的数字莫过于“极地水冰预测误差降低达22%”。IBM与NASA公布的技术报告显示,相较于SwinV2-B基准模型0.0377的均方根误差(RMSE),新模型压低到了0.0293,降幅达到22.3%。

但需要厘清的是,模型预测的目标并不是地下深处埋藏的真实物理冰块。所谓极地水冰分布预测,在学术上拟合的是一个由地形坡度、地表曲率、最高温度场、永久阴影区(PSR)轮廓以及冰层稳定赋存深度等多维物理指标计算得出的“赋存前景概率(Prospectivity)”。

模型运算出的降幅是物理参数代理地图的回归拟合精度,AI并未在月表探明一克真正的物理水冰。
寻冰指标透视:物理代理解析与工程瓶颈 数学层:RMSE降幅 -22.3% 误差从 0.0377 降至 0.0293 基于回归模型的数值拟合表现 物理层:非真实水冰 • 坡度与表面曲率 • 永久阴影区(PSR)轮廓 • 最高温度场与热工模型 拟合结果仅为找矿前景概率 工程层:导航硬伤 • 缺失高精测地参考系 • 生成坐标经纬度偶发偏差 • 绝非物理测量探测仪 不可直接用于落月避障控制

在真正的原位水资源开采逻辑里,AI绘制出的热力图充其量是第一道案头地质图层,探测器若要打下第一根取样钻管,依然必须依靠中子能谱仪、雷达探测或就地巡视的物理印证。

更为现实的技术硬伤在于工程可用度。该模型在模型卡中明确披露,目前其表征空间内未建立严格的测地参考系(geodetic reference frame)。在极端多模态图像重构与生成测试中,模型的经纬度解算偶发性偏移可达数十度,绝对高程也会出现系统性偏移。这意味着它无法无缝嵌入阿尔忒弥斯(Artemis)等载人航天或商业探月飞船的制导、导航与控制系统(GNC),无法承担米级着陆点遴选与自主避障任务。

同时,这套底座当下依赖的下游测试基准样本量极为单薄:极地冰评估仅依托25个测试样本,不规则月海斑块仅有约10个瓦片,高精度NAC切片也只有62个。个位数百分比的指标浮动,在如此狭窄的测试集上极易受到小样本方差的冲击。

  • 风险.若脱离中子谱仪等物理测量设备,单凭大模型概率图指引探测器现场取冰,极有可能陷入代理参数过拟合带来的地质错判。

对于行星遥感学者而言,这个模型最大的价值并非单纯的测试集跑分,而是免去了处理几十TB零散FITS格式数据、手动拉伸阴影和对齐星历坐标的数月苦功。将42.48TB数据对齐沉淀为可复用的SomBench基准,本身就是行星科学数据工程的扎实一步。

但对翘首以盼AI直接开辟星际资源的公众与工业界来说,登月航天工程依然遵循最保守严谨的物理定律。百米粗筛靠基础模型加速,米级避障与打钻找冰仍需等待物理仪器的真正落地。