兩百萬張月球影像、1,100 GPU 小時:NASA 與 IBM 開源月球基礎模型全解析
NASA 與 IBM 開源了以 SomBench(39TB、涵蓋 17 年 LRO 觀測)訓練的多模態月球基礎模型——極區冰層預測誤差最多降低 22%,且僅用一半訓練資料就擊敗 ImageNet 基線。
2026 年 9 月 10 日,IBM 與 NASA 低調發布了今年最特別的 AI 模型之一:NASA-IBM 月球基礎模型(Lunar Foundation Model)。這是一個多模態、多解析度的基礎模型,訓練素材不是網路文字或程式碼,而是約 200 萬張經過共同配準(co-registered)的月球表面影像拼貼。模型權重以 Apache-2.0 授權上架 Hugging Face,微調程式碼放在 NASA-IMPACT 的 GitHub 儲存庫,連訓練語料 SomBench——史上第一個開放、機器學習就緒的月球資料集——也以 CC BY 4.0 一併公開。
這是首批專為月球科學打造、公開可用的基礎模型之一,而它出現的時間點,正好是 NASA 與合作夥伴積極規劃人類長期駐留月表的時代。背後的思路很直接:與其為每個科學問題手工打造一套新演算法,全球任何研究者都可以從一個共享的預訓練模型出發,用少量標註資料微調出自己的任務模型。
為什麼月球需要基礎模型
月球勘測軌道飛行器(LRO)自 2009 年起持續觀測月球,按 NASA 自己的說法,它產生的資料量超過 NASA 所有其他行星任務的總和。成果是數 PB 級的影像與地球物理圖資:窄角相機(NAC)每像素 1 公尺的高解析度影像、廣角相機(WAC)每像素 100 公尺的多光譜影像,再加上來自 Diviner、LOLA、Mini-RF、GRAIL 與 JAXA SELENE/Kaguya 等儀器的地形、熱輻射、重力與雷達產品。
問題在於:這些資料從來就不是「機器學習就緒」的。此前不存在任何公開的統一資料集,能將多模態、多解析度的月球資料整合進現代機器學習可用的共同框架。研究月球的科學家要嘛得人工翻閱地圖與影像,要嘛從頭訓練小型、任務特定的模型——不僅運算成本高昂,辨識細微地理特徵的精度也常常不足。
SomBench 補上了這塊缺口。它整合了四次任務、九部儀器、超過 30 個空間對齊圖層,分為兩個軌道:WAC 低解析度軌道有 963,609 個拼貼(每像素 100 公尺,共 38 TB);NAC 高解析度軌道有 1,000,113 個拼貼(每像素 1 公尺,共 1.4 TB)。資料集切分以月球橫麥卡托分帶為單位——橫跨兩個分帶的拼貼直接捨棄,以防止空間洩漏——測試集則保留給下游評估。完整資料集托管於 AWS。
ViT-B 架構與月球特有的工程細節
從架構上看,這個模型在前沿標準裡相當精簡:ViT-B 編碼器—解碼器,768 維、12 層、12 個注意力頭,從零開始在 SomBench 上訓練。真正有意思的不是規模,而是疊加在 TerraMind 遮罩式 token 預訓練配方之上的領域特化設計。
第一是光照處理。月球表面的外觀,受光照幾何(太陽角度、太陽參考框架錨點、拼貼足印)的影響,遠大於表面本身的固有變化。同一個隕石坑在不同光線下可能天差地遠,因此模型把每個拼貼的觀測幾何明確編碼為編碼器輸入,而不是讓網路默默把陰影誤認成地形。
第二是多解析度訓練。NAC 與 WAC 拼貼在單一混合批次迴圈中以原生解析度共同訓練,讓同一組權重涵蓋相差 100 倍的兩個解析度家族。FlexiViT patch embedding 讓檢查點能在不重訓骨幹的情況下以其他 patch 尺寸微調;逐模態的 tokenization 則代表微調時可以自由增刪模態——這對下游研究者非常實用,因為他們手頭未必湊得齊全部 11 個預訓練模態。
輸入涵蓋九個密集影像層,加上兩個序列式脈絡模態:含 8 個欄位的逐拼貼光學metadata,以及含 28 個欄位的靜態圖資脈絡。預訓練本身以 2026 年的標準看格外樸實:16 張 H100、150,000 步、全域批次 1,536、bf16 精度——總計約 1,100 GPU 小時。配方還包括九個逐模態 VQ-VAE tokenizer(FSQ 量化)、一個 DDPM 解碼器,以及對離散 token 詞表的交叉熵目標。
基準測試:贏在哪裡、又只是打平在哪裡
根據 NASA-IBM 技術論文,模型在關鍵地理特徵辨識上比常用方法最多高出 23%。拆開來看是三項任務:
極區冰層前瞻性預測是差距最大的一項。在辨識月球冰層高潛力區域時,模型的 RMSE 比 SwinV2-B(ImageNet)最多降低 22%——0.0293 對 0.0377。這一點至關重要:月球兩極的永久陰影區是最難直接觀測的環境之一,卻可能藏有意味著水與氧的冰層——這些是未來月球基地的關鍵資源,也是製造火星任務火箭燃料的原料。
隕石坑偵測則展現了效率優勢。在公尺級解析度下,模型與 SwinV2-B 等最先進基線打成平手;但在脈絡級解析度(約 100 公尺)下,它僅用一半訓練資料就比 SwinV2-B 高出近 19%——預訓練版本用 50% 訓練資料就能達到或超過用完整資料集訓練的基線。隕石坑計數是定年月表、重建太陽系歷史的核心手段,而隕石坑測繪直接支撐 NASA 的降落點選擇、危險迴避(陡坡、巨石)與長期月球基礎設施規劃。
不規則月海斑塊(IMP)分割是最小幅度的一項:IoU 0.5709 對 ConvNeXtV2-B 的 0.5687——在標籤不完美的條件下領先 3%。作者也坦白指出,NAC 隕石坑與 IMP 兩個基準上的領先者應視為「表現相當」,因為差距小於不同隨機種子間的波動。所有基準測試都透過 TerraTorch 執行,loader、切分、增強、損失函數與指標在各骨幹間保持一致,以五個種子的平均值與標準差呈現,基線包括 ResNet-50、ViT-B MAE、ConvNeXt-B、DaViT-B、DeepLabV3+ 與 SegFormer。
NASA 官方公告中還有一個極具說服力的示範:模型偵測到愛因斯坦隕石坑附近、由 SpaceX 火箭殘骸撞擊形成的新隕石坑。由於撞擊後的影像被排除在預訓練之外,這項測試證明模型可以微調來辨識觀測之間的新表面變化——在龐大的月球資料集中自動化變化偵測。
事先講清楚的限制
模型卡對「這個系統不是什麼」有罕見的明確聲明:它不是科學級的生成式產品;不維持大地測量參考框架;未經驗證不得用於降落點認證或危險清除等營運決策。冰層前瞻性輸出回歸的是知識驅動的模糊疊加圖,而非實測冰層。消融貢獻尚未分離,NAC 預訓練也僅限於 1,095 個配準影像框。對一份研究資產來說,這些都是正確的警示,也將這次發布定位為科學社群的基礎設施,而非成品。
更大的圖像:Prithvi 家族的月球新成員
月球基礎模型是 NASA-IBM 合作一系列開源模型的最新成員:Prithvi 地理空間家族(災害監測、洪水製圖、作物產量預測、颶風預測)與預測太空天氣的 Surya 太陽物理學模型。Prithvi 今年稍早已成為第一個在軌部署的 AI 地理空間基礎模型。
這個模式一致且刻意:開放權重、開放資料、開放程式碼、領域調適的架構,以及任何大學實驗室都負擔得起的樸實算力預算。正如 NASA 首席科學資料長 Kevin Murphy 所言:「我們還必須讓資料更容易被科學家探索和使用。NASA-IBM 月球基礎模型展示了當我們把 AI 帶進 NASA 數 PB 級科學資料時的可能性。這是我們在 AI 看到的真正機會:把大規模資料變成新發現。」
當前沿實驗室競相打造越來越大的通用模型時,這次發布提醒我們:最務實的 AI 進展,往往發生在資料精心策劃的窄領域——而 1,100 GPU 小時,聰明地花在 200 萬張月球影像上,就能勝過十年的人工製圖。
Sources
- [1] https://newsroom.ibm.com/2026-09-10-ibm-and-nasa-release-open-source-ai-model-to-support-lunar-exploration
- [2] https://science.nasa.gov/science-research/artificial-intelligence-lunar-foundation-model/
- [3] https://huggingface.co/nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model
- [4] https://www.unite.ai/ibm-and-nasa-open-source-lunar-foundation-model-with-sombench-dataset/
- [5] https://www.reuters.com/science/ibm-nasa-launch-ai-model-help-map-ice-craters-moon-2026-09-10/