← All posts / Research

從 PB 級資料到月球科學:NASA 與 IBM 開源專為月球打造的基礎模型

以月球勘測軌道器 17 年的影像資料訓練而成,NASA-IBM 月球基礎模型能繪製撞擊坑、辨識年輕火山特徵、估算極區冰層穩定性,現已在 Hugging Face 上免費開放。

從 PB 級資料到月球科學:NASA 與 IBM 開源專為月球打造的基礎模型

月球也有屬於自己的基礎模型了。2026 年 9 月 10 日,NASA 與 IBM Research 發布了 NASA-IBM Lunar Foundation Model,這是首批專為月球科學打造、並以開源形式釋出的 AI 模型之一。模型公開托管在 Hugging Face 上,完整程式碼則放在 GitHub,讓任何研究者都能使用——它的任務是以前所未有的規模分析月球表面:繪製撞擊坑、辨識不尋常的火山特徵、估算月球極區冰層可能藏身的位置。

對一個坐擁 PB 級行星資料的機構而言,這次發布代表 NASA 對「科學發現」的思路出現了明確轉向:不只是蒐集更多資料,而是讓既有檔案變得可被機器檢索、可直接用於科學研究。

用 LRO 十七年的資料養出來的模型

模型背後的功臣,是 NASA 的月球勘測軌道器(Lunar Reconnaissance Orbiter,LRO)——自 2009 年起持續拍攝月球。LRO 產出的資料量比 NASA 所有其他行星任務加總還要龐大,幾乎構成一張覆蓋整個月球的無縫高解析度鑲嵌影像。

這個基礎模型以該檔案中約 200 萬個影像圖塊訓練而成,包括:

  • 超過 100 萬張窄視角相機(Narrow Angle Camera)高解析度影像,解析度達 1 公尺
  • 近 96 萬 4,000 張多光譜影像,解析度為 100 公尺

訓練語料還補充了來自其他任務的影像與地形資料:NASA 的 GRAIL(重力重建與內部結構實驗室)、Lunar Prospector(月球探勘者號),以及日本 JAXA 的 SELENE(輝夜姬/月球探測器)。

由於模型已在這個龐大且大多未標註的資料集上完成預訓練,行星科學家只需少量標註資料,就能把它微調到特定任務上——撞擊坑繪製、冰層分布預測、火山特徵偵測等等。這正是基礎模型方法的核心賣點:不必為每個問題從零打造專用演算法,而是讓一個通用模型適配多種用途。

它實際上能做什麼

NASA 的公告列出了三項具體能力,每一項都對應真實的研究課題。

撞擊坑繪製。 每個撞擊坑都由一次撞擊形成,因此坑的數量與尺寸是定年月球表面、重建太陽系歷史的關鍵依據。這個模型繪製撞擊坑的效率遠超人工方法,讓科學家把時間花在解讀結果、而非描繪輪廓上。在一個相當搶眼的展示中,模型偵測出 Einstein 撞擊坑周邊的既有坑體,並標示出一個由 SpaceX 火箭殘骸撞擊形成的新坑——而這次撞擊後的影像,是刻意從預訓練資料中排除的。

年輕火山作用。 月球如今已無火山活動,但它曾經有過。模型加速了不規則月海斑(irregular mare patches)的辨識——這些外觀相對年輕的火山構造,挑戰了既有的月球冷卻時間線。大規模繪製這些特徵,可望幫助科學家拼出更精確的月球熱演化史。

極區冰層穩定性。 對探測而言或許最關鍵的一項:模型能估算冰層在表面與地下可能保持穩定的位置。月球的永久陰影區夠冷,足以讓冰被封存長達數十億年。在 NASA 的基準測試中,NASA-IBM 模型在月球南極一帶(包括 Mons Mouton 附近)的冰層預測圖上,保留了參考資料中的細微尺度模式——而對照組 ConvNeXt 基線模型則把這些細節抹平了。在所有評測任務中,該模型的表現皆與強基線持平或更佳,其中以極區冰層估算的優勢最為明顯。

以開放科學為設計原則

這次釋出的內容遠不只一個模型權重檔。團隊同步公開了:

  • 機器學習就緒的預訓練資料集與基準測試集
  • 整合進 TerraTorch(IBM 的地理空間基礎模型開源工具包)
  • 托管在 Hugging Face 上的配套論文,確保研究可重現

科學團隊橫跨 NASA 馬歇爾太空飛行中心的 Impact AI 團隊、NASA 總部的行星科學部門、戈達德太空飛行中心與艾姆斯研究中心,加上 IBM Research 與學術夥伴。

月球基礎模型加入了日益壯大的 NASA-IBM 模型家族:Prithvi 系列涵蓋地球觀測——災害監測、洪水製圖、作物產量預測、颶風預測;Surya 模型則針對日球層物理,預測太陽閃焰等可能干擾電網與衛星運作的太空天氣現象。月球模型把這套打法從地球軌道延伸到了另一個星球。

為什麼重要

時機並非偶然。隨著 Artemis 計畫瞄準長期駐留月球,「冰在哪裡」「這個著陸點安不安全」已經從學術好奇變成任務規劃的實際問題。一個人人可微調、免費可得的模型,大幅降低了回答這些問題的門檻——也把 NASA 十七年的觀測紀錄,從蒙塵的檔案庫變成共享的運算資源。

NASA 首席科學資料官暨代理首席資料與 AI 官 Kevin Murphy 講得很直白:「NASA 花了數十年建立起非凡的月球科學紀錄,但蒐集資料只是工作的一部分。我們還必須讓資料更容易被科學家探索和使用。NASA-IBM 月球基礎模型展示了把 AI 帶進 NASA PB 級科學資料後的可能性。這是我們在 AI 身上看到的真正機會:把大規模資料轉化為新發現。」

在開放與封閉模型的拉鋸戰中,這也是一個低調但值得注意的數據點。當前沿實驗室愈來愈傾向守住模型權重,NASA 與 IBM 卻把一個領域專用的基礎模型,連同訓練資料、基準測試與工具鏈整套公開——賭的是在一個沒有任何單一機構能夠獨占的領域裡,可重現的開放科學才是最快的加速器。

從「我們有影像」到「我們理解表面」之間的鴻溝,正是基礎模型證明自身價值的地方。月球如今是太陽系中紀錄最完整的天體之一;隨著這次釋出,它也成為運算上最容易親近的天體之一。