SLAC 的 AI 壓縮器:科學資料縮小 100 倍,關鍵細節一個不丟
SLAC 與史丹佛團隊打造的神經網路方法,可將實驗資料壓縮 10 至 100 倍,同時保留科學發現倚賴的細微訊號,並支援只解壓研究員需要的那一小塊資料。
下一世代的科學儀器正面臨一個與物理本身無關的難題:實驗產生的資料,即將淹沒實驗本身。美國能源部 SLAC 國家加速器實驗室的研究人員,結合史丹佛、德州大學奧斯汀分校、UC Davis 與卡內基美隆大學的力量,發表了一個 AI 解方——一套神經網路方法,能把海量實驗資料壓縮 10 至 100 倍,同時保住傳統壓縮會丟掉的細微、卻承載科學訊號的細節。這項成果於 2026 年 8 月 24 日發表在《Nature Machine Intelligence》。
一場沒地方放的資料洪流
計畫背後的推手,是 SLAC 的直線加速器同調光源(LCLS)——一座用來拍攝原子與分子運動「快照」的超快 X 射線自由電子雷射。隨著 LCLS 升級,它最終將以每秒高達一百萬次 X 射線脈衝運轉,資料速率以每秒 TB 計。現有的儲存系統沒有一套能直接吞下這樣的洪流再慢慢整理。
「資料量將大到完全無法再用過去的方式處理,」SLAC 首席科學家、同時也是史丹佛材料與能源科學研究所成員的 Joshua Turner 說,他是此計畫的主持人。「現在有太多科學應用,資料儲存與分析速度是真正的瓶頸,我認為這個方法是一個聰明的解法。」
需要這種等級吞吐量的儀器,包括 X 射線光子漲落光譜儀(XPFS),它用來研究拓撲與量子材料等奇異物質中粒子的運動行為。對這類實驗而言,有科學價值的訊號不是明顯乾淨的特徵,而是埋在雜訊裡的統計紋理。
為什麼傳統壓縮在科學上行不通
標準的檔案壓縮是為照片、影片與音訊設計的,它假設人的眼睛和耳朵可以容忍小幅失真。科學不一樣。X 射線分子影像中散布的微小斑點(speckle),承載著材料的排列方式、無序程度、以及隨時間演變的資訊。
「那些斑點往往反映了材料底層的排列、無序或動力學,」論文第一作者、SLAC 研究員倪淵(Yuan Ni)說。「一旦丟掉它們,我們就失去了獨特的科學線索——材料如何結構化、又如何隨時間變化。」
通用壓縮器最佳化的是「感官品質」。當它丟棄「不重要」的資訊時,它無從得知:那一點微弱的斑點圖樣,正是物理學家花費寶貴束線時間測量的東西。
先小波、後神經網路
SLAC 方法的核心概念,是不再把資料集當成一整團無差異的位元組。流程分兩個階段:
- 按尺度分離。 先用一種稱為小波分析(wavelet analysis)的數學工具,把資料分解成不同尺寸的特徵——粗結構、中等尺度圖樣、以及細節。
- 分尺度壓縮。 神經網路再為這些分尺度的特徵各自學習一個緊湊表示,確保細粒度特徵不會被通用壓縮平均掉。
成果是一個跨尺度保留細節的壓縮編碼,而不是針對單一「品質」定義最佳化的產物。
同樣關鍵的是解碼端。因為特徵以多尺度映射到神經網路表示上,使用者可以選定一個特定感興趣區域,用指定的解析度還原它——完全不必碰資料集的其他部分。「如果用傳統壓縮器,你得解壓整個檔案,可能要花上幾分鐘、幾小時甚至幾天,」現在是德州大學奧斯汀分校助理教授的 Zhantao Chen 說,他在 SLAC 任研究員期間參與開發此方法。「這個方法可以只解壓感興趣的區域,而不是整個資料集,效率高出許多。」
這種選擇性解碼的能力,讓壓縮從儲存技巧升級為分析加速器:想檢視海量資料集一角的研究員,幾秒鐘就能得到答案,不用排一個跑整夜的任務。
10 到 100 倍,跨領域通吃
「視底層資料與想要的品質/保真度而定,我們通常能達到 10 到 100 倍的檔案縮減,」倪淵說。團隊的驗證也不限於 X 射線科學:他們測試了多種實驗技術的分子與材料測量資料、太陽磁場測量資料,甚至一般照片。跨資料類型,網路都能適應,學會每種測量中哪些特徵才是關鍵。
研究團隊對定位也很明確:這個方法是要與既有的資料縮減技術並用——例如預先過濾、只保留有趣的事件——而非取而代之。「我們的工作不是要取代現有壓縮方法,」倪淵強調,「而是提供一個額外的 AI 路徑。」
訓練這些網路本身就需要可觀的算力:團隊使用了位於勞倫斯柏克萊國家實驗室、NERSC 的旗艦超級電腦 Perlmutter。計畫由能源部科學辦公室與 SLAC 的實驗室導向研發計畫支持。
為什麼這件事不只在實驗室裡重要
這項工作是每個資料密集領域即將撞上的瓶頸的預演。下一代電波天文觀測站、融合電漿診斷、粒子物理偵據器、大尺度氣候模擬,全都面臨同一個不對稱:資料產生的成長速度,快過儲存、頻寬與分析能力的成長。選項很殘酷——要嘛在儀器端就把資料丟掉,要嘛更聰明地決定留下什麼、以及日後如何取回。
SLAC 的方法指出了第三條路,而且剛好是 AI 最擅長的:學習一個保留多尺度結構、體積小幾個數量級、還能隨機存取解碼的資料表示。它把壓縮從「打包封存的檔案」重新定義為「一場實驗的可查詢編碼」。
還有第二層更安靜的意涵。過去幾年,AI 在科學中的角色多半是分析——在人類已經收集好的資料裡找模式。而這是 AI 往上游走了一步,直接決定「科學記憶」本身怎麼被寫下。如果編碼方式決定了未來研究者能從一場實驗中取回什麼,那壓縮模型就成了科學紀錄的一部分。把它做對——保真度可控、跨尺度保留、可選擇性取回——不是工程上的錦上添花。它決定了在某幾分之一秒內捕捉到、百萬分之一的斑點圖樣,是否還能用在一個尚未出生的科學家手上。
洪流即將到來。SLAC 剛剛示範了:機器學習可以同時是堤防,和索引。