← All posts / Industry

SpaceX 在連串可靠性事故後,指派 Starlink 高管 Michael Nicolls 掌管 xAI 資料中心

Elon Musk 已任命 Starlink 資深工程主管 Michael Nicolls 統管 SpaceXAI 資料中心營運;此前 Macrohard 園區多次停電中斷 AI 模型訓練,正常運轉率持續低於 99.9% 的內部目標。

SpaceX 在連串可靠性事故後,指派 Starlink 高管 Michael Nicolls 掌管 xAI 資料中心

根據 The Information 於 9 月 1 日刊出的報導,SpaceX 已對負責建造與營運 AI 資料中心的團隊進行大規模人事改組,指派 Starlink 資深工程主管 Michael Nicolls 統管 xAI 基礎設施部門。此舉發生在田納西州與密西西比州園區可靠性問題頻傳之際。

這次改組之前,已有多位資深資料中心主管在近幾週陸續離職。它出現的時間點格外微妙:xAI 基礎設施策略的核心主張——巨型 AI 算力叢集可以用遠快於產業常規、也遠便宜於產業常規的方式建成——正與實際營運的嚴酷現實正面相撞。

發生了什麼

The Information 報導指出,Elon Musk 在近幾週整頓了 SpaceX 負責資料中心的團隊,在 SpaceXAI 既有園區陸續浮現土木工程隱憂與一連串可靠性問題後,撤換了多位主管。公司已任命 Starlink 老將 Michael Nicolls 掌管 AI 資料中心組織。

Nicolls 是一位實戰派營運者。擔任 Starlink 工程副總裁期間,他曾公開出面處理這個衛星網路最艱難的時刻,包括 2025 年 7 月那場讓服務中斷約兩個半小時的大規模網路事故。值得注意的是,他已於 2026 年 4 月接任 xAI 總裁,並在給員工的內部備忘錄中表明,近期目標是要追上 Anthropic Claude 系列模型的水準。如今基礎設施這一塊也歸他管——這種權力集中,正是 Musk 一貫的治軍方式:由一位資深副手掌握端到端的全權。

時機點並非偶然。The Information 的報導描述,有些設施因為搭建得太過激進,曾在沒有備援冷卻與備援電力系統的情況下運轉了好幾個月。

Macrohard 的問題

報導中最尖銳的細節與 SpaceXAI 的 Macrohard 園區有關。為了達成不可思議的建設時程,該園區高度依賴臨時性基礎設施:供電靠移動式燃氣渦輪機,緩衝靠 Tesla Megapack 儲能電池,冷卻則靠超過 100 台移動式冰水機。

這種拼裝式配置帶來了後果。據一位參與該專案的人士透露,園區停電已多次中斷 AI 模型訓練,正常運轉率也持續低於公司至少 99.9% 的內部目標。對一座超大規模訓練叢集而言,這個缺口代價高昂。叢集一旦斷電並不只是暫停而已——檢查點回復與重新啟動可能耗掉數小時甚至數天的 GPU 時間,而在 GW 級園區的規模下,每一個百分點的運轉率都對應著巨額金錢。

可靠性問題也伴隨著孟菲斯以外擴建計畫的延宕。不過即使面對這些摩擦,SpaceXAI 表示截至 6 月已有 1.4 GW(十億瓦)產能上線,目標年底突破 2 GW,且 AI 相關營收已達約 26 億美元。

財務背景

這次改組之所以重要,是因為 AI 幾乎是一夕之間成為 SpaceX 最龐大的投資優先項目之一。在最近一個申報季度,SpaceX 營收達 78 億美元——近乎去年同期的 41 億美元兩倍——同時單季就投入約 158.3 億美元於 AI 基礎設施。即便 AI 新興業務營收以約 250% 的速度成長,公司整體仍處於虧損狀態。

這些營收有一部分來自金額驚人的外部算力合約。一份每月 9.2 億美元的 Google 算力協議,讓這家搜尋巨頭取得約 11 萬顆 Nvidia GPU 的使用權;SpaceXAI 也將 Colossus 產能租給 Anthropic,合約金額最高可達每月 12.5 億美元,不過該合約設有解約條款。

SpaceX 一向以成本優勢為其建設哲學辯護。公司表示,xAI 第二座資料中心的前兩個運算叢集上線成本約為產業典型成本的四分之一——但這項申報並未詳細說明該計算包含了哪些費用項目。如果這個數字經得起檢驗,那確實是結構性優勢;但如果它省略了臨時電力與冷卻、備援系統,以及目前進行中的工程補強成本,真實經濟學就遠不那麼漂亮。

垂直整合,一路到底

Musk 的回應不是放慢腳步,而是把更多資料中心供應鏈拉進公司內部。SpaceX 正在德州開發燃氣渦輪機葉片與導葉的製造產能——Musk 表示,在發電設備動輒要等上數年的市場裡,這項努力最多可將渦輪機部署時程縮短 18 個月。

而在德州之外,公司還在推動這套策略中最具投機性的一環:軌道資料中心。SpaceX 已向美國聯邦通信委員會(FCC)申請許可,打造一個由多達 100 萬顆衛星組成、在軌道上充當運算基礎設施的系統。這項曾被當作笑談的申請案,如今正式隸屬於同一個地面設施連 99.9% 運轉率目標都守不住的計畫。

市場反應與意義

投資人目前看來並不介懷。SPCX 股價 9 月 1 日約在 143.36 美元,與前一日收盤的 143.69 美元幾乎持平。股價較 6 月歷史高點 225.64 美元回落約 36%,但已從 8 月低點約 104.83 美元強勁反彈——這個區間顯示市場同時定價了 AI 建設的想像空間,以及它不斷展現的執行風險。

更深一層的意義,在於它揭露了整個產業「速度 vs. 可靠性」的取捨。SpaceXAI 在孟菲斯的一系列園區——Colossus、Colossus 2、位於南黑文的 Macrohard,以及新宣布的第四座孟菲斯園區——是以資料中心產業認為不可能的速度建成的。第一座 Colossus 超級電腦從空蕩廠房到訓練叢集上線只花了 122 天。這種速度讓 xAI 得以搶下稀缺的 GPU、鎖定 Google 與 Anthropic 等租戶,並在競爭對手還卡在許可程序時就把產能轉化為合約營收。

但這次改組等於默認了一件事:快速建成與良好營運是兩種不同的專業。Google、Microsoft 這類超大規模業者之所以選擇緩慢而冗餘的建設方式,正是因為會閃爍斷電的訓練叢集是負債——他們的內部可靠性標準向來預設了長年的調校與驗證。SpaceXAI 把這一切壓縮到幾個月內完成,如今帳單以主管更迭、冷卻系統補強與訓練中斷的形式到來。

任命 Nicolls 傳達的訊息是:Musk 的回應不是放緩步調,而是為其底下的高速機器補上專業營運層——引進一位靠讓數千顆衛星持續上線而建立聲譽的主管。Starlink 式的快速迭代能否移植到 GW 級的地面基礎設施上,如今是 AI 建設浪潮中最具關鍵性的未決問題之一。年底的 2 GW 目標,將是第一場真正的考驗。