瓶頸不再是晶片:馬斯克公布 Colossus 2 時程表,年底衝刺 121 萬顆 GPU
馬斯克迄今最詳細的 Colossus 2 擴建時程:22 萬顆 GB300 下週上線、11 月再一批,年底「如果夠幸運」再加一批,讓曼菲斯集群突破 120 萬顆 GPU。
將近兩年前,馬斯克首次承諾要把他位於曼菲斯的超級電腦擴充到百萬顆 GPU 以上。如今終點線終於在望——9 月 25 日,他在 X 上發文,公布了迄今為止最詳細的公開時程表。這份被 Bloomberg 報導、隨後傳遍科技媒體的計畫,將帶領 Colossus 2 在 2027 年到來之前突破 120 萬顆 Nvidia 加速器。
檯面上的數字
根據馬斯克的貼文,Colossus 2——位於田納西州曼菲斯附近的第二代集群——目前運行 11 萬顆 Nvidia GB200 晶片與 44 萬顆 GB300。僅這支艦隊就讓它成為全球最大的單一場址 AI 訓練設施之一。Epoch AI 的獨立資料中心目錄目前估計該場址擁有約 111 萬顆 H100 等效算力,由約 946 MW 的 IT 電力支撐,資本成本達 358 億美元。
接下來的擴充以異常乾淨的批次推進:
- 22 萬顆 GB300「下週完全上線」——第一批,宣布後幾天內就要到位
- 11 月再上 22 萬顆 GB300
- 12 月底第三批 22 萬顆 GB300——「如果夠幸運」,馬斯克自己打了預防針
如果三批全部達標,Colossus 2 年底將擁有 121 萬顆 GB200 與 GB300 處理器,其中 GB300 佔 110 萬顆。再加上第一代的 Colossus 1 場址——15 萬顆 H100、5 萬顆 H200 與 3 萬顆 GB200——SpaceXAI 總運行 GPU 數將達到約 144 萬顆。
為什麼是 11 萬?光纖,不是矽
整份貼文最奇怪的數字是增幅本身:為什麼一個 AI 集群要以 11 萬或 22 萬顆晶片為單位成長?馬斯克把原因直接連到網路物理,而非晶片供給:這個增量反映的是「能插進一台中央交換器的光纖電纜數量」。
這個細節之所以重要,在於它推翻了過去兩年的主流敘事。一直以來,AI 建設的瓶頸被認為是 Nvidia 的 Blackwell 級 GPU 供給——馬斯克自己就曾直接向黃仁孝爭取早期配額。但在這份時程表上,晶片基本上已經到手;限制點亮速度的,是交換器結構(switch fabric)、光纖布建,以及最重要的——背後的電力。拿到 GPU 已經不是最難的部分,餵飽它們、把它們互連起來才是。
貼文沒回答的電力問題
馬斯克的時程表明顯漏了一塊:電從哪裡來。路透社 7 月報導,曼菲斯場址安裝了 59 台沒有聯邦清淨空氣許可的天然氣渦輪機,並因此被周邊社區提起訴訟。SpaceXAI 之後承諾淘汰這批臨時發電設備——但期程長達一年,要等它自建的 1.2 GW 永久電廠上線。
那座電廠正是整份時程表底下最沉默的依賴。12 月底那批是最大的破口:馬斯克自己都以「幸運」形容,一旦延後,問題多半出在電力供應與交換器容量,而不是 Nvidia 的出貨進度。如果 1.2 GW 電廠趕在入冬前未能供電,Colossus 2 就得靠著無許可的燃氣渦輪機撐完整個擴建期——這個姿態已經引來法律行動與監管關注。
三歲公司站上前線牌桌
這樣的規模,因為公司的年紀而更顯驚人。SpaceXAI——xAI 於 2026 年 2 月併入 SpaceX、7 月改旗易幟——成立僅約三年,對比 Anthropic 的六年與 OpenAI 的十年。但如果 12 月目標達成,馬斯克將率先跨過百萬 GPU 的門檻——這是競爭對手未曾為單一場址公開提出過的數字。Broadcom 曾在 2024 年表示有三個超大規模客戶要在 2027 年達成百萬 GPU 集群,但不願點名;馬斯克是第一個把附日期的時程表攤在陽光下的人。
艦隊本身也看得出務實的調度。第一代 Colossus 1 場址混合了 Hopper 與 Blackwell 世代的 GPU——對訓練 Grok 來說效率不彰——所以 SpaceXAI 已把它出租給 Anthropic 跑推論,而 Colossus 2 純用 Blackwell,避免異構瓶頸。
曼菲斯只是野心的起點。馬斯克曾說 SpaceXAI 要在 2027 年前把資料中心容量成長七倍,丟出 2030 年 5,000 萬顆 H100 等效 GPU 的目標,SpaceX 還在探索由百萬顆衛星組成的軌道資料中心系統——這個點子被黃仁勳客氣地稱為目前的「夢想」。
觀察指標
三個檢查點可以告訴我們這份時程表是真是假:
- 下週:22 萬顆 GB300 是否真的「完全上線」,還是「上線」最後變成「已機架但未聯網」?
- 11 月:第二批正好撞上田納西的冬季用電高峰——這是永久電廠期程的第一場真正的壓力測試。
- 12 月底:馬斯克自己打折的那批。盯著 Shelby County 的空氣許可申請與渦輪機拆除進度,它們是最領先的指標。
在一個把「GPU 數量」當成前沿競賽計分板的產業裡,Colossus 2 的擴建是迄今最清晰的單一測試:AI 建設的瓶頸是否已永久地從矽晶圓轉向百萬瓦——以及一家公司能否跑得比自己的電網還快。
Sources
- [1] https://www.morningstar.com/news/dow-jones/202609252622/elon-musk-looks-to-rapidly-scale-colossus-2s-nvidia-chip-count
- [2] https://www.tomshardware.com/tech-industry/data-centers/elon-musks-spacexai-to-add-another-660-000-ai-gpus-this-year-nearing-a-total-of-1-44-million-in-operation-firm-is-building-1-2-gigawatt-power-plant-to-bring-systems-fully-online
- [3] https://aiweekly.co/alerts/musk-xais-colossus-2-aims-for-121m-nvidia-gpus-by-year-end
- [4] https://finance.yahoo.com/technology/ai/articles/elon-musk-aims-double-colossus-060447907.html
- [5] https://epoch.ai/data/ai-data-centers/directory/colossus-2