先命名、後出貨:Musk 揭曉 Grok 4.8——2.5 兆參數、全新 C++ 軟體堆疊,而 4.7 依然缺席
馬斯克在一則回覆貼文中命名了 Grok 4.8:2.5 兆參數、以 SpaceXAI 重寫的 C++ 堆疊訓練。此時 Grok 4.7 已錯過第四個期限、仍未發布。我們追溯這項宣告背後長達四個月的線索。
美東時間 9 月 13 日晚間 9 點 24 分,有人在 X 上問馬斯克:除了 Grok 4.7,SpaceXAI 九月還有什麼可期待的?他回覆了一個此前從未公開存在過的模型:「Grok 4.8,這是一個 2.5T 模型,用我們全新的 C++ 軟體堆疊訓練,本週完成訓練並開始 RL。」
這一句話,就是 Grok 4.8 目前為止的全部公開紀錄。沒有模型頁面、沒有 API 識別碼、沒有價格、沒有基準測試、沒有發布說明——截至 9 月 14 日,xAI 的新聞頁、模型目錄與開發者文件裡,既找不到 4.8,也找不到 4.7。該公司最新發布的模型仍是 8 月 12 日推出的 Grok 4.6。這則貼文真正值得注意的是脈絡:Grok 4.7 本身還沒出貨,已錯過 9 月 11 日的目標,馬斯克只說還需要「幾天」。SpaceXAI 等於替一款尚未發布的模型,先命名了它的繼任者。
那則貼文到底說了什麼
馬斯克的回覆在一行字裡塞進三個實質宣告。第一是規模:2.5 兆參數,比 1.5T 的 Grok 4.5/4.6 大約 67%,也比還在排隊的 2.1T Grok 4.7 大約 19%。第二是基礎設施:模型據稱以 SpaceXAI 全新的 C++ 軟體堆疊訓練——這是該公司 5 月以來持續打造的重寫版訓練與推論管線。第三是時程:預訓練「本週」完成,接著進入強化學習(RL)。
這些都沒有規格書背書。xAI 從未為任何 Grok 4 系列模型公布參數量;整條參數階梯——5 月量產模型的 0.5T、成為 Grok 4.5 的 V9-Medium 1.5T、先後被標為 2T 與 2.1T 的 4.7,到現在的 2.5T——全部出自馬斯克本人的貼文。而且創辦人自己對「數字對應型號」的映射已經變動過一次:7 月 18 日的貼文用問號把 2T 模型標為「Grok 4.6?」,十天後 4.6 的名號落在 1.5T 模型上,2T 級的訓練被改名 2.1T、重新指派給 4.7。
參數頭條常忽略的還有一個技術細節。Grok 是混合專家(MoE)架構,總參數量描述的是記憶體足跡,而非吞吐量。馬斯克自己就說過,Grok 4.7 雖然更大,但「服務起來會稍微慢一點」,原因正是如此。跑在新堆疊上的 2.5T 模型,可能比舊堆疊上的 2.1T 更快,也可能更慢——xAI 以外目前沒有人說得準。
四個月的 C++ 承諾,一句話的兌現
9 月 13 日貼文中最有分量的,或許是「C++ 軟體堆疊」幾個字,因為這是這次重寫首度被掛在一個有編號的模型上。相關線索長達四個月,且全部來自同一個帳號:
- 5 月 28 日——SpaceX「幾乎完成」了自家用 C 語言撰寫的訓練堆疊 V1.0,「精確映射到 220k GB300 與 800G NIC」,大量使用管線平行,「盡可能貼近裸金屬」。
- 5 月 28 日(稍晚)——下一步:用 C 寫推論堆疊,「在大型 GB300 叢集上同步高速跑 RL」,並坦承「(老實說我們確實用了一點 C++,但不多)」。
- 6 月 29 日——「真正巨大的增益將在約 3 個月後到來,屆時整個訓練與推論堆疊都改用 C/C++ 撰寫並大幅簡化(大多數軟體層將被完全刪除)」。
- 7 月 8 日——Grok 4.5「還沒」用上新的推論軟體;「現在的速度大概可以再翻一倍以上」。
從 6 月 29 日起算三個月落在 9 月下旬,所以 9 月中旬在新堆疊上完成訓練的模型,確實落在馬斯克自己劃定的時間窗內——這可以說是這條時間線上,第一次有「期限形狀」的說法與現實對得上。這套策略本身就是一場豪賭:在 Colossus 規模下,瓶頸是軟體開銷而非矽晶片——刪掉軟體層、把程式碼直接映射到 GB300 硬體,就能找回通用框架浪費掉的效能。如果堆疊真的如描述般運作,它等於是所有未來 Grok 訓練的容量倍增器,這也是為什麼一行關於軟體堆疊的文字,可能比它上方的參數數字更重要。
「本週完成訓練」以前代表什麼
對這項新宣告唯一誠實的校準方式,是看馬斯克過去講出同款句子的紀錄,而那紀錄要求你保持耐心:
- Grok 4.5:「完成訓練」貼於 5 月 25 日,7 月 16 日發布——52 天後。(同一則貼文還承諾「2 到 3 週內公開發布」。)
- Grok 4.6:「下週完成訓練」貼於 7 月 18 日,8 月 12 日發布——25 天後。
- Grok 4.7:「初始訓練已完成」貼於 8 月 12 日——截至 9 月 14 日仍未發布,已 33 天且持續增加,9 月 11 日的發布目標落空,延遲被歸咎於一個 RL 設定。
把這些間隔套到 9 月中的訓練完成點,Grok 4.8 落在 10 月初到 11 月初之間——前提是它遵循任何先例。迄今每個 Grok 4 發布都延誤過第一次宣布的日期;馬斯克自己估計的「短的那端」從未兌現過。
對模型排程意味著什麼
最尷尬的問題是:Grok 4.7 怎麼辦?SpaceXAI 近期不乏短命旗艦的先例——Grok 4.5 於 7 月 16 日出貨,27 天後就被取代——但 4.7 現在面臨更奇怪的命運:要嘛作為過渡品出貨幾週就被自己的繼任者追過,要嘛被整個跳過,等待直接折進 4.8。9 月 13 日的貼文完全沒有回答這一點。那則命名 4.8 的回覆,一次都沒提到 4.7。
對於追蹤「發布」而非「宣布」的人,確認訊號很具體:x.ai 或 docs.x.ai 上出現 4.8 的模型頁或發布說明;一則說 RL 已開始的貼文(那會啟動倒數時鐘);4.7 的任何動向,因為每個 4.8 日期都取決於前代是否先出貨;以及相對於 Grok 4.6 每百萬 token 輸入 2 美元/輸出 6 美元的定價——更大的模型配上更快的堆疊,價格可能往上也可能往下。
數字背後的模式
剝掉細節看,Grok 4.8 的揭露延續一套熟悉的劇本:用回覆貼文宣布、掛上漂亮的整數、讓時程保持模糊。2.5T 這個數字延續了創辦人 5 月以來公開攀爬的階梯,而 C++ 堆疊的故事把一項基礎設施工程變成了產品賣點。這些都未必是假的,而且「映射到單一硬體平台的裸金屬軟體」這場工程豪賭確實有意思。但截至今天,Grok 4.8 只存在於一個地方:X 上的一則回覆,發表於它前一個模型仍未出貨之際。從那句話到可發布的產品之間的距離,可以用馬斯克自己的歷史間隔來度量:25 天、52 天,或者,仍在計數中。