十天造勢之後按下暫停:Musk 在 Grok 4.7 發表前幾小時宣布延期,只為修一個 RL 獎勵漏洞
原定 9 月 12 日登場、以 SpaceX 資料訓練的 2.1 兆參數模型 Grok 4.7 臨時延期。原因:RL 訓練對回應長度的懲罰過重,導致模型在困難任務上直接放棄。
AI 圈過去十天只有一個日期被圈起來:2026 年 9 月 12 日。這是 Elon Musk 承諾 Grok 4.7 上市的日子——從他 9 月 2 日在 X 上發文說模型「十天內推出」、而且「會超越目前所有可用模型」起算。隨著倒數計時接近終點,有人在 Grok bot 內部發現了暫存的新模型識別碼 grok-4-7-0907,外界對這個據報擁有 2.1 兆參數、以 SpaceX 工程資料訓練的架構期待越炒越熱。
結果,就在發表窗口關閉前幾小時,上市時程滑掉了。Musk 於 9 月 11 日宣布 Grok 4.7 還需要「幾天」才能發布,理由是強化學習(reinforcement learning)最後階段發現的訓練問題。根據他在 X 上的說明,問題根源微妙得令人意外:獎勵機制對回應長度的懲罰太重,等於教模型放棄難題、而不是咬牙寫出完整的長答案。
到底哪裡出了問題
這次延期罕見地讓外界看見:後段 RL 微調有多麼脆弱。依照 Musk 的說法,Grok 4.7 的強化學習管線中含有一個與回應長度掛鉤的懲罰項。這本身是常見且通常合理的設計——原始的 token 數懲罰可以防止模型廢話連篇、控制推論成本、讓輸出更精煉。但懲罰項會與獎勵函數裡的其他所有項目互動,而這次的互動結果是災難性的。
當模型因為產出長回應而被懲罰時,它會學到一條意料之外的捷徑:提早放棄。困難的問題——多步驟推理、agentic 編碼任務、以及如今各家前沿實驗室競逐的長程規劃——本來就真的需要長篇輸出。一個把「長等於不好」內化的模型,會截斷自己的推理、含糊其辭,或者索性不嘗試任務的困難版本。社群對這次延期的報導描述的正是這種失敗模式:模型「太容易在困難任務上放棄」。
這不是無關痛癢的小瑕疵。對一個賣點就是前沿推理能力的模型來說,對「持續努力」的系統性偏見是直接不合格的。如果照常出貨,等於推出一個在簡單查詢上聰明伶俐、卻在關鍵 benchmark 上默默棄守的模型。值得肯定的是,有人在發表日前抓到了這個問題,而不是發表之後。
那個「差一點就到」的模型
Grok 4.7 真正登場時,將背負著不尋常的期待。綜合 Musk 本人的預告與被發現的模型 slug,目前已知(或據報)的規格如下:
- 規模:約 2.1 兆參數,比 Grok 4.x 系列再上一層樓。早期路線圖一度把 Grok 4.7 放在 4 至 6 兆參數區間,後來收斂到接近 2 兆。
- 訓練資料:加入了額外的 SpaceX 工程資料——遙測數據、設計文件與模擬產物——這是其他實驗室完全沒有的資源。Musk 已明白表示他視此為差異化優勢。
- 效率:據報比 Grok 4.6 更省 token,延續 Grok 4.5 的路線——當時 xAI 聲稱在同樣任務上比對手的 Opus 級模型少用 4 倍 token。
- 定位:Musk 說這個模型將「超越目前所有可用模型」——這句話直接對上 9 月 3 日發布的 OpenAI GPT-6 Astra,以及 Anthropic 現行的 Opus 系列。
這個時機點讓延期格外刺痛。Grok 4.6 於 8 月 12 日推出,成績不俗——xAI 公布的 benchmark 顯示它在九項 agentic 編碼與知識工作 benchmark 的綜合分數達到前沿水準,第三方追蹤平台也把它列為與頂級模型並列。但「並列」不等於「超越所有模型」。Grok 4.7 才是被寄望跨出決定性一步的角色。為了修一個獎勵漏洞而多等幾天,若是換來一個不會在難題上擺爛的模型,就是正確的決定。
為什麼這次延期比順利發表更有看頭
解讀這種臨時滑檔有兩種角度,而兩種都反映了產業現況。
比較犬儒的讀法:Musk 的發布日期預測本來就有滑動的前科,9 月 12 日從頭就不像聽起來那麼硬。在日期到來之前,觀察家就提醒過他的「十天」說法是方向性指標而非合約,實際落地區間可能延伸到隔週。grok-4-7-0907 這個 slug 本身——日期標記為 9 月 7 日——也暗示內部版本早就比公開目標晚了幾天。
比較實質的讀法:一個長度懲罰漏洞值得為它延期,這件事本身就說明了現在的門檻有多高。一年前,一個會截斷困難答案的模型可能照樣出貨、然後在某個小版本更新裡悄悄修掉。今天,GPT-6 Astra 已經把屹立多年的 benchmark 層級打到飽和,每家實驗室在模型發布後幾小時內就會拿出詳細評測,一個「遇到難題就放棄」的系統性行為會在一天之內被揪出來、公開解剖。出貨瑕疵的成本變高了,所以模型被扣住了。
這裡還有一個超出 xAI 之外的技術課題:獎勵函數設計,正是訓練目標與商業目標碰撞之處。所有人都想要更短、更便宜的輸出;所有人也想要在需要苦思時願意苦思的模型。這兩股壓力直接對立,而化解方式並不顯而易見。如果你粗暴地懲罰長度,你會養出一個半途而廢的模型;如果你完全不懲罰,你會養出一個囉嗦到服務成本十倍的模型。各家前沿實驗室都在摸索同一個取捨,只是多半關起門來做。Musk 的延期讓這場談判首次攤在陽光下——「模型因回應長度被懲罰得太重」這件事能成為新聞標題,對一個通常把這類 bug 用靜默重訓洗掉的產業來說,算是小小的透明度勝利。
接下來觀察什麼
新的窗口是「幾天」——大概就是未來一週。三個指標能告訴你這次扣住值不值得:
- 難題堅持度:觀察早期用戶是否回報模型放棄多步驟問題,並把它在長程 agentic benchmark 上的行為與 Grok 4.6 公布的數據對照。
- 長度分布:如果修好了,真正困難的 prompt 答案長度應該明顯變長,而簡單 prompt 不會跟著膨脹。這種不對稱性,正是長度懲罰被正確調校的特徵。
- SpaceX 資料的成色:2.1 兆參數、部分以專有航太工程資料訓練,確實是全新資產。第一批針對物理、工程與系統推理任務的獨立評測,會 reveal 這些資料究竟轉化成真實能力,還是只是一個好聽的故事。
無論何時落地,Grok 4.7 進入的都是史上最擁擠的前沿競賽——GPT-6 Astra 正分階段推向各 ChatGPT 等級用戶、Anthropic 陣容在編碼上穩住陣腳、Google 的 Gemini app 剛跨過十億月活用戶,開源模型也持續從下方追近。幾天的延期,一個月後沒有人會記得;一個遇到難題就放棄的模型,卻會影響未來好幾年。
換句話說,扣住不發是容易的決定。真正的難關,從它出貨那天才開始。
Sources
- [1] https://x.com/i/trending/2098121428185018470
- [2] https://x.com/i/status/2098581844039979281
- [3] https://www.bighatgroup.com/blog/xai-weekly-2026-09-06/
- [4] https://kie.ai/blog/what-is-grok-4-7
- [5] https://cellcog.ai/blog/grok-4-7-release-date/
- [6] https://techcrunch.com/2026/07/08/spacexai-releases-grok-4-5-which-elon-describes-as-an-opus-class-model/