← All posts / Models

遲到九天終於登場:Grok 4.7 正式上線,法律測評碾壓對手、價格只要競品的四分之一

兩度跳票的 Grok 4.7 終於在 9 月 21 日問世,每百萬 token 收 2/6 美元——Terminal-Bench 分數幾乎翻倍、法律與電機工程測評大幅領先,但純編碼峰值仍落後 Fable 5.1。

遲到九天終於登場:Grok 4.7 正式上線,法律測評碾壓對手、價格只要競品的四分之一

9 月 2 日,馬斯克承諾 Grok 4.7 十天內問世;9 月 11 日,日期跳票;9 月 21 日,模型真的上線了。SpaceXAI 的旗艦模型現已在 Cursor 與 Grok Build 開放,並透過 Grok API、第三方編碼工具與模型路由器全面供應。整場跳票風波留下的疑問——多等九天到底值不值——發布文件終於給出了答案。

核心賣點是性價比,不是帳面第一。Grok 4.7 主打「速度是同級模型的兩倍、價格只要一半」,且與 Grok 4.6 同價同速:每百萬輸入 token 2 美元、輸出 6 美元。對照 Fable 5.1 Max 的 10/50 美元、GPT-5.6 Sol Max 的 4/20 美元,這個定價把 Grok 4.7 放在前沿模型的「折價區」。另提供輸出速度翻倍的 fast 版本,價格也翻倍。

更大的底座,更難的訓練任務

技術上,Grok 4.7 採用了比 Grok 4.6 更大的全新底座模型——外界普遍報導為 2.1 兆參數(Grok 4.6 為 1.5 兆),並經過數月的 SpaceX 工程資料補充訓練。發布說明形容這是一場更長的強化學習訓練,任務混合明顯偏向「需要花費許多小時才能完成的難題」,並在自我驗證與長上下文管理上有具體提升。模型也首次原生理解 Grok Bot 的控制框架,SpaceXAI 將對話與知識型任務的進步歸功於此。

這種強化學習的投入,最明顯反映在長時程任務的續航力上。在衡量多小時終端機工作的 Terminal-Bench 4.0,Grok 4.7 xHigh 拿下 38.0%——幾乎是 Grok 4.6(20.3%)的兩倍,也高於 GPT-5.6 Sol Max 的 37.3%,但仍落後 Fable 5.1 Max 的 57.9%。在 DeepSWE v1.1 上,高效能模式繳出 71.0%,緊咬 GPT-5.6 Sol 的 72.7%,並超越 Grok 4.6 的 65.2%。

Grok 4.7 真正贏的地方

最令人吃驚的數字反而在純編碼之外。在 Harvey Legal Agent 法律代理人測評上,Grok 4.7 拿下 19.6%——不僅高於 Grok 4.6 的 15.8%,更是 GPT-5.6 Sol Max(2.5%)與 Fable 5.1 Max(6.7%)的數倍。在電機工程測評 EEBench 上,Grok 4.7 的 64.0% 大幅領先 Grok 4.6(53.0%)、Fable 5.1(56.4%)與 GPT-5.6 Sol(39.4%)——這個結果很像 SpaceX 工程資料訓練在實體系統推理領域開花結果。

在多小時辦公室工作測評 AA Briefcase v1.1,Grok 4.7 得分 1,657,領先 Grok 4.6(1,546)與 GPT-5.6 Sol(1,487),僅次於 Fable 5.1(1,678)。GDPval Elo 榜單說著同樣的故事:Fable 5.1 Max 以 1735 居首,Grok 4.7 xHigh 以 1695 緊追在後,Grok 4.6 為 1605,GPT-6 Astra Max 為 1542。

而它輸的地方,也輸得誠實。在強調長時程編碼的 CursorBench 4.0,Grok 4.7 拿 46.3%——明顯優於 Grok 4.6 的 40.4%、高於 GPT-5.6 Sol 的 41.7%,但落後 Fable 5.1 的 51.8%。HealthBench Professional:56.7%,較 Grok 4.6 的 48.5% 進步,但不及 GPT-5.6 Sol(60.5%)與 Fable 5.1(62.1%)。馬斯克 9 月「超越所有現有模型」的承諾,在絕對帳面上並未兌現;但兌現的東西在商業上或許更有意思:以親民價格買到前沿邊緣的峰值。SpaceXAI 自己的發布圖表也承認這個定位——在 CursorBench 上把 Grok 4.7 描述為「性價比前沿」,而非全面前沿。

獨立評測機構補上了一個發布文件沒有細講的細節。Artificial Analysis 給 Grok 4.7 xHigh 的智慧指數為 46 分——但特別指出它每項任務平均消耗約 8.1 萬個輸出 token,是 Grok 4.6 xHigh(3.6 萬)的兩倍以上。Grok 4.7 回答前想得更久。以每百萬輸出 6 美元的價格,這些思考很便宜;但在延遲敏感的應用裡,這是真實的取捨——新推出的 fast 版本正是為了買回一部分速度。

安全防護才是隱藏亮點

最安靜的頭條,可能才是企業採購最在乎的。Grok 4.7 掛載了 SpaceXAI 稱之為全新架構的安全防護堆疊——是他們測過在拒答與越獄抵抗上最強的模型。在雙重用途領域,它宣稱同時在「良性任務的實用性」與「危險請求的拒答」上領先:以 62.4% 登頂 LatchBio 生物安全測評;在 SpaceXAI 自家的惡意資安任務測評 HackerBench v0.3 上,僅 3.3% 的危險雙重用途提示穿過防線,同時極少誤擋正當的資安工作。公司也開始向特定網路安全合作夥伴提供僅限邀請的紅隊能力存取,用於防禦研究。

對一家曾經被貼上「前沿實驗室中最寬鬆」標籤的公司來說,這是意義重大的轉變。如果這些數字經得起第三方檢驗,安全校準就從合規項目變成賣點——也直接回應了 OpenAI、Anthropic 與 Google 近幾週檯面下持續進行的產業安全標準對話。

觀察與結論

給本週正在選模型的人三個重點。第一,折價區迎來了真正的前沿住民:以代理式編碼與多小時任務執行而言,Grok 4.7 的分數配上 2/6 美元的價格,在「每完成任務成本」上很難被擊敗。第二,領域特化成了新的差異化武器——Harvey Legal 與 EEBench 的差距不是誤差範圍,而是鴻溝,這暗示訓練資料的組成(此例是火箭工程紀錄)能築起防禦性的利基。第三,金字塔頂端仍屬於 Fable 5.1——如果你要的是絕對最大編碼效能,且願意付五到八倍的價格,排行榜仍然叫你掏錢。

這場發布也為一段混亂的插曲畫下句點:十倒數、公開跳票、晚了九天出貨。但 SpaceXAI 已在約兩個月內推出三個模型世代,每一次都維持同樣激進的價格。Grok 4.7 沒有打敗所有對手——它也不需要。它只需要讓其他所有人的定價看起來很不舒服,而從這份發布成績單來看,它做到了。