← All posts / Models

雙倍工時、同樣價格:拆解 SpaceXAI 的 Grok 4.7

SpaceXAI 的 Grok 4.7 能在困難任務上運作更久、Terminal-Bench 分數近乎翻倍、在 Harvey 法律 Agent 基準拿下 19.6%——全部維持 Grok 4.6 的 $2/$6 定價,但代價是 token 用量暴增一倍以上。

雙倍工時、同樣價格:拆解 SpaceXAI 的 Grok 4.7

2026 年 9 月 21 日,SpaceXAI 悄然推出 Grok 4.7——該公司迄今最擅長程式開發、Agentic 任務與知識工作的模型,而且完全沒有動到價目表。就在對手們於同一週忙著降價或互相搶發(OpenAI 在 Anthropic 發布 Opus 5.5 後約 90 分鐘就推出 GPT-6 Sol 與 Luna)的同時,SpaceXAI 走了相反的路:維持 Grok 4.6 每百萬輸入 token 2 美元、輸出 6 美元的定價,然後把模型本身大幅升級。「速度是可比模型的兩倍、價格只有一半」是官方的說法,而他們公布的基準測試表格至少支持了後半句。

技術面上改了什麼

Grok 4.7 與前代相比有四個差異,而且沒有一個是小修小補:

全新且更大的基礎模型。 Grok 4.7 並未沿用 Grok 4.6 的基底。SpaceXAI 為這一代訓練了更大的基礎模型——在多數實驗室都靠後訓練從既有基底擠出效能的這一年,這是個值得注意的決定。

更長的 RL 訓練、更難的任務組合。 強化學習的任務組合刻意偏向需要「數小時」才能完成的問題。這個選擇直接反映在長時程基準測試的成績上:這是一個為 Agentic 工作現實調校的模型——在現實中,單一任務橫跨數小時而非數秒。

更好的自我驗證與長上下文處理。 官方表示模型會更仔細地檢查自己的工作——這在程式開發中最重要,能不能在執行中途抓出自己的錯誤,決定了你交付的是能動的 PR 還是幻覺產物。

原生支援 Grok Bot 架構。 Grok 4.7 經過訓練能原生理解 SpaceXAI 的 Grok Bot harness,改善了對話品質與一般知識工作表現。

開發者文件補齊了規格:50 萬 token 上下文視窗(與 Grok 4.6 相同)、知識截止日為 2026 年 5 月、支援文字與圖片輸入/文字輸出,推理強度(reasoning effort)可從 low 一路調到 xhigh。

基準測試全景

SpaceXAI 的對照表以 xHigh 強度的 Grok 4.7 對上 Grok 4.6 High、GPT-5.6 Sol Max 與 Anthropic 的 Fable 5.1 Max。所有分數皆為廠商自報,而老實的總結是:Grok 4.7 在每一行都優於 Grok 4.6、在其中兩項基準 outright 領先,但並未橫掃全場。

基準測試Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
輸入單價(美元/百萬)$2$2$4$10
輸出單價(美元/百萬)$6$6$20$50
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.037.6%20.3%37.3%57.9%
Harvey 法律 Agent 基準19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

*高強度模式。

有三個數字特別顯眼。Terminal-Bench 4.0 從 20.3% 跳到 37.6%(Artificial Analysis 在自家的評測中也獨立量到 +4.5 個百分點的增益)是整張表中單代最大的進步——長時間終端機作業本是 Grok 4.6 最弱的一環,如今已與 GPT-5.6 Sol 打平。EEBench 的 64.0% 以近 8 分之差領先 Fable 5.1、更是遙遙領先 GPT-5.6 Sol 的 39.4%——電機工程是個意外出現前沿領先的領域,SpaceXAI 也不客氣地大方展示。而 Harvey 法律 Agent 基準的 19.6% 幾乎是分類勝利:Fable 5.1 Max 只有 6.7%、GPT-5.6 Sol Max 僅 2.5%,換句話說,Grok 4.7 的法律 Agent 分數約是最接近對手的三倍、價格卻只有三分之一。

不過 Fable 5.1 Max 仍在 7 項基準中的 4 項稱王,包括 Terminal-Bench 上具壓制性的 57.9%——而它的輸入價是 5 倍、輸出價約 8.3 倍。GPT-5.6 Sol Max 則守住 DeepSWE 的最佳成績 72.7%。在 SpaceXAI 的 CursorBench 4.0 每任務成本圖上,Grok 4.7 坐在性價比的前沿位置。這才是真正的訴求:不是「最強模型」,而是「中階價格的前沿能力」。

Artificial Analysis 的獨立驗證

廠商自報的基準本來就該打折扣,這也讓 Artificial Analysis 的獨立評測成為這次發布中最有價值的資料點。他們的結論大方向是肯定的,但帶一個重要但書。

Grok 4.7 在 Artificial Analysis 智慧指數拿下 46 分,比 Grok 4.6 高 2 分,AA 表示這讓 SpaceXAI 進入「前四大 AI 實驗室」之列。在 AA-Briefcase(AA 用於長時程 Agentic 知識工作的私人基準)上,Grok 4.7 較前代大增 +111 Elo、達到 1,657——剛好落在 Claude Opus 5 與 Claude Fable 5.1 之後的前沿地帶。在 GDPval-AA 上則拿下 1,695 Elo,領先 Grok 4.6 達 +90。

程式開發的故事更強:Grok 4.7 搭配 Grok Build 在 AA 的 Coding Agent Index 拿下 56 分,比 Grok 4.6 高 9 分,在原生 harness 模型中排第四——僅次於 Claude Fable 5.1、GPT-6 Astra 與 Claude Opus 5。分項成績全面上揚:DeepSWE v1.1 從 65% 升到 73%、Terminal-Bench 4.0 從 18% 升到 33%、SWE-Atlas-QnA 從 58% 升到 63%。

但書則是:這些增益伴隨著巨大的 token 食慾。Grok 4.7(xhigh)在每個智慧指數任務上大約燒掉 8.1 萬個輸出 token——相較之下 Grok 4.6(high)約 3.6 萬、GPT-6 Astra(max)約 2.7 萬。這比前代多 125%、比 Astra 多 196%。以每百萬輸出 6 美元計算,每任務的經濟學仍然划算,但任何用 token 量來編列 Agent 部署預算的人都需要重新校準。AA 另外量測到長提示詞下的輸出速度約為每秒 188 token,任務平均耗時 7.1 分鐘。

還有一個品質訊號:Grok 4.7 在 AA-Omniscience 的幻覺率從 34% 降到 29%,準確度大致持平——多燒的 token 買到的是更多自我檢查,而不是更多瞎掰。

全新的防護堆疊

Grok 4.7 掛載了 SpaceXAI 稱之為「全新防護堆疊」的 安全機制——是他們測過在拒絕與越獄抵抗上最強的模型。在資安與生物等雙重用途領域,官方表示它在善意任務的實用性與危險任務的安全拒絕兩方面都領先,以 62.4% 登上 LatchBio 生物安全基準的頂點。在 HackerBench v0.3(SpaceXAI 自家針對危險與惡意資安任務的基準)上,僅 3.3% 的危險雙重用途提示詞通過,同時模型「極少阻擋合法的資安工作」。該公司也已開始向特定的資安合作夥伴提供邀請制的紅隊能力存取,供防禦研究使用。

考量到任何實驗室的安全宣稱都理應受到質疑,這裡最有用的細節其實是數字的形狀:對真正危險的任務高拒絕、對合法任務低拒絕。多數安全堆疊都在兩者間取捨;把兩個軸都公布出來,至少是朝向當責的一步。

可用性

Grok 4.7 現已可在 Cursor(所有方案)使用,也是 Grok Build 的預設模型,另可透過 Grok API、OpenRouter、Vercel 與 Cloudflare 呼叫。Grok 4.7 Fast 變體以雙倍價格換取雙倍輸出速度,但只在 Cursor 與 Grok Build 上提供——不含公開 API——且被排除在 Grok Build 免費層之外。美國區域端點(https://us.api.x.ai/v1)以 10% 溢價將推理留在美國境內,快取命中則折扣至每百萬 0.5 美元。

為什麼重要

三個結論。第一,當 OpenAI 與 Anthropic 週二忙著打一場以分鐘計價的價格戰時,SpaceXAI 示範了另一條可行路線:價格不動、能力上調——而基準表格顯示這招至少在長時程專業工作上奏效。第二,專業化的模式越來越鮮明:Grok 4.7 並非處處領先,但它的領先之處(EEBench、Harvey 法律)恰恰落在 per-token 價格複利成長最快的專業領域。第三,AA 的 token 用量數字才是真正安靜的頭條:當一個模型把 token 消耗加倍以上來換取可靠性,「每百萬 token 價格」就不再是最重要的數字——每完成任務成本才是,而那是個更難比價的東西。