更大、更便宜、更頑強:解析 xAI 的 Grok 4.7
xAI 的 Grok 4.7 採用更大的基底模型,價格卻維持每百萬 token 輸入 2 美元、輸出 6 美元不變,Terminal-Bench 分數近乎翻倍,並在電子工程與生物安全基準上奪冠。
xAI 於 2026 年 9 月 21 日發布 Grok 4.7,這次更新像是一份針對當前前沿模型市場格局的刻意宣言。官方稱其為「最擅長編碼與知識工作的模型」,而最核心的賣點幾乎是個悖論:一個全新、更大的基底模型——據報導權重數量比 Grok 4.6 多出約 40%——卻以與前代完全相同的價格與速度提供服務。在 Anthropic 的 Fable 5.1 每百萬輸入 token 收 10 美元、輸出收 50 美元的年代,Grok 4.7 堅守 2 美元與 6 美元。「速度是可比模型的兩倍,價格只有一半」,這是 xAI 放在標題正下方的口號。
實際上改了什麼
在底層,Grok 4.7 並不是一次微調或重新包裝的檢查點。根據官方公告,xAI 為它進行了更長的強化學習訓練,任務混合難度更高,並刻意側重需要耗費數小時才能完成的問題——正是代理式工作流程日益依賴的長時間編碼 session、終端機馬拉松與文件產製流程。官方也表示,模型在自我驗證工作與管理更長上下文方面都有進步,而且 xAI 訓練 Grok 4.7 原生理解 Grok Bot 框架,強化了對話任務與一般知識工作的表現。
上下文視窗維持與 Grok 4.6 相同的 50 萬 token,基本費率之外還有個有趣的設計:快取輸入為每百萬 token 0.50 美元,而 xAI 另提供一個輸出速度加倍、價格也加倍的快速變體。這種雙層結構悄然承認了一件事:在 2026 年,延遲已經與原始智慧並列,成為產品的第一級功能。
基準測試全貌
xAI 公佈的數字講述了一個進步不均但真實的故事。在側重長時間編碼任務的 CursorBench 4.0 上,Grok 4.7 拿下 46.3%——比 Grok 4.6 的 40.4% 大幅躍進,也明顯領先 GPT-5.6 Sol 的 41.7%,但仍落後 Anthropic Fable 5.1 的 51.8%。DeepSWE v1.1 達到 71.0%(標註為 high effort 分數),與 GPT-5.6 Sol 的 72.7% 和 Fable 5.1 的 70.0% 基本並駕齊驅。
最戲劇性的進步恰恰出現在訓練任務側重的領域。衡量數小時終端機工作的 Terminal-Bench 4.0 從 Grok 4.6 的 20.3% 躍升至 37.6%——近乎翻倍,並小幅超越 GPT-5.6 Sol 的 37.3%(Fable 5.1 仍以 57.9% 領先)。電子工程評測 EEBench 從 53.0% 跳到 64.0%,遠遠甩開 GPT-5.6 Sol 的 39.4% 與 Fable 5.1 的 56.4%。在 Harvey 法律代理基準上,Grok 4.7 從 15.8% 進步到 19.6%。
獨立測評機構的結果大致印證了這個圖像。Artificial Analysis 給 Grok 4.7 的智慧指數比 Grok 4.6 高出兩分,在代理式知識工作任務上表現尤其突出——同時指出增益集中在長時程、使用工具的工作,而非短問答對話。
專業知識工作呈現相同模式。在以 Elo 評分、讓 AI 處理律師、護理師與金融分析師任務的 GDPval 上,Grok 4.7 以 xhigh 推理強度獲得 1695 分,高於 Grok 4.6 的 1605 與 GPT-6 Astra 的 1542,不過 Fable 5.1 仍以 1735 分居冠。另一項多小時辦公工作基準 AA Briefcase v1.1 也從 1,546 進步到 1,657。
全新的安全防護堆疊
這次發布中最深遠的部分,或許藏在安全章節裡。Grok 4.7 採用了 xAI 稱之為「全新的安全防護堆疊」,官方宣稱這是他們測試過在拒答與越獄抵抗上最強的模型。細節值得注意:Grok 4.7 以 62.4% 登上 LatchBio 生物安全基準榜首;在 xAI 自家用於高風險與惡意網安任務的 HackerBench v0.3 上,僅放行 3.3% 的高風險雙用途提示詞,同時極少阻擋正當的資安工作。這種「高能力、低過度拒答」的平衡,正是每一家實驗室在網路安全與生物研究等雙用途領域極力想穿過的針眼。xAI 也已開始向特定網安合作夥伴提供 Grok 4.7 紅隊能力的邀請制存取,用於防禦研究。
這件事的意義超越 xAI 本身。前沿實驗室的競爭已經從純粹的基準分數吹噓,轉向誰能交付「最有能力、同時又會拒絕危險事」的模型——監管機構、企業買家與各實驗室自己的安全團隊,都越來越常同時檢視這本帳的兩側。
取得方式
Grok 4.7 現已於 Cursor 與 Grok Build 上線,也可透過 Grok API、第三方編碼框架、模型路由器與雲端平台使用。入門只需 curl -fsSL https://x.ai/cli/install.sh | bash,或直接在 Grok Build 免費試用。
分析:價格效能的擠壓戰
撥開基準測試表格,戰略動作一目瞭然。xAI 爭奪前沿的方式,不是宣稱在任何單一評測上拿到最高分——Fable 5.1 仍穩坐編碼王座,GPT-6 Sol 也贏得若干項目——而是以大約只有 Anthropic 旗艦五分之一的輸出價格,提供接近前沿的效能。在 xAI 自家的 CursorBench 4.0 價格效能圖上,Grok 4.7 就位於前沿地帶:46.3% 搭配每百萬 6 美元輸出,與 51.8% 搭配 50 美元,是完全不同的價值主張。
這對價格帶高於 xAI 的每一家廠商都是擠壓。當一個大 40% 的模型以不變的價格推出、代理式終端工作分數近乎翻倍時,「夠好的前沿」實際成本就持續下探——而收溢價的實驗室必須用能力差距(Fable 5.1 的編碼領先)或生態系深度來證明價差的合理性。隨著 OpenAI 在 Grok 4.7 發布前一天推出 GPT-6 Sol 與 Luna,Anthropic 的 Claude Opus 5.5 也在同一週登場,2026 年 9 月正在成為史上最擁擠的前沿模型發布窗口。xAI 的賭注是:在那片人潮中,標價才是讓人記住的東西。