← All posts / Models

SpaceXAI 發布 Grok 4.6:以五分之一成本追平 GPT-5.6 Sol

SpaceXAI 推出 Grok 4.6,一款以代理失敗數據訓練的前沿模型,專為長時間自主任務設計——在 Artificial Analysis 上追平 GPT-5.6 Sol,成本僅為其五分之一。

SpaceXAI 發布 Grok 4.6:以五分之一成本追平 GPT-5.6 Sol

SpaceXAI(前身為 xAI)正式發布了 Grok 4.6,這是其最新的前沿模型,專為長時間運行的代理(agent)、程式碼編寫以及更具野心的大型互動與視覺工作而設計。該模型於 2026 年 8 月 12 日發布,直接建立在 Grok 4.5 的基礎之上,公司將其重點描述為「特別著重於長時間運行的代理和更具野心的大型互動與視覺工作」。結果是一個在 Artificial Analysis 排行榜上追平 OpenAI GPT-5.6 Sol 的模型——兩者並列全球第三——同時超越了月之暗面(Moonshot AI)的 Kimi K3,而成本僅為其大約五分之一。

相同的基礎,截然不同的訓練方式

Grok 4.6 最引人注目的細節在於沒有改變的部分:架構。Grok 4.6 運行在與其前身 Grok 4.5 相同的 1.5 兆參數 V9 基礎上。SpaceXAI 這次沒有把模型做大。相反地,效能提升幾乎完全來自更長、且本質上不同的後訓練(post-training)流程。

根據 The New Stack 的報導,SpaceXAI 用大多數 AI 實驗室會丟棄的東西來訓練 Grok 4.6:代理失敗數據。補充訓練的時間比 Grok 4.5 更長,納入了專門為推理和進階技術任務策劃的模型生成數據。關鍵洞見在於,失敗的代理軌跡——即自主編碼代理走錯路、陷入死胡同或產生錯誤輸出的步驟——藴含著豐富的學習訊號。透過訓練這些失敗案例,Grok 4.6 學會了在不偏離軌道的情況下維持更長序列的自主工作,這項能力已成為 2026 年前沿編碼模型的決戰領域。

Cursor 是與 SpaceXAI 在 Grok 4.5 發布時密切合作的 AI 程式碼編輯器,其在部落格文章中確認:「Grok 4.6 經歷了比 Grok 4.5 更長的補充訓練,使用專為推理和進階技術工作策劃的模型生成數據。」該模型即日起可在 Cursor 的桌面版、網頁版、iOS、CLI 和 Cursor SDK 中使用。

基準測試表現:與 GPT-5.6 Sol 並列

在 Artificial Analysis 排行榜上——被廣泛認為是最全面的前沿大型語言模型獨立基準測試聚合平台——Grok 4.6 追平了 GPT-5.6 Sol,兩者並列全球第三。前兩名分別由 GPT-5.6 Terra 和 Claude Opus 4.8 占據。

這是一項重大成就。Grok 4.6 超越了 Kimi K3——月之暗面擁有 2.8 兆參數的模型,該模型自 7 月下旬以來一直占据第三位。SpaceXAI 將 Grok 4.6 描述為專門「為跨越更長工作序列保持專注而打造,包括研究不熟悉的主題」——這項能力直接轉化為在代理基準測試中更好的表現,因為這些測試需要持續的多步驟推理。

然而,值得注意的是,正如 The New Stack 所觀察到的,「基準測試的提升尚未在所有方面都超越競爭對手。」Grok 4.6 的優勢在於代理和編碼任務,而非純知識回憶或創意寫作——在這些領域,Claude Opus 和 Gemini 模型仍然保持領先。

定價:極具競爭力,但暗藏玄機

Grok 4.6 沿用了與 Grok 4.5 相同的積極定價策略:每百萬輸入 token 2 美元,每百萬輸出 token 6 美元。快取輸入 token 為每百萬 0.50 美元。作為對比,Claude Opus 5 的定價為每百萬輸入 5 美元、輸出 25 美元——這意味著 Grok 4.6 以大約五分之一的成本提供了相當的智慧能力。

但定價模式中存在一個結構性的陷阱。Grok 4.6 支援 50 萬 token 的上下文窗口,但 2 美元/6 美元的定價僅適用於 20 萬 token 以下的提示。當提示達到 20 萬 token 或以上時,輸入、快取和輸出的費率都會提高至未公開的更高級別。對於經常將大型程式碼庫塞入上下文(輕鬆超過 20 萬 token)的長時間編碼代理來說,這種分層定價可能會大幅侵蝕帳面上的成本優勢。

此外,快取命中價格從 Grok 4.5 到 4.6 有所上漲。Grok 4.5 的快取命中計費為每百萬 token 0.30 美元;Grok 4.6 則為每百萬 0.50 美元。正如一項分析所指出的,「在長時間運行的編碼代理中,快取讀取通常佔據大部分帳單」,因此快取定價上漲 67% 對生產環境部署來說是一個實質性的變化。

技術規格

  • 參數量: 1.5 兆(V9 基礎,與 Grok 4.5 相同)
  • 上下文窗口: 50 萬 token
  • 模態: 文字和圖片輸入;文字輸出
  • 知識截止日期: 2026 年 2 月 1 日
  • 推理力度級別: 四個設定(低、中、高,以及一個額外級別)
  • 輸入價格: 每百萬 token 2.00 美元(20 萬提示 token 以下)
  • 輸出價格: 每百萬 token 6.00 美元
  • 快取命中價格: 每百萬 token 0.50 美元
  • 批次 API: 所有 token 成本半價

代理優先策略

在日益擁擠的前沿模型市場中,Grok 4.6 脫穎而出的關鍵在於其明確的代理工作導向。當其他實驗室在優化對話品質、創意寫作或多模態廣度時,SpaceXAI 將籌碼押在了企業客戶日益需求的能力上:能夠在較長時間內自主執行複雜的多步驟任務。

決定用代理失敗數據進行訓練在哲學上很有趣。大多數實驗室在訓練期間會過濾掉失敗的軌跡,將其視為噪音。SpaceXAI 的方法將失敗視為一等訓練訊號——一套錯誤課程,教導模型代理通常在哪裡崩潰。這與 2026 年更廣泛的行業趨勢一致,即從執行軌跡中進行強化學習,而不僅僅是最終答案。

馬斯克在評論此次發布時簡單地表示:「Grok 4.6 是一個顯著的改進。」該模型可立即透過 SpaceXAI 開發者 API、Cursor 所有方案、Poe 以及 Grok Build 使用。

接下來的計畫

Grok 4.6 並不是 SpaceXAI 路線圖的終點。馬斯克先前已確認,擁有 2.1 兆參數的 Grok 4.7 正在開發中,預計將在未來幾週內推出。如果模式不變——相同基礎、更好的訓練——Grok 4.7 可能代表代理能力的再一次飛躍,而非簡單的規模擴大。

就目前而言,Grok 4.6 提供了一個極具說服力的價值主張:用於代理編碼和知識工作的前沿級智慧,價格迫使競爭對手做出回應。分層定價模式和增加的快取成本是否會抑制在生產環境代理部署中的採用,仍有待觀察,但基準測試數據說明了一切。SpaceXAI 已經穩固地確立了自己在前沿 AI 實驗室頂級梯隊中的地位。