Grok 4.6 進駐 GitHub Copilot:xAI 的程式碼模型攻勢全面走向主流
xAI 於 8 月 12 日發布的 Grok 4.6 在代理式編碼基準測試中達到前沿水準,並於 8 月 14 日全面進駐 GitHub Copilot——這是今年任何前沿模型所拿下最快的主流分發管道。
在 xAI 發布 Grok 4.6 兩天之後,這個模型出現在了大多數開發者實際會接觸到它的地方:GitHub Copilot 的模型選單。2026 年 8 月 14 日,GitHub 宣布 Grok 4.6——xAI 於 8 月 12 日推出的最新推理模型——正式在 Copilot 中逐步推出,範圍涵蓋 VS Code、Visual Studio、JetBrains 系列 IDE、Xcode、Eclipse、Copilot CLI、Copilot 雲端代理以及 Copilot 應用程式。對一個在綜合智力基準上追平 OpenAI GPT-5.6 Sol 的模型來說,從 API 發布到主流 IDE 分發只花了不到 48 小時,這件事本身就是新聞:編碼模型的分發大戰,已經壓縮到以「天」為單位。
Grok 4.6 是什麼
Grok 4.6 建立在 Grok 4.5 之上,特別聚焦於兩件事:長時間運行的代理(agent),以及更具企圖心的互動式與視覺化作品。根據 xAI 的官方公告,這個模型的設計目標是在多步驟的複雜任務中持續投入——研究一個主題、分析資訊、遍歷一個程式碼庫,或者把一個粗略的想法變成完整的應用程式。xAI 觀察到,在較長的任務軌跡上,模型開始展現更多自我測試與驗證行為,會在繼續推進之前先檢查自己的工作。
訓練方法也比典型的迭代升級更加講究。Grok 4.6 經歷了比 Grok 4.5 更長的補充訓練,使用了針對推理與進階技術概念策劃的模型生成資料、高品質工程資料,以及改進的優化器與訓練配方。xAI 接著用 Grok 4.5 本身重新生成監督微調(SFT)軌跡,涵蓋不同推理強度、代理框架,以及 STEM、軟體工程與知識工作等領域,並以模型化檢查過濾掉有問題的軌跡。強化學習階段則涵蓋廣泛的代理式任務,包括核心(kernel)優化、網頁開發與電腦輔助設計(CAD)等特定領域環境。
基準測試成績單
在 Artificial Analysis 智力指數(九項基準的綜合分數)上,Grok 4.6 拿到 61 分,追平 GPT-5.6 Sol Max,僅落後 Fable 5 Max 的 62 分一分。完整的評測表格比頭條數字更有看頭:
- GDPVal-AA v2(知識工作價值):1753,領先 GPT-5.6 Sol Max(1728)與 Fable 5 Max(1741)
- CursorBench v3.2:69.9%,落後 Fable 5 Max(70.5%),但超越 GPT-5.6 Sol Max(67.2%)
- DeepSWE v1.1:65.9%——較 Grok 4.5 的 54% 大幅躍進,但仍落後 GPT-5.6 Sol Max(73%)
- FrontierCode v1.1 Extended:61.3%,領先 GPT-5.6 Sol Max(60.6%)
- APEX-Agents:57.5%,相較 Grok 4.5 的 47.1% 提升了十個百分點
- Terminal-Bench v3.0:26%,從 15.7% 顯著進步,但與 OpenAI 模型的 34.6% 仍有差距
整體態勢很一致:Grok 4.6 相对前代最大的進步都在代理式與知識工作評測上——這正是 xAI 明言的訓練方向。它並非全面稱霸:GPT-5.6 Sol Max 在 DeepSWE 上保持明顯領先,Fable 5 Max 也在多項編碼榜上略勝一籌。但以每百萬輸入 token 2 美元、每百萬輸出 token 6 美元的定價,它以低於多數前沿對手的價格提供了頂級的綜合分數。
為什麼 Copilot 分發很重要
GitHub 官方 changelog 特別指出,在內部測試中,Grok 4.6「在 VS Code 與 Copilot CLI 的終端機編碼任務上表現出色」,並且「在需要持續推理與工具使用的長時程任務上表現尤其突出」。最後這句話——長時程任務——正是 GitHub 選擇凸顯的差異化賣點,也與 xAI 自己對這個模型的定位吻合:一個能扛下多步驟專案的代理,而不只是補全下一個函式的自動完成工具。
這次推出涵蓋 Copilot Pro、Pro+、Max、Business 與 Enterprise 等方案,採逐步開放。計費依照供應商定價、以用量計費。值得注意的是,根據 GitHub 的模型託管文件,xAI 在 Copilot 中以零資料保留(zero data retention)API 政策運行 Grok 模型——即 xAI 承諾不在其伺服器上保留使用者的提示與補全內容。對正在權衡非 OpenAI、非 Anthropic 供應商的企業來說,這已是越來越關鍵的採購檢核項。
這也是一個刻意布局的延續。Grok 4.5 已於 7 月 28 日登陸 Copilot,xAI 模型更早在今年 2 月就進入了 Microsoft Copilot Studio。微軟與 GitHub 這一側,實質上已成為 xAI 最大的主流分發管道——考量到微軟是 OpenAI 的最大投資者,這個結果相當耐人尋味,也說明 Copilot 如今是真正多供應商的平台,而非 GPT 的專屬漏斗。
兩天上市的新節奏
最具指標意義的數據或許是時間軸。Grok 4.6 於 8 月 12 日同步上線 API、Cursor、Grok Build、OpenRouter、Vercel 與 Cloudflare;到了 8 月 14 日,它已進入 GitHub Copilot 與 Visual Studio。xAI 還在 Grok Build 與 Cursor 提供首週雙倍用量作為誘因。
對開發者而言,實際影響是 IDE 層的模型選擇,現在幾乎與 API 層的模型選擇同步更新。對 xAI 的競爭對手而言,這則是壓力:一個前沿編碼模型在發布後 48 小時內觸達數百萬 Copilot 席位,拉高了所有人對分發管線的基本期待。模型先發布、獨佔兩週、再慢慢滲透到第三方工具的時代,已經結束了。
Grok 4.6 能否守住位置仍是未知數——榜單顯示,在每一個關鍵評測上至少有兩個對手在緊咬。但這次發布展示了一套正在奏效的策略:專門為持續性代理工作訓練、積極定價,然後在熱度冷卻之前塞進每一個選單、IDE 與 CLI。開發者今天就可以從 Copilot 模型選單試用,或直接透過 xAI API 使用,定價為每百萬 token 輸入 2 美元、輸出 6 美元,另有雙倍價格的快速版本。