← All posts / Models

百萬 token 的思考:Google 發布新旗艦模型 Gemini 4 Argon——但現在幾乎沒有人用得到

Google DeepMind 發表 Gemini 4 Argon:在 DeepSWE 與 Vals Index 創下新紀錄、輸出上限達 100 萬 token、定價 $2/$10——但初期僅透過 Fairwind 計畫開放給受信任的資安防禦者。

百萬 token 的思考:Google 發布新旗艦模型 Gemini 4 Argon——但現在幾乎沒有人用得到

2026 年 9 月 30 日晚間 8 點(UTC),Google DeepMind 揭開了 Gemini 4 Argon 的面紗——這是該公司的新一代旗艦模型,也是今年秋季最重要的 AI 發布。但轉折在於:除了精選的一小群資安防禦者與 Google 自家工程師之外,目前幾乎沒有人能實際使用它。在旗艦模型發布通常意味著 API 立即開放、馬拉松式直播展示的時代,Google 選擇了相反的路——這種刻意分階段的推出方式,既說明了 Argon 本身,也說明了 2026 年 AI 的政治環境。

Argon 是什麼

Google 將 Gemini 4 Argon 描述為「為了在複雜、長程工作流程中維持深度推理而打造」的旗艦模型。圍繞三大支柱的定位——真實世界的軟體工程、法律與金融等企業知識工作、以及資安防禦——標示出清晰的戰略押注:Argon 瞄準的不是聊天機器人式的問答,而是需要人類團隊花費數小時甚至數天、且能產出可衡量經濟價值的持續性專業工作。

頭號技術規格是輸出 token 上限。Argon 將上限從先前的 64K token 大幅擴展到業界領先的 100 萬 token。這個數字比表面看起來更重要:當模型能在單一推理軌跡中生成數十萬 token,它就能真正嘗試長程任務——大規模程式碼庫遷移、端到端資安稽核、深度多文件法律分析——而不會被今天破壞 Agent 工作流的上下文切換與狀態遺失所中斷。它把「推理預算」從一份點心變成了自助餐。

定價方面,Argon 未來進入 API 時將極具侵略性: introductory 價格為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入再打 95 折。這大幅低於 OpenAI GPT-5.5 的定價($5/$30),顯示 Google 打算在「單位任務成本」上與基準分數雙線作戰。

數字會說話

根據 VentureBeat 的分析,在 Google 公布的 18 項基準測試中,Argon 有 12 項 outright 領先、1 項並列第一,而 GPT-6 Astra 僅 3 項領先、1 項並列。重點包括:

  • DeepSWE v1.1:77.9%——在衡量真實世界長程軟體工程任務的基準上創下新紀錄,而這正是 AI 預期產生最直接經濟效益的領域。
  • Vals Index:領先——該指數衡量金融、程式、法律與稅務工作的經濟影響力,各領域按其對美國 GDP 的貢獻加權。Argon 是榜首,在 Vals Finance Agent v2(多步驟金融研究)與 Harvey 的 Legal Agent Benchmark(法律研究與起草)上也同樣領先。
  • AutomationBench:51.3%,排名第一——Zapier 用來衡量跨核心業務功能端到端執行能力的基準。
  • LVBench:91.7%——長影片理解的最新紀錄,反映 Argon 在知識工作需要視覺理解時的強項。
  • CWE-bench v1:68%,並列第一——修補資安漏洞的能力,延續 3.8 Flash Cyber 在 CWE-bench v0 的表現。
  • Gray Swan IPI:攻擊成功率僅 0.7%——在間接提示注入防護上領先群雄,這對 Agent 部署是關鍵防線(最接近的對手為 1.0%)。

The New Stack 的早期評測提供了平衡觀點:Argon 在知識工作上的領先是決定性的,但部分程式能力指標相對 OpenAI 與 Anthropic「表現不一」。DeepSWE 的 77.9% 固然是紀錄,但幾天前流出的「Gemini 4 Pro」分數(DeepSWE 88.7%)暗示 Google 可能保留了完整能力版本——或者那些數字根本不是真的。

Argon 在 Google 內部的工作實績

發布內容中最引人注目的,是 Argon 已經在 Google 內部做的事:

  • 量子運算:Argon 協助研究人員優化瓶頸子程式的時空資源(qubits × gates)。在一個案例中,它在幾分鐘內將公開基準改善了 40%。
  • 資料中心效率:一組 Argon agent 分析全艦隊的效能遙測數據,自主識別並套用記憶體優化,為 Google 資料中心釋出超過 300 TiB 記憶體,估計總節省可達 500 TiB 至 1 PiB。
  • Rust 遷移:Argon agent 正在將 C/C++ 程式碼庫遷移到 Rust——從 re2、libgav1 等核心函式庫的數萬行,到 Fuchsia Zircon 核心(kernel)的 80 萬行以上。以 libgav1 為例,agent 透過多輪效能導向實驗取代了 3.2 萬行 SIMD 程式碼,產出的記憶體安全影片解碼器比原 Rust 版快 2.7 倍,且輸出完全一致。

這些不是行銷 demo,而是有可稽核結果的基礎設施級部署。100 萬 token 的輸出上限,正是讓這種單軌跡重寫成為可能的關鍵。

為什麼資安防禦者先用

Argon 的首批外部使用者是 Google「Fairwind 計畫」中的受信任資安防禦者——這是 9 月初宣布的倡議,旨在讓防禦者使用先進的 Gemini 模型自主尋找並修補漏洞。對這群人、以及 Google 內部團隊,Argon 將以無資安護欄的形式提供,解鎖其完整的旗艦級防禦能力。

早期的實證很具體:Wiz 已在其免費保護關鍵公共基礎設施的 Scan for Good 計畫中使用 Argon。在一次早期部署中,模型發現了一個在全球醫院使用的醫療軟體中暴露敏感個人資料的嚴重漏洞——這是先前旗艦模型都錯過的重大風險。在 Wiz 內部的黑箱滲透測試基準上,Argon 在發現攻擊面、識別漏洞、產生概念驗證證據等方面都超越了 3.8 Flash Cyber。

這種「防禦優先」的推出順序,扭轉了 AI 資安常見的攻擊敘事。Google 不是在問「這個模型能破壞什麼」,而是在展示它能保護什麼——並在全面發布前建立公眾信任。

安全護欄與分階段推出

Google 明確表示「安全地發布這個等級的旗艦能力需要分階段進行」,並指出該公司「正積極參與美國政府的自願性發布前模型存取程序」。這句話將 Argon 与白宮今年建立的治理框架連結起來——在缺乏強制法規的情況下,各前沿實驗室已採用這條自願性的發布前審查管道。

伴隨發布的是四大安全支柱:拒絕有害的資安與 CBRN(化生放核)請求、同時保留合法的雙用途研究(依據 Frontier Safety Framework),並以內部激活監測技術偵測濫用;透過自動化紅隊與對抗訓練,取得領先的提示注入防護;監測 chain-of-thought 與行動、在模型超出使用者意圖時中止執行;以及為高風險評估強化隔離封裝的沙箱環境,遵循 Google 的 agent 控制路線圖。值得注意的是,Google 在訓練過程中也使用了類似的監測系統,並公開呼籲業界在「能力急遽提升的關鍵時刻」維護推理透明度。

意義何在

有三個觀察特別突出。第一,基準測試的領先地位確實輪回到 Google——至少在 OpenAI 或 Anthropic 出招之前——而在 Vals Index 這類以經濟權重的評估上的領先幅度,讓這個宣稱具體而非空洞。第二,100 萬 token 的輸出視窗改變了 Agent 工作的解剖學:過去需要協調框架拼接的任務,現在可以做為單一軌跡執行。第三,發布策略本身就是故事中的故事。透過 Fairwind、政府發布前參與、以及付費 API 優先的擴展順序,Google 實質上把旗艦能力當成管制物質對待——讓「最強大的模型安靜地、在監督下、發布給經審核的使用者」成為常態。

對開發者、企業與一般使用者,Argon「很快」就會到來,從付費 API 客戶與 Google AI Ultra 訂戶開始。到時候,$2/$10 的定價將對整個產業的前沿定價表施加立即壓力。在那之前,我們其他人只能在玻璃窗外看著——一個能思考一百萬 token 的模型,正在醫院軟體、量子子程式與 Google 自己的核心(kernel)上工作。