防禦者優享、無網安護欄:Google Gemini 4 Argon 登場,百萬 token 輸出與一枚醫療軟體漏洞作為見面禮
Google 新一代前沿模型 Gemini 4 Argon 以業界首見的 100 萬 token 輸出上限與頂級的代理式程式開發、網路防禦能力問世——首波不對一般大眾開放,而是透過 Fairwind 計畫交給經審核的資安防禦者,且刻意移除網安護欄。
9 月 30 日,Google DeepMind 發表了新一代前沿模型 Gemini 4 Argon——然後做了一件不寻常的事:它沒有在第一天就把模型推向數以億計的消費者,而是透過 Fairwind 計畫,把模型交給一群經過審核的網路安全防禦者,而且刻意移除了網安護欄。這個決定傳達了兩層訊息。第一,Argon 是 Google 對「真實世界軟體工程、企業知識工作與網路防禦」前沿地位的宣示。第二,在 AI 發現的漏洞可在一天內被武器化的年代,Google 選擇讓「能自主尋找、驗證並修補重大漏洞的模型」的第一批使用者是防禦方,而非所有人。
Argon 是什麼
Argon 是 Gemini 4 世代的第一個模型,由 Google DeepMind SVP 兼 Google 首席 AI 架構師 Koray Kavukcuoglu 宣布。它的設計目標是長時程工作:那些橫跨數千個步驟才會收斂的深度任務——遷移一個程式碼庫、跑完一條金融研究管線、清算一整個攻擊面。為了支撐這種推理,Google 把模型的輸出 token 上限一口氣擴充到業界最高的每回應 100 萬 token,是過往 Gemini 世代 64K 的逾 15 倍。當模型有餘裕在單一軌跡中思考並生成數十萬 token,它就能一次吃完難題,而不是把問題碎片化到多個工作階段。
定價方面,上市初期為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入打 95% 折扣;優惠期結束後回到定價每百萬輸入 4 美元、輸出 20 美元。獨立追蹤者的估算顯示,Argon 在 Intelligence Index 上每任務的混合成本約 1.99 美元,相對 OpenAI GPT-6 Astra 的 3.26 美元——如果分數在正式環境站得住腳,這是很實在的效率差距。
Google 公布的數字
對比 GPT-6 Astra 與 Anthropic Claude Opus 5.5,Google 報告 Argon 在公開的 18–19 項基準中領先 12–13 項,幾個亮點包括:
- DeepSWE v1.1:77.9%——真實世界長時程軟體工程的新紀錄,領先 Opus 5.5 的 74.2%。
- LVBench:91.7%——長影片理解的最新水準,反映對長時間內容的視覺推理能力。
- AutomationBench:51.3%、排名第一——Zapier 用來衡量跨核心業務功能端到端執行的基準。
- Vals Index——衡量金融、程式開發、法律與稅務工作經濟影響、按美國 GDP 權重加權的指數,Argon 為領先模型;在多步驟金融研究的 Vals Finance Agent v2 與 Harvey 法律代理基準上同樣領先。
- 網路安全——在評估漏洞修補的 CWE-bench v1 上以 68% 並列第一;內部評測則大幅超越 Gemini 3.8 Flash Cyber:漏洞發現 85.8% 對 71.0%,滲透測試 70.9% 對 58.2%。
但局面並非一面倒。獨立分析與社群拆解指出,GPT-6 Astra 在 FrontierSWE v2 與 Terminal-Bench Science 上仍然勝出,兩者在 CWE-bench 打平;在 Artificial Analysis 的綜合智慧指數上,Argon(High)拿到 52.6 分,與 Astra 的 52.7 分在統計上不分軒輊,部分項目還略落後 Claude Opus 5.5。Bloomberg 報導也有 Google 內部員工對基準分數能否轉化為實際工作表達疑慮。用 Google 自己的話說,Argon 的優勢在專業化:長時程專業工作與防禦,而不是全面稱霸。
已經在改變 Google 的建造方式
整份公告中最具體的,是 Argon 代理如今在 Google 內部已經在做的事——因為這些是 production 數字,不是願景簡報:
- 量子運算:Argon 協助研究人員優化瓶頸應用的量子子常式的時空資源(qubits × gates)。其中一例在幾分鐘內就把已發表的基線改善了 40%。
- 資料中心效率:一組 Argon 代理分析了全機隊的效能遙測,自主在 Google 資料中心套用記憶體優化,釋出超過 300 TiB 記憶體,估計總節省可達 500 TiB 至 1 PiB。
- 大規模 Rust 遷移:Argon 代理正在把 Google 內部的 C/C++ 遷移到 Rust——從 re2、libgav1 等核心函式庫的數萬行,到 Fuchsia Zircon 核心 80 萬行以上,一切都要經過嚴格的自動與人工審計才會上線。以 libgav1 為例,Argon 代理透過多輪效能導向實驗,改寫了既有 Rust 移植版中 3.2 萬行 SIMD 程式碼,產生能讓編譯器自動向量化的安全 Rust——最終得到一個比原移植版快 2.7 倍、輸出完全相同的記憶體安全視訊解碼器。
為什麼先給 Fairwind
「先發放給信任的防禦者、而且不掛網安護欄」是這次發布的策略核心。對經審核的防禦者與 Google 內部團隊,模型的前沿網安能力完整解鎖。Wiz 已在其 Scan for Good 計畫中使用 Argon,免費為關鍵公共基礎設施尋找並修復高風險暴露。
Google 選擇高舉的實證是:在早期部署中,Argon 發現了一個暴露敏感個人資訊的重大漏洞,存在於全球醫院使用的醫療軟體中——而先前幾代前沿模型都漏掉了這個嚴重風險。很難不把這件事讀成對當下時局的直接回應:就在幾天前,OpenAI 才披露阻止了一場針對其模型的協同蒸餾攻擊,而一個由 AI 發現的 Rejetto HFS 漏洞,據報在發現後一天內就被用於實際攻擊。前沿等級的攻擊能力如今已是環境背景雜訊;Google 的答案是把防禦那一側先武裝起來。
Google 同時也在與美國政府自願性的「發布前模型存取」程序合作,逐步擴大可用範圍——對於追蹤白宮備忘錄後續框架實際運作的人,這是個值得注意的數據點。
全面開放前的護欄工程
在 Argon 面向大眾之前,Google 表示正在強化四類前沿護欄:
- 濫用防護——拒絕有害的網攻與 CBRN(化生放核)請求,同時保留正當的雙用途研究;並改善監測模型內部激活以偵測濫用的技術,經內外部紅隊以人工與自動化攻擊手法測試。
- 提示注入防護——透過自動化紅隊與對抗訓練,Argon 在 Gray Swan 的間接提示注入(IPI)基準上領先,是 Google 迄今對間接注入最有韌性的模型。
- 失準監測——部署監控 Argon 思維鏈與行動的系統,當模型超出使用者意圖時中止執行。值得注意的是,Google 明確呼籲業界在「能力躍升的關鍵時刻」維持推理透明度——在隱藏推理軌跡的爭論中,這是個低調但立場鮮明的表態。
- 強化沙箱——在高風險訓練或評測開始前隔離並密封環境,與其代理控制路線圖一致,相關實務將與夥伴共享。
接下來呢
更廣的可用性會「盡快」到來,從付費 API 客戶與 Google AI Ultra 訂閱者開始,讓早期測試者先把護欄磨硬。優惠定價也自公開上市時生效。
對前沿競賽而言,Argon 用兩種方式重新框定了 2026 年的競爭。它把輸出容量——那條 100 萬 token 的軌跡——變成頭條級能力而非註腳,賭的是長時程代理能力的勝負手在「持續生成」而不只是基準分數。它也把「誰先拿到模型」變成一項安全決策:先給防禦者、再給開發者;先審核、再放量。這道閘門式發布究竟是審慎還是表演,完全取決於後續開放的速度——以及 Argon 這類模型找到醫療軟體漏洞的速度,是否快過對手找到利用它們的方法。
本文綜合 Google 官方公告、資安媒體報導與獨立基準分析(見上方來源連結)。
Sources
- [1] https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- [2] https://thehackernews.com/2026/10/google-rolls-out-gemini-4-argon-to.html
- [3] https://www.cnbc.com/2026/09/30/google-gemini-4-argon-ai.html
- [4] https://www.helpnetsecurity.com/2026/10/01/google-gemini-4-argon/