← All posts / Models

0.75 美元的前沿:Gemini 3.8 Flash 與 Cyber 孿生模型重寫能力的價格

Google 六週內第三度發布 Flash 級模型,以每百萬 token 0.75 美元提供前沿級的編碼與代理效能;而門禁管制的 Cyber 變體修補 Chrome 漏洞的正確率,是體型大它數倍的模型的 2.6 倍。

0.75 美元的前沿:Gemini 3.8 Flash 與 Cyber 孿生模型重寫能力的價格

2026 年 9 月 2 日,Google 在短短六週內推出第三個 Flash 級模型,同時提出了一個迄今最有力的論證:前沿級的能力,不再需要前沿級的價格。Gemini 3.8 Flash 由產品管理資深總監 Tulsee Doshi 與 Google DeepMind 的 Gemini 安全負責人 Raluca Ada Popa 共同宣布,是該公司「迄今最佳推理與編碼模型」,速度與成本卻與前代持平:每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元。

與它同時登場的,是更不尋常的孿生兄弟:Gemini 3.8 Flash Cyber——一個專攻網路安全的變體,具備前沿級的漏洞偵測與自動修補能力,但被鎖在一個名為 Fairwind 的新審核制計畫背後。這兩個發布合起來,勾勒出 2026 年整個產業日漸清晰的策略:壓縮發布週期、把通用智慧拆成領域調校的變體,並把工作馬模型定價壓低到足以成為代理艦隊(agent fleet)的預設底層。

發布節奏本身就是故事

六週、三個 Flash 發布。Gemini 3.6 Flash 於 7 月 21 日出貨;3.7 Flash 之後三週即是 3.8。以歷史標準衡量——中階模型改版曾是季度大事——這是節奏的改變,而不只是遞增。Google 明確將 3.8 Flash 定調為「延續 3.7 Flash 的氣勢」,而細節文字透露了公司能維持這種節奏的原因:兩個新版本「由相同的基礎智慧驅動」,並透過長時間運行的代理迴圈「遞迴地評估與精煉底層模型」。換言之,代理如今正實質參與訓練下一世代將運行它們的模型。

這種節奏也有防禦目的。OpenAI 的 GPT-6 Astra 於 9 月 3 日登場、Meta 的 Muse Spark 1.3 於 9 月 2 日出貨、Anthropic 的 Claude Fable 5.1 更早幾天——一家產業追蹤者形容,這是 72 小時內四場前沿發表會。在這場混戰中,「便宜但優秀」的模型,會在塵埃落定之前就被塞進生產環境。

3.8 Flash 實際交付了什麼

核心主張是 3.8 Flash「經常逼近更高成本前沿模型的表現」,而基準測試大致佐證了這點:

  • DeepSWE v1.1(長時程軟體工程):3.8 Flash 在端到端自主解決複雜工程問題上超越多數更大的前沿模型,且成本僅為零頭。
  • Terminal-Bench 2.1:90.8%,相較 3.7 Flash 的 81.6%——單一世代在最能反映實務的代理編碼評測上躍進九個百分點。
  • HLE-Verified:54.9%,展現橫跨 STEM、人文與專業領域的多步推理能力。
  • 專業代理:在 Vals Finance Agent V2 與 Harvey 的法律代理基準上,3.8 Flash 優於 3.7 Flash 與其他前沿模型——量化金融與法律,正是企業真正付錢的領域。

Google 對設計選擇的描述罕見地直白:「3.8 Flash 更努力工作。」面對複雜任務,它執行額外的推理步驟、反覆呼叫工具,在高投入等級下有時會消耗更多 token 來換取效能。運算受限的開發者可以把投入等級調低,或繼續使用仍完整支援的 3.7 Flash。模型配備 100 萬 token 上下文視窗,獨立測量顯示輸出速度約每秒 305 token、首 token 延遲約 0.78 秒——「Flash」之名依然名符其實。

定價本身值得單獨一段,因為它既是誘餌也是賣點。0.75/3.75 美元的費率是優惠價,2026 年 12 月 31 日到期。2027 年 1 月 1 日起,費率翻倍為每百萬 token 1.50/7.50 美元。任何圍繞今日經濟學設計代理艦隊的人,現在就該把翻倍建模進去——不過即使翻倍,輸入價仍比 Anthropic Claude Fable 5.1 的 10/50 美元低一個數量級。

Google 精選的展示也本身就說明了一切:在 Google Antigravity 裡用單一提示詞建出可完整遊玩的 DOS 版 Google Maps;一款用 Nano Banana 生成材質的 3D 法師城堡遊戲;互動式硬體拆解視覺化工具;基於美國地質調查所真實資料的地形探索器。這些都是代理式展示品——一年前的模型會在中途崩潰的多步驟長程建造。可用範圍首日即廣:開發者可透過 Gemini API 與 AI Studio,企業用 Gemini Enterprise,消費者則在 Gemini App、Google 搜尋的 AI 模式、甚至 Google 試算表中的 Gemini(AI Pro/Ultra 訂閱)使用。

Flash Cyber:門禁之後的能力

更具影響力的發布,也許是多數開發者永遠碰不到的那個。Gemini 3.8 Flash Cyber 專為防禦性安全工作調校——找漏洞、產生修補——僅透過新的 Fairwind 計畫提供給「受信任的防禦者」:政府機關、關鍵基礎設施營運者,以及申請通過的軟體維護者。

Google 公布的數字相當驚人:

  • 在自主漏洞發現的標準產業基準 CyberGym 上,Flash Cyber 超越前代 3.5 Flash Cyber 以及體型顯著更大的前沿模型。
  • 在橫跨 20 種程式語言、涵蓋多類漏洞的 Google 內部基準上,成功率超過 70%——這是大幅躍進,因為 CyberGym 偏重 C/C++,並不符合真實防禦需求。
  • 在 Collinear 主導的 CWE-Bench 自動修補測試上,pass@1 達 47.2%,對比某領先前沿模型的 47.8%——實質打平、成本低得多,落在帕累托前緣上。

接著是生產環境的收據。Chrome 安全團隊發現,Flash Cyber 對 Chrome 漏洞產生的正確修補數量,是體積大它數倍的最佳商業模型的 2.6 倍。Wiz 在其內部滲透測試基準上測得召回率高出 7.5–9.7%、成本低 2.3–5.2 倍。Google 的雲端漏洞研究團隊更用它在兩小時內找到一個關鍵的基礎漏洞——這類研究與發現通常需要數個月。

最後這個數據點,是整場發布會低調的頭條。過去耗費人類團隊數月的漏洞研究,如今對門內的組織而言,只是一次兩小時的模型運行。這種不對稱是雙刃的:同樣的能力若落入錯的手中,也會壓縮攻擊者的時程——這正是 Google 在此反轉一貫安全姿態的原因。Flash Cyber 出廠時帶著比基礎模型更寬鬆的網路安全防護,而這份寬鬆,正是它只提供給審核通過的防禦者、而不在開放 API 上販售的理由。

安全、穩健性,以及這一切意味著什麼

基礎版 3.8 Flash 依 Google 的前沿安全框架,內建針對 CBRN(化學、生物、放射、核)與網路攻擊濫用的防護,且 Google 表示在 Gray Swan 量測下「提示注入穩健性顯著躍進」——隨著代理艦隊逐月擴張,這個指標越來越重要。

策略解讀很直接。Google 已不再競爭「最大模型」的頭條,而是競爭預設基礎設施層:便宜到可以無所不在地嵌入、快到能支撐互動式代理、在長時程編碼上可靠到能交付真正的工作,再加上一個門禁制的超強變體作為國安圈的招牌。六週內第三個 Flash 發布不是衝刺,而是節拍器——而它敲出的節拍是:每 token 的能力,正持續變便宜。

對開發者而言,計算很具體:如果你的工作負載是代理編碼、文件密集分析或工具編排,優惠價的 3.8 Flash 如今是市場上最強的成本效益點之一——附帶一條已知的價格懸崖,日期是 1 月 1 日。對資安界而言,Fairwind 門內的 Chrome 修補成果,預演了一個未來:稀缺的資源將不再是漏洞發現本身,而是修補模型所找到問題的組織意志。