Google 推出 Gemini 3.7 Flash:專為程式開發與 Agent 而生的省錢工作馬
距離 3.6 Flash 僅三週,Google 的 Gemini 3.7 Flash 以每百萬輸入 token 0.75 美元的優惠價帶來大幅編碼與 Agent 升級,但背後更大的故事是 Google 的執行力競賽。
三週。這是 Google 從發布 Gemini 3.6 Flash 到推出後繼版本 Gemini 3.7 Flash 之間的全部時間。這款於 2026 年 8 月 13 日上線的新模型,被 Google 稱為「迄今最聰明的編碼與 Agent 工作馬(workhorse)」。Google 表示,這種罕見的短週期來自開發者回饋與演算法創新,也透露出一個重要訊息:Gemini 團隊的改進不再需要等待下一代旗艦模型才能上路。
但這次發布也正值 Google 的尷尬時刻。延宕多時的 Gemini 3.5 Pro 依然沒有明確的上市日期,DeepMind 剛經歷一場大規模領導層重組,競爭對手在高階基準測試上持續領先。因此 Gemini 3.7 Flash 既是一次實實在在的模型升級,也是對「快速迭代策略能否彌補旗艦缺席」的一場考驗。
編碼與 Agent 能力大幅躍進
核心數字相當有說服力。在衡量生產級程式碼品質的 FrontierCode 1.1 Main 基準上,Gemini 3.7 Flash 拿下 43.6%,大幅超越 Gemini 3.6 Flash 的 34.4%——而且值得注意的是,略高於 Google 表列中 Anthropic Claude Sonnet 5 的 42.7% 與 OpenAI GPT-5.6 Terra 的 41.3%。在長時程軟體工程評測 DeepSWE v1.1 上,新版 Flash 達到 65.3%(前代為 49.0%),不過 GPT-5.6 Terra 在此項仍以 69.6% 領先。
網頁開發是進步最明顯的領域之一。Gemini 3.7 Flash 在 Arena 的 WebDev Arena 上取得 1588 的 Elo 分數,高於 3.6 Flash 的 1538、Claude Sonnet 5 的 1541,以及 GPT-5.6 Terra 的 1523。Google 表示,新模型能用更少的提示次數生成功能更完整的版面與應用程式,並且無論參考來源是截圖、圖片還是整套設計系統,都能高度貼合設計要求。
在知識密集領域,進步同樣顯著。在與金融、法律、生物科學相關的複雜文件理解評測 GDP.pdf 上,3.7 Flash 拿到 34.0%(前代 22.0%),在 Google 的比較表中也勝過 Claude Sonnet 5(28.0%)與 GPT-5.6 Terra(24.7%)。在衡量真實企業流程自動化的 AutomationBench 上,分數從 17.0% 躍升至 30.4%,同樣領先 Claude Sonnet 5(10.7%)與 GPT-5.6 Terra(23.6%)。
Google 自己的成績單裡有誠實的保留
值得肯定的是,Google 的基準表並未宣稱全面獲勝。在 Terminal-bench 2.1 上,3.7 Flash 得分 85.8%,而 GPT-5.6 Terra 以 87.4% 領先;Terra 在 Terminal-bench 3.0 與 OSWorld-2.0 上也居首。Claude Sonnet 5 在 Agent’s Last Exam 的多模態桌面任務中以 33.3% 奪冠,新版 Flash 為 26.3%。在 Artificial Analysis 的智慧指數上,3.7 Flash 得分 56——較 3.6 Flash 的 52 穩步提升,但與 Claude Opus 5 的 63 仍有明顯差距。
整體圖像很清楚:這是一款在編碼與 Agent 工作負載上大幅拉近差距、同時價格低得多的模型,而非在所有項目上取代高階競品的全面王者。
價格成為競爭武器
優惠期的經濟學非常激進。到 2026 年 12 月 31 日為止,Gemini 3.7 Flash 的價格為每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元——是 3.6 Flash 標準價的一半;2027 年 1 月 1 日起將恢復為 1.50 美元與 7.50 美元。優惠期間 context caching 為每百萬 token 0.075 美元。相較之下,Claude Sonnet 5 為 2/10 美元,GPT-5.6 Terra 為 2/12 美元,差距進一步拉大。
對 Agent 工作負載而言,這比單純的 token 價格更重要。一個使用者請求可能觸發一長串的模型呼叫、推理 token 與工具操作,因此真正決定部署是否划算的指標是「每完成一項任務的成本」,而非每百萬 token 的單價。Google 的賭注是:更高的首次通過率加上更便宜的 token,等於更便宜的最終產出。DeepMind 引述的早期客戶回報指出,3.7 Flash Agent 比 3.6 便宜了 35%。
不只是答得更對,還要執行得更穩
除了基準分數,Google 特別強調降低營運摩擦的行為改進:模型遇到阻礙時會調整策略、指令模糊時會主動釐清意圖,並且更忠實地遵循指示。它「思考得更勤奮」,會投入更多心力在多步驟規劃與工具呼叫上——實務上意味著更少的重試次數與更少的人工介入。
相較於 3.6 Flash 強調「減少」推理步驟與工具呼叫以避免執行迴圈失控,3.7 的重點轉為在規劃上投入足夠心力、同時提升執行品質——這可以說是比單純減少步驟更實用的最佳化方向。
新模型也同步升級了 Gemini Spark——Google 面向 AI Pro 與 Ultra 訂閱者、在超過 160 個國家提供的 24/7 個人助理——改善其在 Google Workspace 中的知識工作與工具使用能力,包括整合檔案、草擬郵件與更新狀態文件。同時出貨的還有針對 CBRN(化學、生物、放射、核)濫用與網路攻擊領域的 Frontier Safety 安全防護新措施。
揮之不去的問題:Gemini 3.5 Pro 在哪裡?
Flash 產品線的氣勢無法完全掩蓋 Google 的旗艦難題。原本在 5 月宣布、承諾 6 月推出的 Gemini 3.5 Pro,至今仍處於合作夥伴測試階段,本次發布也未給出任何時間表。路透社 7 月報導指出,該模型未能達成內部目標(尤其在編碼方面)而錯過時程,即使 Google 已開始訓練其口中「最有企心的模型」Gemini 4。Google 最近一款通用 Pro 模型仍是 2 月推出的 Gemini 3.1 Pro。
這波延宕與戲劇性的領導層改組時間重疊:DeepMind 共同創辦人 Demis Hassabis 轉任董事長並出任 Alphabet 首席科學家,前 DeepMind CTO Koray Kavukcuoglu 接掌部門並直接向 Sundar Pichai 匯報;Jeff Dean、Oriol Vinyals、Quoc Le 與 Sanjay Ghemawat 等研究大將則離職創辦新創 Discovery Loop。路透社報導,內部分歧、運算資源分配受限與官僚體制都是拖慢發布的原因。外部評價從 The Verge 的「組織修復」到 SemiAnalysis 更嚴厲的「Google 正把重心轉向利潤豐厚的 AI 雲端基礎設施、而非自家模型的前沿地位」不等。
結論
Gemini 3.7 Flash 現已全面上線:開發者可透過 Google AI Studio 與 Android Studio 中的 Gemini API、Antigravity 環境、Gemini Enterprise Agent Platform 使用,一般使用者則可透過 Spark 體驗。在明年 1 月標準價格恢復之前,開發者有數個月的半價時間,可以用自己的程式庫、提示詞與失敗模式來實測這款模型。
策略解讀很明確:在旗艦產品線理順之前,Google 正把 Flash 層級的速度與價格武器化。如果企業最終最在意的是「每完成任務的成本」,3.7 Flash 確實很有競爭力。而在新領導層手中開發的 Gemini 4 能否縮小高階差距,將是判斷這套快速迭代策略究竟是真正的優勢、還是更深層問題症狀的最終試煉。
Sources
- [1] https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- [2] https://venturebeat.com/technology/googles-gemini-3-7-flash-targets-coding-and-agents-with-a-50-introductory-price-cut
- [3] https://9to5google.com/2026/08/13/gemini-3-7-flash-launch/
- [4] https://arstechnica.com/ai/2026/08/google-announces-gemini-3-7-flash-just-three-weeks-after-previous-release/
- [5] https://www.reuters.com/business/google-gemini-launch-delayed-tech-falls-short-internal-goals-bloomberg-news-2026-07-16/
- [6] https://www.reuters.com/world/inside-google-executive-moves-that-led-its-big-ai-reshuffle-2026-08-12/