← All posts / Models

Google Gemini 3.7 Flash:以半價提供接近前沿的程式碼能力

距離 3.6 Flash 僅三週,Google 就推出 Gemini 3.7 Flash——專為程式開發與 Agent 而生的主力模型,DeepSWE 從 49% 躍升至 65.3%、FrontierCode 從 34.4% 升至 43.6%,入門價卻只有前代的一半。

Google Gemini 3.7 Flash:以半價提供接近前沿的程式碼能力

三週。這是 Google 從發布 Gemini 3.6 Flash 到推出後繼版本之間隔的時間。2026 年 8 月 13 日,Gemini 團隊正式介紹 Gemini 3.7 Flash,官方形容它是「迄今最聰明的主力工作馬模型(workhorse model),專為程式開發與 Agent 而生」。單看這個更新節奏,就能看出前沿競爭的主戰場已經轉移:不再是每年一次的旗艦發布,而是快速迭代的中階模型,悄悄追平旗艦效能,同時在價格上全面碾壓對手。

訴求很直接:Gemini 3.7 Flash 在軟體工程、知識工作與網頁開發流程上都有大幅進步,而且以「3.6 Flash 原始每百萬 token 成本一半」的入門價上市。對正在打造正式環境 Agent 的開發者來說,這種「快速改版的工作馬模型 + 積極定價」的組合,正是当前多數實際 AI 工作發生的區間。

關鍵基準測試數字

核心數據完全落在 Google 宣稱的定位上。在正式環境的程式任務方面,3.7 Flash 相較前代有顯著躍進:

  • FrontierCode 1.1 Main:43.6%(3.6 Flash 為 34.4%)——衡量生成可直接上線的正式程式碼能力
  • DeepSWE v1.1:65.3%(3.6 Flash 為 49.0%)——真實世界軟體工程任務上大幅提升 16.3 個百分點
  • WebDev Arena(Arena.ai):1588 Elo(3.6 Flash 為 1538)——用更少的提示次數生成可用的版面與功能完整的應用

DeepSWE 這個數字特別值得注意。從 49% 到 65.3% 並不是小幅打磨,而是通常伴隨全新模型家族才會出現的世代跨越,而非三週內的點版本更新。獨立追蹤數據顯示,該模型在 SWE-bench Verified 上約為 74.4%,足以與貴上許多的模型競爭——發布以來社群討論也多次指出,3.7 Flash 在軟體工程任務上超越了部分旗艦級對手。

不只寫程式:文件處理與商業流程

進步不僅限於程式碼,也延伸到知識密集領域——金融、法律、生物科學——模型在複雜文件上展現更強的推理與準確度:

  • GDP.pdf 基準:34.0%(3.6 Flash 為 22.0%)——測試處理複雜知識密集文件的能力
  • AutomationBench:30.4%(3.6 Flash 為 17.0%)——完成真實商業工作流程的能力接近翻倍

AutomationBench 的結果可以說是這次發布中商業意義最大的數字。企業在 AI 上真正花錢的地方就是商業流程自動化,而在這個領域效能近乎翻倍、又只收工作馬等級的價格,讓 3.7 Flash 成為過去必須動用旗艦模型才能支撐的 Agent 工作負載的有力選項。

定價:積極,而且明講是限時的

Gemini 3.7 Flash 到年底前提供入門價:每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元——是 3.6 Flash 上市價的一半。但有一點必須用粗體強調:入門價將於 2026 年 12 月 31 日截止。2027 年 1 月 1 日起,價格翻倍為輸入 1.50 美元、輸出 7.50 美元。

這種結構看起來就是一套獲客策略——先讓開發者用 3.7 Flash 建置起來、把工作流依賴鎖進去,明年再讓調漲後的價格變成常態。這也呼應了 2026 年中階模型的全面價格戰:Google、OpenAI、Anthropic,以及 MiniMax、DeepSeek 等挑戰者,都在搶當正式環境 Agent 裡的預設引擎。

開發者體驗:紀律重於炫技

除了分數,Google 特別強調日常 Agent 運作中真正重要的行為改進。3.7 Flash「更能適應阻礙、必要時主動釐清意圖、更忠實地遵循指令」,在多步驟規劃與工具呼叫上更用心、執行更有紀律——意味著在工程流程中需要的人工監督更少、重試次數更少。

任何在正式環境跑過程式 Agent 的人都知道失敗模式長什麼樣子:Agent 做到一半就偏離、亂逛,或者默默跳過某個步驟。執行紀律是 demo 與正式部署之間的分水嶺,也是工作馬模型過去落後旗艦的地方。Google 的示範素材也圍繞這點:單一文字提示生成完整可玩的 3D 遊戲、透過 Nano Banana 整合即時生成角色、靜態 PDF 轉成帶動態圖表的互動資料故事,以及用 3.7 Flash 的多模態理解在多 Agent 迴圈中訓練機器人。

Spark、安全與可用性

Gemini Spark——開放給 160 多國 Google AI Pro 與 Ultra 訂閱者的 24/7 個人 Agent——即日起改用 3.7 Flash,為 Google Workspace 帶來更好的工具使用能力:整合檔案、起草郵件、更新狀態文件等複雜多技能流程。

安全方面,3.7 Flash 隨附更新的 Frontier Safety 防護,針對化學、生物、放射、核武(CBRN)與網路攻擊等濫用領域強化防線,與 Google 的生物韌性計畫和網安計畫保持一致。

可用性涵蓋 Google 全線產品:透過 Google AI Studio、Android Studio 的 Gemini API,以及主打 Agent 優先工作流的 Google Antigravity;企業可透過 Gemini Enterprise Agent Platform 與 Gemini Enterprise 應用;個人用戶則透過 Gemini 應用中的 Spark 使用。

大局觀

Gemini 3.7 Flash 具體呈現了 2026 年模型市場的決定性動態:中階正在吞噬前沿。當一個定價每百萬輸入 0.75 美元的工作馬模型,能在 DeepSWE 拿下 65.3%、在文件推理上超越前代旗艦時,每個工程團隊要問的問題就從「我們需要哪個旗艦模型?」變成「能不能改用 Flash 等級的價格就出貨?」

對 Google 來說,從 3.6 到 3.7 僅僅三週的間隔,也展示了對手無法忽視的組織速度。官方將這種速度歸功於開發者回饋與「未來模型都會採用的演算法創新」——暗示這種節奏將成為新常態,而非一次性衝刺。隨著入門價在年底到期,開發者有大約四個月的時間可以評估、整合、鎖定 Agent 架構,然後經濟格局就會改變。

這匹工作馬剛剛變強了一大截。而它依然是便宜的那個。