Google Gemini 3.7 Flash:為代理時代而生、價格砍半的工作馬模型
距離 3.6 Flash 僅三週,Google 推出 Gemini 3.7 Flash:程式碼能力大幅躍進、代理任務跑出 SOTA,輸入價格更砍至每百萬 token 僅 0.75 美元。
三週。這是 Google 從發表 Gemini 3.6 Flash 到推出後繼版本 Gemini 3.7 Flash 之間所花的全部時間——這個被官方稱為「迄今最聰明的工作馬模型(most intelligent workhorse model yet)」的新模型,於 2026 年 8 月 13 日問世,主打程式開發與 AI 代理(agents)。這次發表不太像是例行的版本迭代,更像一份宣戰書:在 2026 年的 AI 經濟裡,中階模型才是真正的戰場,而願意最快砍價、同時讓分數持續攀升的公司,才能拿下這塊市場。
這次發表了什麼
Gemini 3.7 Flash 是原生多模態推理模型,支援文字、影像、音訊、影片與 PDF 輸入,具備 100 萬 token 上下文窗口,回應延遲針對代理式工作流最佳化。它位於 Google 的 Flash 產品線:原始能力上限低於旗艦級 Gemini 3.7 Pro,但它的設計目標是成為開發者在實際生產環境中最常呼叫的模型——因為在每一次工具呼叫都會累積成本與延遲的場景裡,效率才是王道。
模型現已透過 Gemini API、Google AI Studio 與 Vertex AI 開放使用,影像生成等更多功能則列為「即將推出」。
真正關鍵的數字
以下是重點基準測試成績,以及 3.7 Flash 相較那個「只有三週大」前代的提升幅度:
- FrontierCode 1.1 Main:43.6%,相較 3.6 Flash 的 34.4% 大幅躍進。更值得注意的是,這個分數同時超越了 Claude Sonnet 5 的 42.7% 與 GPT-5.6 Terra 的 41.3%——一款中階 Flash 模型,在程式碼能力上贏過了對手的旗艦級模型。
- SWE-bench Verified:約 78%(代理式軟體工程),略高於 Gemini 3 Pro——這是在真實儲存庫上修 issue,不是解題遊戲。
- DeepSWE:約 65% 通過率,平均每項任務成本不到 1.5 美元,Google 強調這在成本效益上大幅超越過往的水準。
- Google 官方宣布在 LiveCodeBench、AIME、GPQA 與長上下文等基準測試上,於 Flash 級距中締造 SOTA(現有最佳)成績。
- 實際代理流量中觀察到 提示快取命中率提升 8%,且工具呼叫錯誤減少。
那個快取數字值得比平常更多的關注。在代理式工作負載中,相同的上下文——系統提示、工具定義、程式碼骨架——會在每一步重複發送。更高的快取命中率與更便宜的輸入價格會複利疊加,徹底改寫長時間運行代理的單位經濟學,而這正是 Google 說這個模型為之而生的場景。
價格砍半
這次發表最激進的部分在商業面。至 2026 年底前,Gemini 3.7 Flash 提供優惠價:每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元——正好是 3.6 Flash 七月底上市價(1.50/7.50 美元)的一半。明年一月起將回歸標準價 1.50/7.50 美元。
這一步棋很明顯是要搶市占。DeepSeek 的 V4-Flash 憑藉價格效能比霸榜全球使用量排名,OpenAI 也透過與 Cerebras 的合作全面壓低延遲。Google 的回應,是讓自家工作馬模型便宜到「難以拿來做同級比較」——至少到 12 月底截止日前是如此。這個期限同時也是一枚遷移誘餌:現在用優惠價把代理架構建好,等價格恢復正常時,你已經被生態系鎖住了。
不只看分數:開發者體驗
Google 這次也特別強調質性層面的改進:3.7 Flash「更能適應阻礙、面對模糊需求時會主動釐清意圖」,並能產出更接近生產品質的初版程式碼。Reddit 上的早期開發者回饋少見地一面倒——「它快、犀利,處理細微語意的能力比之前的版本好太多」是頗具代表性的說法。使用者心得固然不能取代評測,但對一個要被塞進數百萬次工具呼叫迴圈裡的模型而言,「會主動釐清意圖」與「自信满满地幻覺」之間的差異,就是產品的全部。
實際場景的驗證則來自已在使用的客戶:語音 AI 公司 Vapi 共同創辦人兼 CTO Gregor Zunic 回報,「Gemini 3.7 Flash 代理比 3.6 Flash 便宜 35%,提示快取命中率提升 8%,工具錯誤也更少」——難得有具名生產環境用戶在發表資料中直接量化節省幅度。
脈絡:節奏戰爭
3.6 Flash 與 3.7 Flash 之間的三週間隔,本身就是新聞。Google 已經在同一季內多次更新 Flash 產品線,而每一次發表都在縮小「中階」與「前沿」之間的差距。當一款 Flash 模型能在 FrontierCode 上超越 Anthropic 與 OpenAI 的旗艦模型,傳統的產品分級——Pro 拼能力、Flash 拼成本——開始變得模糊。對買家而言,這意味著選模型正在從「承諾」變成「路由決策」,而供應商的定價策略也隨之起舞。
競爭背景同樣重要。這是 Google 自 DeepMind 領導層大改組(Demis Hassabis 轉任董事長、Koray Kavukcuoglu 接掌)以來,首個重要的模型發表。在高層動盪三週後就交付一款便宜、快速、夠強的工作馬模型,等於宣告「實驗室即工廠」的營運模式安然挺過了組織重整。
後續觀察
兩個懸念伴隨這次發表而來。第一,基準分數的領先能否守得住——對 Claude Sonnet 5 的 FrontierCode 領先幅度不到一個百分點,完全在重新評測的誤差範圍內,而且現在對手們每週都在更新。第二,明年一月優惠價到期後會發生什麼事:建立在 0.75 美元輸入價之上的代理系統將面臨成本翻倍,而 Google 顯然賭的是轉換成本會讓大家留下來。
對開發者來說,結論很簡單:如果你正在跑程式碼代理或工具呼叫迴圈,而且付的是旗艦級價格,現在多了一個成本砍半、分數卻證明它不是妥協的工作馬選項。至少到 12 月 31 日為止,最便宜的聰明選擇,同時也是最明智的那一個。
Sources
- [1] https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- [2] https://deepmind.google/models/gemini/flash/
- [3] https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
- [4] https://venturebeat.com/technology/googles-gemini-3-7-flash-targets-coding-and-agents-with-a-50-introductory-price-cut
- [5] https://the-decoder.com/gemini-3-7-flash-lands-with-coding-gains-and-undercuts-its-three-week-old-predecessors-price-by-50/
- [6] https://www.datacamp.com/blog/gemini-3-7-flash
- [7] https://openrouter.ai/google/gemini-3.7-flash
- [8] https://deepmind.google/models/model-cards/gemini-3-7-flash/