Google 今日揭曉 Gemini 3.8 Flash:代號「skimaki」的精煉之作,劍指 Claude Fable 5
Google DeepMind 於 9 月 2 日公開 Gemini 3.8 Flash——這個歷經 Jetski 內部實測的「skimaki」版本砍掉冗長輸出,以十分之一的價格挑戰 Claude Fable 5 的編程王座。
2026 年 9 月 2 日是 Gemini 3.8 Flash 的揭曉日。根據多個追蹤 Google DeepMind 近乎每月出貨節奏的報導,該公司計畫在這個星期三公開發表新模型——距離 8 月 13 日 Gemini 3.7 Flash 推出僅僅三週。這次發表並非憑空出現的傳聞:這個內部代號為 「skimaki」 的版本,整個 8 月都在 Google 內部的 Jetski 編程平台上進行實測,並已完成正式環境部署。今天登場的是一個經過考驗、打磨過的精煉版本——而不是一張空頭支票。
3.8 Flash 到底新在哪裡
早期測試者的回饋指向一個結論:Gemini 3.8 Flash 是「精煉」而非「革命」,而這個定位正是理解 Google 策略的關鍵。主要改進集中在減少冗長輸出——這是 Flash 系列長期為人詬病的缺陷。任何在快速 tier 模型上搭建過正式環境管線的人都懂這種痛:你只要求模型修一個函式,它卻回傳一大段解釋、重複脈絡加上各種但書,而每一個 token 都要計費。據報導,這個版本也修正了 3.7 Flash 公開推出後被發現的若干特定問題。
這次發表的背景是一個不斷壓縮、持續加速的迭代週期。Gemini 3.6 Flash 於 2026 年 7 月 21 日上線;Gemini 3.7 Flash 在 8 月 13 日跟進——間隔 23 天。Business Insider 於 8 月 27 日報導,員工已經在 Jetski 上執行「Gemini 3.8 Flash Preview」,距離 3.7 Flash 正式上線只有 14 天。一名測試過該模型的員工告訴該媒體,它「已經明顯比 3.7 Flash 更好用」,但也強調現在要做完整評測還太早。執行長 Sundar Pichai 已表明 Google 的目標是約每月一款新模型,而 Flash 產品線正是這個節奏的主要載體。
基準線:3.7 Flash 建立了什麼
要理解為什麼一個「精煉版」值得關注,先看 3.7 Flash 上市時繳出的數字。在軟體工程評測上,它在 FrontierCode 1.1 Main 拿下 43.6%(3.6 Flash 為 34.4%),在 DeepSWE v1.1 拿下 65.3%(對比 49.0%)。在 Arena.ai 的 WebDev Arena 上,它的 Elo 達到 1588,高於前代的 1538。在 AutomationBench——真實商業流程評測——上,它從 17.0% 躍升至 30.4%。它同時也搭載了針對 CBRN(化生放核)與網路攻擊領域更新的安全防護。
定價是故事的另一半。3.7 Flash 以每百萬輸入 token 0.75 美元、每百萬輸出 token 3.75 美元的優惠價登場,這個價格維持到 2026 年 12 月 31 日,之後調為 1.50/7.50 美元。市場普遍預期 3.8 Flash 會落在同一區間:Google 反覆使用「優惠價至 2026 年底」的措辭,顯示全年價格穩定是刻意策略。
為什麼目標是 Claude Fable 5
圍繞 skimaki 版本的報導,一致將 3.8 Flash 描繪為瞄準 Anthropic 的 Claude Fable 5——後者目前在複雜編程、repo 級軟體工程與多步推理領域設定了能力天花板。但這種前沿級效能伴隨旗艦定價:輸入每百萬 10 美元、輸出每百萬 50 美元——輸入與輸出成本大約都是 Flash 優惠價的 13 倍。
所以訴求不是「Flash 在每個基準上都打贏 Fable」,而是一場針對經濟學與速度的鉗形攻勢:
- 精準的推理迴圈。 透過更好的內部思考預算與 token 效率,在不拉高延遲的前提下,縮小 SWE-Bench、Terminal-Bench 等基準的差距。
- 吞吐量。 Flash 級模型天生為平行子代理部署與快速工具呼叫而建,傳聞解碼速度約在每秒 280+ token。在需要協調大量快速代理的場景,速度往往勝過暴力算力。
- 成本不對稱。 如果 3.8 Flash 能以十分之一的 API 成本提供接近 Fable 5 的輸出品質,多代理工作流的經濟學一夜之間就會改變。Anthropic 自己也在 9 月 1 日做出反應——推出 Claude Fable 5.1,將快取讀取價格大砍 75% 至每百萬 0.25 美元——這清楚說明快速、低價的戰場正是交火最激烈之處。
時機點相當尖銳:Google 揭曉發表日期的那一週,正好是 Anthropic 更新產品線的時候;而這個模型登場之際,快速 tier 的價格戰已全面開打——OpenAI 的 GPT-5 Mini($0.25/$2.00)、Anthropic 的 Haiku 4.5($1.00/$5.00),以及 xAI 更凶悍的 Grok 快速 tier($0.20/$0.50)。
Jetski:把內部試煉當武器
這次發表的來源本身就值得一提。Google 的 Jetski 編程平台——3.8 Flash Preview 的測試場地——是這種快速迭代的試煉場。讓未發表的模型在正式發表前、於真實內部工程工作負載上跑上數週,Google 得以收集到策劃式基準測不出來的效能資料,同時順帶改進自家開發者工具。而揭露「skimaki」代號與週三發表日的爆料社群,已成為 Google 產品發布的可靠預警系統——某種程度上也是免費的上市前宣傳。
《華爾街日報》另報導,Gemini 4 在預訓練評測上表現不俗,但後訓練仍需加強。這讓 3.8 Flash 的定位更加清晰:在下一個世代交替之前,從現有基礎設施與訓練投資中榨出最大推理效率的橋接模型。
對開發者與採購方意味著什麼
對於運行大量代理管線的團隊來說,一個接近前沿編程能力、又便宜又快的模型,會直接改變單位經濟學。大多數正式環境的 AI 流量根本不需要前沿級模型——編程助理、客服機器人、文件處理都跑在工作馬等級的 tier 上,因此每一分效率的改進都會在每天數百萬次呼叫中複利放大。
代價是版本折騰。在兩到三週一次的節奏下,評測管線很快就會過時,在某個版本上驗證過的行為不保證在下一版成立。建立在 Gemini 上的團隊應該把模型選擇視為持續流程而非一次性決策——採用與版本無關的評測架構、定期對自己的工作負載做回歸測試,並在預算上預設腳下的模型一季會換四次。
Gemini 3.8 Flash 不是登月計畫。但對 AI 開發的日常現實而言,它可能更具意義:快速 tier 已成為主戰場的鐵證——以一種把基礎模型當成持續交付服務、而非單次巨型發布的節奏,不斷精煉。
本文內容反映正式揭曉前的報導;Google 的官方公告(含最終基準與定價)將於 9 月 2 日發布。
Sources
- [1] https://cryptobriefing.com/google-gemini-3-8-flash-wednesday/
- [2] https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- [3] https://www.businessinsider.com/google-employees-testing-next-gemini-flash-3-8-model-2026-8
- [4] https://shattered.io/gemini-3-8-flash-preview-google-testing-2026/
- [5] https://nokiapoweruser.com/gemini-3-8-flash-leak-release-date-fable-5-benchmarks/
- [6] https://aiweekly.co/ai-news-today