← All posts / Models

Google Gemini 3.6 Flash 登場:百萬 token 上下文、降價 17%、速度再進化

Google 的 Gemini 3.6 Flash 搭載百萬 token 上下文視窗、輸出價格調降 17%,並在代理型與程式碼基準測試上有顯著提升——但這足以擊敗 GPT-5.6 與 Claude 嗎?

Google Gemini 3.6 Flash 登場:百萬 token 上下文、降價 17%、速度再進化

Google 在 AI 模型大戰中的效率佈局

2026 年 7 月 21 日,Google DeepMind 發布了 Gemini 3.6 Flash,同時推出兩款兄弟模型——Gemini 3.5 Flash-Lite 與 Gemini 3.5 Flash Cyber——這是 Google 今年最具攻擊性的效率導向模型組合。當市場焦點都放在 GPT-5.6 Luna 和 Claude Opus 等尖端模型上時,Google 正悄悄押注一個方向:真正能帶來營收與採用量的,是中階模型——快速、便宜,且足夠聰明以應付生產環境的需求。

Gemini 3.6 Flash 正是這一策略的集大成之作。它保留了自 3.x 系列以來 Gemini 最具標誌性的百萬 token 上下文視窗,同時將輸出 token 價格調降 17%,並在程式碼基準測試中取得兩位數的進步。問題在於:這些漸進式的改善,是否足以將開發者從 OpenAI 和 Anthropic 身邊拉走,在日益擁擠的市場中脫穎而出?

技術規格

Gemini 3.6 Flash 被定位為 Google 的「通用型 Flash 主力模型」。以下是核心規格:

  • 上下文視窗: 1,048,576 token(100 萬)——約為 GPT-5.3 Chat 的 128K 視窗的 8 倍
  • 輸入定價: 每百萬 token 1.50 美元
  • 輸出定價: 每百萬 token 7.50 美元(前一代為 9.00 美元)
  • 快取輸入定價: 每百萬 token 0.15 美元——重複使用相同上下文可享 90% 折扣
  • 最大輸出長度: 較 3.5 Flash 大幅延長,支援更長的生成回應
  • 多模態: 原生支援文字、圖片、音訊與影片輸入

此模型還引入了改善的 token 效率,意味著它每消耗一個 token 能完成更多工作——實際上放大了原始降價的效果。Google 表示,3.6 Flash 在四項代理型基準測試類別中均優於 Gemini 3.1 Pro 與 Gemini 3.5 Flash,顯示效率的提升並未以犧牲能力為代價。

基準測試表現:亮點與爭議

根據 Google 官方模型卡,Gemini 3.6 Flash 在推理、程式碼、代理型、多模態與長上下文等基準測試中均進行了評估。突出的結果包括:

  • GDPval-AA v2: 1421 分,優於 Gemini 3.5 Flash 的 1349 分——知識型工作任務提升 5.3%
  • 程式碼基準測試: 較前一代 Flash 提升約 12 分,Google 稱其在多項程式碼指標上已超越 3.1 Pro
  • 代理型基準測試: 在四項代理型評估套件中均優於 3.1 Pro 與 3.5 Flash
  • 多語言與內容安全: 在兩個面向上均較 3.5 Flash 有所改善

在 Artificial Analysis 智慧指數上,Gemini 3.6 Flash 獲得約 50 分的估計值,位居目前可用模型的中上階層。BenchLM 的綜合評分給它 75.3 分,相比之下 Claude Sonnet 4.6 為 64.25 分——但兩者的 90% 信賴區間有所重疊,意味著這個領先只是參考性的,並非定論。

直接對比之下,情況更加微妙。與 Claude Sonnet 5 相比,Gemini 3.6 Flash 在速度上具有決定性優勢(報告稱快 3.6 倍),成本上也更便宜(在 8 月 31 日的促銷定價結束後約便宜 2 倍)。然而,Claude 在寫作品質和評論者所稱的「智慧天花板」——處理極度複雜推理任務的能力——上仍保持領先。

與 OpenAI 的 GPT-5.6 Luna 相比,情況就不那麼樂觀了。Reddit 的 r/singularity 和 r/Bard 社群反應直白:「Gemini 3.6 Flash 比 GPT 5.6 Luna 差,而且貴 2.5 倍,」一位用戶如此評論。雖然這種說法過於簡化——它忽略了 Gemini 巨大的上下文視窗優勢和多模態能力——但也反映了真實的不滿:Google 的 Flash 階層儘管不斷迭代改進,仍未在原始智慧上追平 OpenAI 的頂級模型。

百萬 token 上下文優勢

Gemini 的百萬 token 上下文視窗仍然是它最具差異化的功能。對於需要在一次呼叫中處理整個程式碼庫、冗長法律文件或多小時影片逐字稿的開發者來說,在這個價位上沒有任何競爭對手能與之匹敵。GPT-5.3 Chat 上限為 128K token。Claude Sonnet 5 支援 200K。Gemini 3.6 Flash 的 100 萬視窗不只是一個行銷數字——它使得在競爭平台上必須透過複雜的分塊與檢索管線才能完成的工作流程成為可能。

快取輸入定價每百萬 token 僅 0.15 美元,進一步放大了這項優勢。需要重複查詢相同大上下文的應用——例如載入案件檔案的法律研究工具——可以快取該上下文,後續呼叫只需支付標準輸入費率的 10%。對於涉及大型靜態文件的工作負載,這使得 Gemini 3.6 Flash 在實際使用中比其每 token 定價所暗示的便宜得多。

Flash-Lite 與 Flash Cyber 的定位

Google 不只推出了一款模型——它推出了一個家族。Gemini 3.5 Flash-Lite 是超低價階層,定價為輸入每百萬 token 0.30 美元、輸出每百萬 token 2.50 美元。它專為高量、低延遲的任務設計,原始智慧不如吞吐量重要:分類、摘要、簡單問答和路由。

Gemini 3.5 Flash Cyber,顧名思義,專門針對網路安全應用——可能在威脅情報、漏洞分析和安全程式碼審查工作負載上進行了訓練或微調。這種垂直領域專門化的做法反映了一個更廣泛的產業趨勢:通用型模型正在商品化,差異化正轉向領域優化的變體。

競爭現實

Gemini 3.6 Flash 的發表正值 Google AI 部門一個微妙的時刻。就在兩週前的 8 月 5 日,公司經歷了戲劇性的領導層重組:Demis Hassabis 卸任 DeepMind 執行長,而 Jeff Dean——Google AI 基礎架構的建構者,任職超過二十年——離職共同創辦 Discovery Loop。這次改組導致 Alphabet 股價下跌 4%,並引發了對 Google 在模型競爭中能否保持動能的質疑。

在此背景下,Gemini 3.6 Flash 既是一種保證,也是一種提醒。它證明 Google 的模型開發管線在組織動盪中仍按計畫推出產品。但它也強化了一種印象:Google 正在打效率戰——以更低的價格提供漸進式改進——而 OpenAI 等競爭對手則在推動原始能力的邊界。

對開發者來說,盤算越來越簡單明瞭。如果你的應用需要絕對最高的每次查詢智慧,且成本是次要考量,GPT-5.6 Luna 或 Claude Opus 仍然是首選。如果你需要龐大的上下文視窗、多模態處理和大規模的積極定價,Gemini 3.6 Flash 可以說是市場上目前最具性價比的選擇。如果最低成本的原始吞吐量才是首要考量,Flash-Lite 以輸入每百萬 token 0.30 美元的價格難以被超越。

對市場的意義

Google 在 3.6 Flash 家族上的策略揭示了明確的論點:AI 模型市場正在分化。尖端模型將繼續在頂級使用場景中維持高價,但絕大多數的生產型 AI 工作——客服機器人、內容處理、程式碼輔助、資料擷取——將由為成本和速度優化的中階模型來承擔。透過提供三個階層(Flash、Flash-Lite、Flash Cyber)並以積極的低價供應,Google 正將自己定位為下一階段 AI 商業化的量產業務贏家。

17% 的輸出降價尤其重要。以每百萬 token 7.50 美元的輸出價格計算,Gemini 3.6 Flash 現在已經與一年前小得多的模型在價格上具有競爭力。加上百萬 token 的上下文視窗和改善的基準測試分數,它迫使競爭對手必須證明其定價的合理性——或者跟進降價。

這一策略能否從 OpenAI 根深蒂固的開發者基礎中奪取市占率,仍有待觀察。但有一點很清楚:Google 並未放棄效率階層。透過 Gemini 3.6 Flash,公司已經放下一個明確的訊號——即便領導層正經歷 DeepMind 歷史上最重大的轉型,它仍打算在每一個面向上競爭:價格、速度、上下文和能力。