← All posts / Tools

Snowflake Cortex AI Gateway 學會自己挑模型——token 開銷最高省 3 倍

Snowflake 推出動態模型路由,自動為每個請求挑選「夠用且最省」的模型,同時納入 DeepSeek-V4-Flash 與 GLM-5.3 開源模型,資料全程留在治理邊界內。

Snowflake Cortex AI Gateway 學會自己挑模型——token 開銷最高省 3 倍

企業 AI 有一個帳面上不太敢明說的問題:沒有人願意用前線模型(frontier model)的價格,去跑一個只會摘要會議記錄的聊天機器人。2026 年 8 月 18 日,Snowflake(NYSE: SNOW)交出了它的答案——在 Cortex AI Gateway 內推出動態模型路由(dynamic model routing),依據品質、速度、客戶偏好與成本,自動為每一個請求挑選最合適的大型語言模型。

概念很直白:把重複性高、複雜度低的工作導向便宜的高效率模型,把真正需要深度推理的任務留給昂貴的前線模型,而且由平台——而不是你的工程師——每天做出這個決策數百萬次。

這次到底發布了什麼

動態模型路由建構在 Cortex AI Gateway 之上。Snowflake 於 2026 年 7 月發布這個閘道,定位為治理代理連線、聰明路由請求與優化 AI 消耗的統一基礎。新的路由層並非外掛的獨立產品——它已整合進 Snowflake 的旗艦 AI 產品,包括 Snowflake CoCo 與 Snowflake CoWork,也開放給透過閘道連接的第三方 AI 代理使用。

伴隨路由功能,Snowflake 同時擴充模型目錄,新增兩個開放權重模型:DeepSeek-V4-Flash 0731 與 GLM-5.3。兩者都將可在 Cortex AI、CoCo 與 CoWork 中使用,加入既有涵蓋 Anthropic、OpenAI、Google、Meta 與 Mistral 等廠商的模型組合。開源模型在此扮演關鍵角色:它們讓路由引擎有了真正便宜的投放標的,能承接簡單任務,同時不必讓受治理的企業資料離開 Snowflake 的安全邊界。

這次發布還包含一套支出管控工具——企業可以追蹤 AI 使用量、跨團隊分攤成本、設定配額與支出上限,並管理人類使用者與 AI 代理的整體消耗。隨著代理式工作負載讓 token 開銷以傳統「按人頭授權」軟體難以想像的方式膨脹,這一點愈來愈重要。

「智慧效率」背後的數字

Snowflake 用一個新指標來包裝這一切:智慧效率(intelligence efficiency)——衡量企業把運算資源、模型、資料與情境轉化為實際業務成果的效率,而非單純的 AI 使用量。

該公司揭露的內部測試數據相當具體:

  • 在一項評測中,使用動態模型路由的 AI 代理建立 dbt 資料管線,相較全前線模型路徑,token 效率提升最高 3 倍,且輸出品質維持不變。
  • 在另一項測試中,工程團隊完成相同數量的 pull request,同時token 效率提升 25%。

廠商自測的 3 倍效率宣稱當然該打折扣,但方向可信。模型路由利用的是一個眾所周知的現實:企業請求中有一大比例——分類、抽取、簡單問答、格式轉換——根本不需要前線模型。為這些請求支付前線價格是純粹的浪費,而這種浪費隨代理採用率線性放大。

競爭背景:路由突然成了主戰場

體認到「模型路由是下一層基礎設施」的公司,不只 Snowflake。就在一週前的 8 月 11 日,NVIDIA 發布了 Switchyard,用於跨模型智慧路由 AI 流量的自 家技術。同週稍早,Stripe 宣布收購 OpenRouter——一家靠著「跨數百個模型的通用 API 與路由器」建立起事業的新創。

三家定位截然不同的公司——資料平台、晶片廠、支付網路——從不同角度收斂到同一個命題:當可用模型的數量爆炸性成長,「選擇層」的價值將超過任何單一模型。誰坐在應用程式與模型清單之間,誰就掌控推論的經濟學。

Snowflake 的差異化在於治理。它的路由決策發生在資料所在之處,這對受監管產業、以及需要應對各區域模型供應狀況的跨國組織至關重要。管理員保有控制權,可以決定哪些模型與供應商根本有資格被列入;而當模型定價與效能變動時,閘道會在執行中的應用程式底下更新路由決策——團隊不必因為新模型上市或價格調整就重建代理。

為什麼重要

CEO Sridhar Ramaswamy 的說法很直接:「問題不再是企業用了多少 AI,而是這些 AI 是否轉化為真正的業務價值……Snowflake 的角色是吸收那層複雜性,讓客戶專注成果,由我們在底下優化模型選擇。」

分析機構 SanjMo 創辦人 Sanjeev Mohan 對營運痛點的描述更露骨:企業「淹沒在模型選項裡」,真正的問題「不是該挑哪個模型,而是大規模地為每個任務挑對模型的營運負擔」。

這裡還有一個更細微的訊號。DeepSeek-V4-Flash 與 GLM-5.3 這類開源模型被定位成第一線的路由標的、而非展示品,本身就標誌著開放權重模型在企業技術棧中的地位變化。當一家大型資料平台的成本故事,有一部分得靠「把工作路由到開源模型」來實現,開源與前線之爭就不再只是意識形態,而是一條實實在在的會計科目。

當然,任何抽象層都有風險:鎖定效應與不透明。讓閘道替你挑模型,就等於信任它對「品質」的定義與它的路由誘因。企業會要求看見「請求為什麼落在某個模型」的可觀測性。但大方向已定——為每個應用手工挑模型,正在變得像手工挑伺服器一樣過時。企業 AI 的閘道時代已經開始,路由之戰正式開打。