← All posts / Industry

AT&T 用一台路由器砍掉 56% AI 帳單:企業「Token 經濟學」的寧靜崛起

AT&T 透過把簡單查詢導向 Llama 與 Gemma,讓部分程式任務成本降低 56%、品質只掉 2%——下一步要讓每日 450 億 token 的六到七成跑在開源模型上。

AT&T 用一台路由器砍掉 56% AI 帳單:企業「Token 經濟學」的寧靜崛起

過去一週最重要的企業 AI 新聞,跟新模型、新晶片、新基準測試都無關。它是一家 140 年歷史的電話公司,決定「哪個問題該由哪個既有模型回答」——然後把帳算給大家看。

8 月 20 日,《The Information》報導,AT&T 透過在任務不需要前沿模型時、把員工查詢路由到更便宜模型的方式,將程式開發等進階 AI 任務的成本最多砍低了 56%。而根據 AT&T 自己的測量,品質代價大約只有 2%。

數字背後的數字更驚人。AT&T 如今每天在整個員工群體中處理平均 450 億個 AI token——一年前大約是每天 80 億,成長超過五倍,動力來自從偶爾用的聊天機器人,轉向全天候運轉的程式代理(coding agent)與文件工作流。目前約 40% 的員工查詢已經跑在開源/開放權重模型上。負責員工 AI 的 AT&T 副總裁 Mark Austin 表示,公司希望未來幾年把這個比例提高到 60% 至 70%。

這不是試點。這是一家財富 500 大公司正在重新架構「如何購買智慧」——也是企業 AI 市場進入分析師所謂 tokenomics(token 經濟學)階段最清晰的訊號:像當年 CIO 管理雲端帳單那樣,紀律化地管理 token 支出。

AT&T 實際上建了什麼

核心做法出奇地簡單:一台模型路由器(model router)。AT&T 使用 LiteLLM——一個開源代理,坐在員工與公司可存取的每個模型之間。請求進來時,路由器會分類它的複雜度(用啟發式規則、關鍵字規則和一個 LLM 分類器),判斷它是否真的需要 Claude 或 GPT 級能力,還是 Llama、Gemma 或輝達的 Nemotron 就能搞定。

  • 簡單任務——文件摘要、程式碼解說、格式轉換、例行查詢——導向 Llama、Gemma 這類開放權重模型,AT&T 以商品化成本自行提供服務。
  • 高難度任務——複雜程式碼生成、細膩分析、高風險推理——仍然交給 Anthropic 與 OpenAI 的前沿模型,溢價買到的是真實的能力差距。
  • 路由器本身就是政策。成本控制不再是告訴員工該用哪個工具,而是一個逐請求、對使用者透明的基礎架構決策。

AT&T 的目標不是消滅前沿模型支出,而是讓它維持持平。隨著用量複合成長——別忘了,十二個月內從 80 億變 450 億日 token——要讓 Anthropic 與 OpenAI 那一行的支出持平、總消耗量卻成長五倍,邊際 token 就必須越來越多由開源模型來供應。整個策略,一句話就講完了。

值得注意的是 AT&T 劃下的一條界線:它沒有使用 DeepSeek 或 Moonshot 等中國開放權重模型,但 Austin 說公司正在積極評估風險面貌。開放權重的地緣政治面向,如今已是採購問題,而不只是政策辯論。

檢視那個 56%

企業和供應商天天在拋成本節省的說法;這一個在變成江湖傳說之前,值得細看。

首先講但書。56% 涵蓋的是部分程式任務——不是全部 AI 支出,也不是一個受控基準測試。「品質下降 2%」是 AT&T 自己的評估、經由二手報導,沒有公開的方法論。內部評測掉兩分,不等於員工可能嘗試的每種任務都掉兩分;開源模型徹底失敗的任務,可能根本被排除在受測範圍外。

其次,這個結果的方向有其他佐證。輝達回報在自家 SWE-Bench 評估中,用 NeMo Switchyard 路由器把例行代理步驟交給較小的 Nemotron 3.5 Lightning、只把真正困難的推理留給前沿模型時,成本降低了 58%。Ramp 的支出數據顯示企業正在積極重定模型組合。高盛的股票研究——下面會談到——整個論點就建立在這種行為的擴散上。

第三,就算頭條數字模糊,機制本身是可信的。多數代理式工作流由大量、低難度的呼叫主導:工具呼叫迴圈、摘要、重新格式化、檢索綜合。如果一個程式代理迴圈中 80% 的呼叫不需要前沿能力,把它們路由走是算術,不是創新。56% 最好被理解為路由適用範圍內任務的實測節省——對一家每天燒 450 億 token 的公司來說,這依然是個巨大的數字。

為什麼開放權重突然夠用了

Austin 對能力差距的描述,是整篇報導最值得引用的細節:AT&T 發現開源模型普遍落後前沿模型六到十個月,但差距正在縮小——而且今天的開源模型「跟 Anthropic 和 OpenAI 的舊模型一樣好、甚至更好」。

最後這半句才是安靜的殺手。它整個改寫了購買決策。如果你今年不選 Llama 的替代方案,是去年的 Claude、卻要付今年的價格,那開源模型在成本和能力上雙贏。前沿實驗室等於一直在跟自己的舊產品線競爭——而那條舊產品線,一直被別人開源出來。

三股力量在 2026 年匯流,讓這一切變得可行:

  1. 開源模型跨過了實用門檻。Qwen、Llama、Gemma、Nemotron 家族如今能處理企業任務的長尾——摘要、分類、程式碼解說——品質高到員工分辨不出與前沿輸出的差別。
  2. 路由基礎架構成熟了。LiteLLM、OpenRouter(剛被 Stripe 以超過 70 億美元收購)、輝達的 Switchyard,以及每家雲端供應商的內建路由,讓逐請求的模型選擇變成一份設定檔,而不是一個研究專案。
  3. Token 計費讓成本現形。產業從固定訂閱轉向計量式 token 計費,讓 AI 支出變成 CFO 看得見的一行數字——而一旦看得見,就會被管理。員工被推向最大模型、無人在意成本的兩年「tokenmaxxing」時代,正在結束。

高盛的反向論點:便宜 token 可能救了 Big Tech

故事在這裡反轉。直覺的解讀是開源模型威脅 AI 既得利益者:如果 Llama 夠好,為什麼還付錢給 Anthropic?

高盛股票研究主管 Jim Covello 主張,對基礎架構擁有者而言,情況可能恰恰相反。更便宜的開源模型讓企業更有可能有利可圖地導入 AI——而有獲利的應用場景意味著更多查詢、更多 token、以及對超大規模資料中心與 GPU 的更多需求,而那些正是 Hyperscaler 們正在狂建的東西。「這對 hyperscaler 是好事,」Covello 說,「因為這讓你更有可能把正在新增的這些產能,有利可圖地填滿。」

市場脈絡很重要。Big Tech 的 AI 資本支出已成為華爾街核心焦慮之一:多年來每次資本支出公告都被獎勵,但過去幾季,投資人開始問更尖銳的問題——不是產能能不能蓋出來,而是是否存在足以填滿它的獲利性需求。AT&T 式的 tokenomics 兩面刃:它壓迫高端模型定價,同時擴大經濟上可行的 AI 應用宇宙。對任何一家公司,淨效應取決於你站在帳本的哪一邊。

對模型實驗室本身,壓力更直接。如果 AT&T 的劇本——前沿支出持平、其餘路由到開放權重——變成財富 500 大的標準做法,實驗室的營收成長就只能來自能力差異化,而非用量。那是門困難得多的生意。

對其他人的意義

AT&T 不是 AI 玩家中的老練者;它是一家成本紀律嚴明、擁有十萬多名員工和普通企業工作負載的電信公司。這正是它的數字重要的原因。如果路由在那裡行得通,舉證責任就轉移到每一家仍然預設把每個查詢送進最貴模型的企業身上。

實際的檢查清單,從 AT&T 的經驗直接掉出來:

  • 先量化 token 流量,再談優化。AT&T 的 tokenomics 計畫始於能見度——知道用量從 80 億到 400 億再到 450 億日 token,問題才變得可處理。
  • 分類你的工作負載組合。多數企業會發現同樣的分布:絕大多數請求很簡單,少數很難。路由利用的就是這個不對稱。
  • 保留通往前沿能力的逃生口。目標是支出持平,不是歸零——開發者對得起成本的工作,照樣能用 Claude 和 GPT。
  • 把模型選擇當水管,不當信仰。2026 年有趣的架構決策不再是「你買了哪個模型」,而是「能可靠處理這件工作的最便宜模型是哪個」。

過去兩年的超大規模 AI 故事講的是能力:更大的模型、更快的晶片、更長的上下文。AT&T 的故事暗示,下一階段講的是經濟學:同樣的模型,智慧路由,價格砍到零頭。這則新聞爆出的那一週,沒有任何一家前沿實驗室發布更聰明的模型——而企業成本曲線的彎折幅度,卻超過了整整一個月。

引擎已經商品化。錢在底盤。