← All posts / Industry

Gartner「推論悖論」:代理式工作流程成本至 2028 年將成長五倍

Gartner 8 月 17 日報告預測,每個代理式工作流程的 AI 推論成本到 2028 年將成長超過 5 倍——token 效率提升的紅利,正被日益複雜、自主的多模型工作流程吞噬,這就是「推論悖論」。

Gartner「推論悖論」:代理式工作流程成本至 2028 年將成長五倍

2026 年 8 月 17 日,Gartner 發布了一項與今年幾乎所有 AI 成本頭條背道而馳的預測:至 2028 年,每個代理式工作流程(agentic workflow) 的 AI 推論成本將成長超過五倍。注意單位——不是每個 token,不是每次模型呼叫,而是每個工作流程:AI 代理人執行真實工作時,那個包含規劃、工具呼叫、自我質疑的完整多步驟循環。

這項預測出現在一個微妙的時間點。就在五個月前的 2026 年 3 月,同一家公司才預測到 2030 年,對一兆參數 LLM 執行推論的成本將比 2025 年降低超過 90%。兩個預測可以同時為真——而它們之間的張力,正是 Gartner 所謂「推論悖論」(Inference Paradox)的核心:更佳的單位經濟學,反而推高了 AI 的整體成本,卻沒有為相應、可預測的價值提供明確路徑。

悖論背後的三大趨勢

Gartner 指出驅動 token 經濟學的三個基本面:

一、基礎模型的成本經濟學正快速改善。 單位 token 價格持續下跌、硬體效率持續提升、供應商持續推出更便宜的等級。這是大眾熟悉的那半邊故事——也是今年夏天價格戰的燃料,部分統計顯示美國主要模型價格自 7 月中以來已下跌近 25%。

二、效率提升解鎖了更昂貴的模型。 AI 效率改善不只是降成本——它讓部署更大、更強、更昂貴的模型來支撐高價值應用變得經濟可行。省下來的 token 成本不會變成存款,而是被換成能力。

三、精密工作流程消耗的 token 遠多於簡單聊天。 代理式工作流程——模型先規劃、呼叫工具、檢視結果、修正再迭代——燃燒的 token 數量比聊天機器人對話高出幾個數量級。當產品從輔助功能演化為多步驟執行,乘數效應便佔據主導。

綜合起來:token 的成本效率正在提升,但提升速度趕不上 AI 能力(以及這些能力伴隨的成本)的增加速度。創新的步伐,正在超越成本曲線。

聊天機器人 vs. 代理人:至少五倍的差距

Gartner 資深總監分析師 Will Sommer 用具體的營運語言描述這道鴻溝:「簡單的聊天機器人只需讀取並理解查詢,快速回出一個機率上合理的答案;而 AI 代理人必須不斷推理、協商、質疑自己。」

這些職責全部加總起來:相較於基本的聊天機器人互動,將任務路由至代理式推理模型,會讓供應商的推論成本增加至少五倍——且隨著任務複雜度提高,往往遠不止於此。

他對產品負責人的警告毫不留情:「產品負責人不能依賴更有效率的 token 經濟學來合理化 AI 成本。每一代新的 AI 能力都需要更多、而且往往更昂貴的 token。地平線上並不存在可靠、經濟的一體適用模型。打造有競爭力的 AI 產品,需要開發並維護複雜的多模型生態系。」

為什麼價格下跌,帳單卻上漲

推論悖論本質上就是套用到運算上的傑文斯悖論(Jevons paradox)。當單位智能的價格下跌,消費量不會維持不變——而是爆炸性成長。每一次效率提升,都讓把 AI 推入更多工作流程的更多步驟、更高能力等級、更長推理鏈變得合理。今年夏天把工作負載遷移到便宜模型、然後眼睜睜看著總支出不減反增的企業,已經親身經歷過這個動態。

Gartner 在 2026 年 6 月預測 AI 編碼成本將在 2028 年超過開發者平均薪資,正是同一現象的早期訊號。如今這個框架已經一般化:不只是編碼代理人,而是從輔助式 AI 轉向自主執行的整體位移,正在改寫成本結構。

報告也封死了輕鬆的逃生路線。既然沒有任何單一模型能對所有事情都經濟可行,答案就不是找一個更便宜的預設模型——而是架構。用 Gartner 的話說,要確保推理代理人等先進 AI 的投資報酬率,需要「相對於基本模型呈指數級提高的回報,或者高度優化的推論分層、路由與編排,以對照更具成本效益的智能來校準複雜任務」。

策略結論:分層,否則出局

對產品負責人而言,這份報告可行動的核心是推論分層(inference tiering)——把工作流程的每一步路由到能勝任該步的最便宜智能。簡單子任務交給小而快的便宜模型;判斷、規劃與模糊推理交給前沿模型;編排層負責決定誰處理什麼。

Sommer 說:「預設使用通用的自主智能,將導致無邊際的成本,比優化過的產品生態系高出幾個數量級。」「無邊際成本」這個詞分量十足:沒有刻意的分層,代理式系統可以透過循環、重試、過度推理,以沒有天然停止點的方式燒穿預算。

這對整個產業有實際影響。模型供應商會繼續在每 token 單價上競爭,但真正的競爭正在轉向誰能交付最便宜的完成任務——這個指數取決於路由智能、token 效率與工作流程設計,與牌價同樣重要。提供細粒度模型選擇、快取與提示上下文管理的平台供應商,賣的是分層淘金熱的鏟子。而以每 token 費率簽訂 AI 合約的企業,或許該在五倍曲線追上自己之前,改以每任務或每成果定價重新議約。

脈絡與但書

Gartner 在這個議題上有其商業利益——完整分析收錄於客戶付費報告《The Inference Paradox: Inference Tiering Is Critical to Protect Margins》,該公司也將從 9 月 14 日澳洲黃金海岸場次開始,在 IT Symposium/Xpo 系列活動中闡述 AI 經濟學。有命名框架和巡迴會議撑腰的預測,應部分視為議題設定。

但背後的算術很難反駁。代理式工作流程在結構上就比聊天昂貴;能力升級在結構上就需要更多 token;而代理人的採用還在早期。Gartner 自己 2026 年 5 月的調查數據顯示,僅 17% 的企業已部署 AI 代理人,另有 42% 計畫在十二個月內跟進。即使這條管線只實現一半,在每工作流程成本成長五倍的同時,整個產業的推論總帳單也會成長一個數量級——效率提升也改變不了這一點。

令人不安的結論是:在 AI 經濟學裡,單位價格在跌,單位在縮小,帳單卻仍在上升。下一階段的贏家,不是賭某一個模型會便宜到夠用的人,而是建立了紀律與管線、在每一步只花費必要智能的人。