CPU 的逆襲:Agentic AI 意外讓古老處理器成為新瓶頸
IEEE Spectrum 報導指出,Agentic AI 已讓 CPU 成為新的效能瓶頸——Intel 伺服器晶片售罄、AMD 倍增出貨預測、AWS 開始 ration CPU 運算資源。
過去三年,AI 基礎設施的故事基本上就是 GPU 的故事。Nvidia 的加速器成為全球最搶手的晶片,記憶體緊接其後,而 CPU——每台伺服器心臟部位的通用處理器——則被視為附屬品,一種跟著真正重要的零件一起裝箱的商品。
這個故事現在正式落幕了。IEEE Spectrum 於 2026 年 8 月 16 日發表的專題報導中,特約編輯 Matthew S. Smith 完整論述了 Agentic AI(代理式 AI)如何翻轉資料中心的效能階層:長期扮演 GPU 無聊配角 的 CPU,已經成為 AI 工作負載的新瓶頸。
代理如何改寫了 CPU 的劇本
這個轉變連最大的雲端業者都措手不及。根據報導,Amazon Web Services 今年稍早向工程師下達了嚴厲的指令:不惜一切代價節約 CPU 週期。AWS 據報已經歷 CPU 伺服器容量的等待時間暴增,因為 AI 工作負載持續擠壓其雲端基礎設施。
一旦跳出 GPU 本位的框架,箇中機制其實不難理解。在聊天機器人時代,一次 LLM 呼叫大多是一次性推論:提示詞輸入、token 輸出、結束。CPU 只負責前置與收尾,鮮少負擔重活。代理式系統的運作方式則完全不同。一個自主運作的模型——衍生子代理、發起 API 呼叫、讀寫檔案、下載套件、執行程式碼——會把大量編排工作推到通用運算上。
Moor Insights & Strategy 副總裁暨首席資料中心分析師 Matt Kimball 用赤裸的數字描述這個乘數問題:一個衍生 100 個代理的企業工作負載,一旦部署到全公司,就會變成「數萬、數十萬、甚至數百萬個代理」,代理之間互相呼叫工具、透過 Anthropic 的模型上下文協定(MCP)彼此溝通。
八個階段中的七個
業界自己的數據也印證了這個現象。Intel 資深研究科學家 Souvik Kundu 指出,代理式 AI 任務的許多環節本質上就是 CPU 的工作:解析模型輸出、判斷要呼叫哪個工具、發出 API 呼叫或執行程式碼、收集結果、再餵回模型。
AMD 的說法更犀利。該公司運算與企業 AI 副總裁 Madhu Rangarajan 表示,在 AMD 的內部測試中,真實代理式 AI 管線的八個階段裡,有七個完全在 CPU 上執行。
結果是一種浪費機器兩半的斷續執行模式。Kundu 與喬治亞理工學院研究人員合作發現,當 LLM 推論在 GPU 上執行時,CPU 往往閒置;反過來,當工具呼叫在 CPU 上執行時,GPU 也往往在空轉。他們提出的排程最佳化可在持續負載下將端對端延遲降低最多 1.8 倍,但這個增益追趕的是一個移動的目標:代理式系統以機器速度產生工作,而且邊跑邊繁殖。
分詞器:隱藏的稅
喬治亞理工的研究還揭露了一個更細微的元兇:分詞(tokenization),即將文字轉換為模型能消化的整數 token ID 的過程。與主宰 LLM 推論的大規模平行矩陣運算不同,分詞是分支多、依賴資料、循序的字串處理——道地的 CPU 領域。
共同發表互補論文的喬治亞理工博士生 Euijun Chung 解釋了代理為何讓這件事更糟。一個進行工具呼叫的模型必須解析並分詞其結果——而在長上下文的情況下,這意味著每次都要重新分詞整個進行中的序列。「假設你有一段 10 萬 token 的持續序列,而工具回傳了 1,000 個 token,分詞器就必須重新分詞整個序列,」Chung 說。「而每一次代理工具呼叫都要做一次分詞。」
延遲後果隨序列長度複合放大。在較長序列長度的測試中,增加 CPU 核心數可將首 token 延遲(time-to-first-token)降低約 1.5 到 7 倍。Chung 的團隊測試的是較小的模型——阿里巴巴的 Qwen 3-30B 與 Meta 的 Llama 3.1-70B——並推測更大的模型相對瓶頸可能沒那麼戲劇化,但他預期代理式 AI 會把序列長度推得遠超過他們測試的範圍:「在代理式 AI 的世界裡,平均序列長度會愈來愈長,所以我預期這個問題會愈來愈嚴重。」
市場已經用鈔票投票
商業訊號再明確不過。Intel 的伺服器 CPU 已經售罄至今年底之後。AMD 將伺服器 CPU 出貨預測翻倍。Arm 與 Qualcomm 都已發表為加速代理式 AI 設計的新 CPU。甚至連 Nvidia——那家以 GPU 定義了 AI 時代的公司——也把 Vera(其 Arm 架構的代理式 AI CPU)列為優先,作為 Vera Rubin 平台的一部分。
Kimball 將這些發展解讀為一個「絕對的訊號」(absolute tell):業界現在把 CPU 效能視為代理式 AI 系統設計的關鍵組成。但他也警告隨之而來的後果:更廣泛的 CPU 短缺與漲價,重演 GPU 與記憶體已經上演過的擠兌。據報導 Intel 已砍客戶端 CPU 產量以挪給伺服器 CPU,即使其新的 18A 製程正在推升客戶端部門的銷售——晶片商和其他人一樣,往錢的地方走。
為什麼這件事重要
CPU 的逆襲不只採購頭痛。它是對十年假設的修正——那個假設認為 AI 進步可以乾淨地對應到平行加速器吞吐量。代理不只思考——它們行動,而行動意味著排程、解析、呼叫、等待、驗證。這些工作必須有個落腳處,而它們落在 CPU 核心上。
對基礎設施規劃者而言,含義很直接:只以 GPU 數量為基礎的容量模型已不完整。對晶片商而言,一塊巨大的新需求版圖已然展開。而對任何追蹤下一個短缺——與下一次漲價——會落在哪裡的人來說,答案可能不是 AI 加速器裡面的那顆晶片,而是坐在它旁邊的那一顆。