一次 Agentic 任務,一萬倍足跡:Vals AI 用實測數據揭開 AI 的能源帳單
獨立評測機構 Vals AI 對 16 個開放權重模型量測電力、碳排與水耗,發現長時間「思考」的 agentic 任務,環境衝擊最高可達簡單問答的 10,000 倍。
多年來,關於 AI 環境成本的爭論大多停留在印象層面:資料中心很大、GPU 很耗電,所以 AI 對地球不好。9 月 3 日,獨立評測機構 Vals AI 用數據取代了印象。在首份環境衝擊報告(Environmental Impacts Report)中,該團隊量測了 16 個開放權重模型在真實 agentic 工作負載下的耗電量、碳排放與水資源消耗——頭條數字相當刺眼:一個長時間、多步驟的「思考」任務,環境衝擊約可達簡單一次性提問的 10,000 倍。
Vals 究竟量測了什麼
多數關於 AI 永續性的討論都聚焦在訓練——打造前沿模型的一次性能源高峰。Vals 看的是帳本的另一邊:大規模推理、做真正的工作。團隊取自家的 Vals Index 基準測試(一套涵蓋金融、程式開發、醫療與法律的多輪、長時程 agentic 任務)的 token 用量數據,餵入開源函式庫 EcoLogits——它根據 token 數量加上模型的總參數量與活化參數量,估算碳排、電力與水耗。
正是這個架構資訊需求,讓研究只能涵蓋開放權重模型——16 個模型中有 14 個來自中國,反映了開放權重今日的生態版圖。封閉實驗室根本不公開估算所需的內部規格。為了部分補上這塊缺口,Vals 推出了互動式計算器,讓使用者在自訂假設下估算足跡。其預設情境就夠嗆人:一個假想的 6 兆參數、30% MoE 活化率的模型,單一 Vals Index 任務就燒掉 21.2 kWh 電力——相當於美國家庭一整天的用電——同時排放 11.5 kgCO₂e(約開車 50 英里),消耗 91.9 公升水(一趟 10 分鐘淋浴)。
一萬倍差距,換算成家常單位
為什麼 agentic 任務會比簡單查詢高出四個數量級?因為 agent 不是在「回答」,而是在「迭代」。一個被要求開發網頁應用的模型會規劃、寫檔案、呼叫工具、讀錯誤訊息、然後重試——產生數萬個輸出 token,而一段聊天回覆可能只有幾百個。Vals 工程師 Omar Almatov 講得很白:「足跡會戲劇性放大,因為這些已經不再是單次問答。」
報告中的換算讓規模變得具體。在某些模型上,開發一個網頁應用所消耗的能源,相當於一個家庭 2.5 小時的用電。若把整個 2,157 項任務的 Vals Index 跑完,以任務級足跡最重的 Kimi K3(Moonshot AI 出品)計算,總碳排相當於一趟舊金山飛邁阿密的航班,用水量足以裝滿一輛消防車的水箱,電力消耗約 1.7 MWh——報告以美國家庭平均約一個月的用電來類比。
整份指標的排行榜橫跨兩個數量級。效率端,Ling 3.0 Flash 2607 跑完整個指標僅需估計 23.8 kWh——一天的家用電;MiniMax M2.7 以 34.8 kWh 居次,Mistral Medium 3.5 為 47.0 kWh。另一端則是 DeepSeek V4 Pro(459.6 kWh)、DeepSeek V4 Pro 0813(869 kWh)、Kimi K3(1.7 MWh)與 Qwen3.8 Max(1.8 MWh)——為了企圖心相當的任務,付出領先群數十倍的足跡。
能力很便宜,足跡可不
報告中最具商業意涵的發現,是價格與衝擊的脫鉤。Kimi K3 以 57% 準確率登上開放權重 Vals 排行榜冠軍,但亞軍 DeepSeek V4 Flash 僅落後 4%,資源成本卻只有零頭。Vals 把兩者的差距比擬為:幫筆電充一次電 vs 充二十次電;喝一杯水 vs 沖一次馬桶。
結果證明,定價是個糟糕的代理指標。DeepSeek V4 Pro 每個輸出 token 的價格比 Kimi K3 便宜近 15 倍、每完成一項任務便宜約 6 倍——環境足跡卻大致相同。折扣、市占率戰爭與 token 效率差異,讓你付的錢和地球付的代價徹底脫節。一個模型可以在 API 價目表上看起來超划算,同時卻是整個模型艦隊中電力與水資源消耗最重的選項之一。
這個模式連消費級場景都成立。利用即將推出的兒童安全基準測試數據,Vals 估算了一場 10 輪的個人對話:Kimi K3 的足跡約為 GLM-5.2 的 3 倍,用的 token 卻只有一半——足夠充 14 支手機的電力、開車 0.2 英里的碳排、三杯水的消耗。決定帳單的是參數量,不是話多不多。
為什麼此時落地
這份報告問世之際,正值真實的政治摩擦。Vals 引用民調指出,每 10 個美國人就有 7 個反對在自己社區興建資料中心;明尼亞波利斯、丹佛、西雅圖等城市已暫時限制資料中心擴建,等待環境評估結果。今年 3 月,參議員 Markey 與眾議員 Beyer 提出《2026 人工智慧環境衝擊法案》,要求資料中心申報環境與能源衝擊;加州更早已要求大型企業揭露溫室氣體排放與氣候相關財務風險。
換句話說,監管者需要的,正是 Vals 剛發布的這種量測——而第一份可信數據顯示,這個產業的環境問題不是資料中心整體的背景嗡嗡聲,而是一個具體、可量化的設計選擇:我們要求模型思考多少,以及在什麼硬體上思考。
不可忽略的限制
報告對自身局限相當坦白。估算依賴假設硬體(計算器預設 256 張 H100、batch size 64)而非實測設施數據;頭條數字未計入輸入、快取與 prefill 運算;而服務大多數消費流量的封閉權重模型——GPT、Claude、Gemini——因實驗室不公開架構而完全缺席。這些絕對數字最好視為有根據的估算,而非電表讀數。
但方向再明白不過。當模型朝越來越大的參數量規模化、agentic 工作流程成為軟體的預設介面,單一任務的足跡也會隨之膨脹。報告結尾的提醒,值得每個本週正在選模型的開發者記住:如果能力持續隨規模成長,環境足跡也會同步成長——而且跟準確率不同,這個數字目前還沒有人印在價目表上。