最便宜的 token 不是最便宜的答案:AlphaSense 顛覆 AI 成本戰的敘事
AlphaSense 針對 246 項金融分析任務的最新研究發現,GPT-5.6 Sol 與 Claude Opus 4.8 在品質與總成本上雙雙勝過中國對手——因為更聰明的模型每項任務耗費更少 token。以 token 單價為核心的價格戰,可能從頭就量錯了東西。
過去幾個月,企業 AI 經濟學的故事只用一種貨幣書寫:一百萬個 token 的價格。中國模型的定價遠低於美國對手——Moonshot 的 Kimi K3 每百萬輸出 token 收費 15 美元,而 Anthropic 的 Opus 4.8 是 25 美元、OpenAI 的 GPT-5.6 Sol 是 30 美元——買家也用實際行動回應:今年夏天 OpenRouter 的數據首度顯示,中國模型在開發者 token 用量上超越了 Claude 與 ChatGPT。
但 AI 市場情報平台 AlphaSense 的新研究指出:所有只看標價採購的人,從一開始就量錯了指標。在執行了 246 項真實的金融分析任務——分析法說會逐字稿、SEC 文件、分析師預估與併購活動——之後,AlphaSense 發現那些「昂貴」的美國模型在品質與總成本上同時勝出。
研究發現
數字相當驚人。以任務集的中位數來看:
- OpenAI 的 GPT-5.6 Sol 產出的答案品質比 Moonshot 的 Kimi K3 高出約 20%——而總成本低了約 13%。
- Anthropic 的 Opus 4.8 品質分數比 Kimi K3 高出約 13%,總成本卻只有對方的一半左右。
- 受測的中國模型包括 Kimi K3 與 GLM-5.2;儘管單價更低,兩者在「每完成任務成本」的指標上都落敗。
每百萬 token 收 30 美元的模型,怎麼可能比收 15 美元的還便宜?關鍵機制是 token 效率。更強的模型完成同樣工作通常需要更少的 token 與更少的處理步驟——更少重試、更少的輔助架構、更短的推理鏈。總支出等於單價乘上用量,而在複雜的知識工作中,用量這一項才是主導者。
「有些看起來更貴的模型——那些只看每 token 單價會覺得貴的——實際上總成本更低,因為它們使用 token 的效率更高,」AlphaSense 執行長 Jack Kokko 說。
為什麼此時此刻重要
這份研究落在全面開打的價格戰正中央。根據《金融時報》,美國主要模型的價格自七月中以來下跌近 25%——是 ChatGPT 問世以來最陡峭的單月跌幅——因為 OpenAI 與 Anthropic 正全力抵禦便宜的中國替代品。OpenAI 將 GPT-5.6 Luna 降價 80%;Anthropic 則以旗艦 Fable 5 一半的價格推出 Claude Opus 5。
這兩個故事並不矛盾——而是互為補充。牌價下跌是供給面對競爭的反應;AlphaSense 的數據則是需求面的修正:每 token 的價格,遠不如達到可接受品質門檻的「每任務成本」來得重要。一家遷移到便宜模型、然後發現代理迴圈長度暴增三倍、重試率攀升、輸出品質下滑的企業,其實一直在用發票單價永遠看不出來的方式,為那份折扣付出代價。
路由:中間路線
值得注意的是,AlphaSense 並未得出「前緣模型全面獲勝」的結論。報告承認開放權重模型有兩個難以撼動的場景:在自己基礎設施上運行工作負載的公司可以完全避開每 token 計費;而電子郵件摘要這類低難度任務,根本不需要前緣智能。
AlphaSense 自家平台就示範了務實的答案:一套路由系統,把查詢的不同部分分配給不同模型——由能力強的模型規劃回應,再交給更小更便宜的模型執行。對多數企業而言,成本最優的架構很可能是一個組合,而非單一選擇。
後續觀察
AlphaSense 的研究只涵蓋一個領域——金融研究——以及 246 項任務的單一任務集。這是真實工作負載而非基準測試套件,利弊互見:它比 MMLU 式的評分更貼近現實,但前緣模型的效率優勢在其他領域(程式開發、客服、文件審閱)可能更小、也可能更大。
儘管如此,方向是明確的。隨著 AI 採購日趨成熟,決定供應商選擇的指標正從「每 token 價格」轉向「每完成任務成本」——而在這個指標上,戰局遠比價格表所顯示的更加開放。押注「效率足以抵銷兩倍牌價溢價」的美國實驗室,拿到了第一份有力的證據;中國實驗室則清楚知道成本戰的下一條戰線在哪裡開啟:不是每 token 的美元,而是每項任務所需的 token 數。
對買家而言,實際的結論很簡單:下次續約前,用你自己的任務做基準測試,把總支出與輸出品質放在一起衡量,並且把定價頁視為談判的起點——而不是故事的全貌。
Sources
- [1] https://www.theinformation.com/newsletters/applied-ai/anthropic-models-can-cheaper-use-chinese-ones-study-finds
- [2] https://finance.yahoo.com/technology/ai/articles/openai-anthropic-may-cheaper-chinese-165403602.html
- [3] https://www.techrepublic.com/article/news-openai-anthropic-cheaper-ai-models-open-weight-competition/
- [4] https://www.cnbc.com/2026/07/07/chinese-ai-models-costs-us-openai-anthropic.html
- [5] https://www.ft.com/content/32a70a3c-7d28-40b4-808e-36edb58c7d01