把 Token 榨到極致:中國 AI 實驗室靠「效率」追平美國的真相
Fortune 九月十三日分析指出,中國實驗室並非只靠蒸餾美國模型——在算力封鎖下被迫練出的效率工程,才是它們把差距縮到 2.7%、並開始反過來拿下美國企業客戶的真正武器。
過去兩年,關於美中 AI 競賽的主流敘事很簡單:美國訓練前沿模型,中國負責複製。但 Fortune 於 2026 年 9 月 13 日發布的深度分析提出了一個令人不安的反論——中國實驗室不只是在「蒸餾」美國模型。它們之所以能追平差距,是因為在算力被封鎖的處境下,被迫把自己鍛鍊成更好的效率工程師,而這種紀律如今正在反過來贏得美國本土的企業客戶。
背景:一場以百分比計量的情報競賽
「接近」到底有多接近?根據今年稍早一份被廣泛引用的 Stanford 基準整合報告,Anthropic 最強模型領先 DeepSeek 最佳模型的幅度只有 2.7%。這個數字正是「領先數個月」與「並駕齊驅」之間的分界線,也為本文所有數據提供了框架。當效能差距縮小到個位數百分比,CTO 的決策問題就從「哪個比較強?」變成「每一美元買到的能力哪個多?」——而這恰好是中國實驗室集中布建優勢的戰場。
這波討論的新聞引信是外交事件。本週稍早,FBI、NSA 與 CISA 聯合發布警戒通告 AA26-251A,指控六家中國 AI 公司——DeepSeek、Moonshot AI(月之暗面)、阿里巴巴、MiniMax、StepFun 與 Z.AI——自 2024 年起大量購買美國前沿 API 的訂閱,並藉由在輸出上訓練而萃取「價值數十億美元的能力」。通告聲稱此手法讓 DeepSeek 得以低報它著名的 560 萬美元訓練成本。中國外交部則稱相關指控「毫無根據」,並將該國的進展歸功於「高水準科技自立自強」。
這兩件事可以同時為真。蒸餾或許解釋了部分平價化的原因。但受 Fortune 採訪的分析師主張,更深的優勢是架構性的——一種美國實驗室因坐擁超大规模雲端預算而從未被逼著發展出來的「用更少做更多」文化。
被約束鍛造出來的 Attention 工程
這個論證的技術核心是 attention 機制——Google 在 2017 年那篇奠基論文中提出的發明,讓語言模型能把每個 token 與其他所有 token 互相權衡,判斷哪些關係重要。attention 使長上下文成為可能,但也讓長上下文變得極為昂貴:運算成本隨上下文長度平方級增長。
Futurum Group 半導體與供應鏈分析師 Brendan Burke 告訴 Fortune,中國實驗室「找到了能把這些運算複雜度降低一個數量級的演算法,然後因為能摘要出最相關的 token,反而得到更好的結果」。這道限制是外部強加的:美國出口管制切斷了中國取得 Nvidia 最強加速器的管道,將整個生態系推向華為等本土替代方案——帳面規格上無法匹敵美國實驗室叢集的硬體。白宮自己的數據讓這種不對稱一目了然:美國掌握全球約 74% 的算力,還有超大規模資料中心以 GW 為單位的擴建在後面撐腰。
「因為可運用的算力較少,他們找出運算上高效的方法,而不是像美國實驗室起初那樣,直接把更多算力砸向一個低效的技術,」Burke 說。相對地,美國前沿模型可以當「token 大胃王」——系統被設計成探索式推理,燃燒大量 token 來測試假設,因為背後的算力取之不盡。
今年密切追蹤模型發布的人,都看得到這種紀律的產物。DeepSeek 的 V4 系列引入壓縮式 attention 技術,宣稱每 token 推論 FLOPs 降低 73%。Z.ai 的 GLM-5.3-Flash 相較自家前代削減 3 倍 attention 運算量,同時以 MIT 授權開放權重。阿里巴巴的 Qwen3.8 家族透過激進的混合專家(MoE)路由,每個 token 只激活總參數的一小部分。這些都不是美國架構的複製品;它們是在稀缺環境中塑形出的、分歧的工程譜系。
企業端的收據
效率宣言很廉價,採用數據不是。Fortune 這篇報導綜整了幾組硬數字:
- AI 量測平台 Larridin 追蹤企業工程工作流,發現 GLM 5.2、Kimi 2.6/2.7 等中國模型能以美國模型五分之一的成本,「還算勝任」地完成約 75% 的工程任務。美國前沿模型在最複雜任務上仍保持領先——但多數日常企業工程早已不需要前沿等級。
- Hugging Face 報告指出,中國開源模型去年佔總下載量的 41%,超過美國模型的份額。
- Ramp 的 AI 指數顯示,付費使用可存取開源與中國開發模型的平台之企業占比,從 1 月的 4.5% 升到 7 月的 6.1%。
- 具名的採用者包括 DoorDash(CEO Andy Fang 稱 Moonshot 的 Kimi「更便宜」且「品質更好」)、Cursor(用 Kimi 協助打造 Composer 2 agent)、Airbnb 與 Siemens(實驗阿里巴巴與 DeepSeek 模型),以及 Thomson Reuters——它把阿里巴巴開源的 Qwen 改造成內部模型 Thomson-1,接手原本由 Claude 負責的文件審閱工作。
開放權重的分發模式功不可沒。DeepSeek 的 R1 及其後繼者可從 Hugging Face 下載、私微調、並透過 AWS 等美國本土雲端提供服務——這條路徑中和了資料主權疑慮,讓戒慎的美國企業能在不把任何一位元組送到中國公司的前提下,採用中國的模型技術。
反向的重量
這個故事也有清醒的反制敘事,Fortune 給了它空間。美國實驗室在最難的任務上仍領先數個月。AnswerRocket 的 CTO Mike Finley 把前沿模型定位成整個產業賴以推進的「存在證明」:「沒有前沿實驗室開路,他們做的一切根本不可能。」
還有揮之不去的來源問題。如果 AA26-251A 的蒸餾指控成立,中國模型能力中有一部分便是美國訓練運算的衍生品——這意味著效率敘事與萃取敘事其實相互糾纏,而非互斥的解釋。效率解釋了中國實驗室為何能把夠強的模型服務得如此便宜;而蒸餾指控若被證實,則解釋了能力的一部分來源。監管者在撰寫假設兩者乾淨分離的政策之前,得先解開這團線。
意義所在
效率論之所以重要,是因為它改變了「贏得 AI 競賽」的定義。當能力平價落在幾個百分點內、成本差距卻是 5 倍,戰場就從原始智能轉移到規模化經濟——而為稀缺而優化的那一方,在 McKinsey 調查中已有 20% 企業領袖表示 token 成本正在限制 AI 導入的世界裡,占據結構性的有利位置。
對美國實驗室而言,令人不安的推論是:豐饒從來不是免費的。算力財富買到了速度,也買到了習慣——探索式推理、大方揮霍的上下文、吃 token 的 agent 迴圈——而這些習慣,對價格敏感的市場未必永遠買單。對中國實驗室而言,推論正好互為鏡像:定義它們的約束,正在變成它們的出口商品。2.7% 的問題已經不是誰領先,而是誰付得起留在賽局裡的代價。