三%的距離:Bloomberg Intelligence 指出 DeepSeek 已把美中 AI 差距縮到史上最小
DeepSeek V4.1 Flash 在 LiveBench 拿下 81.1 分、全球第六,創中國模型新高,把美國領先幅度從年初的 15% 壓縮到約 3%——出口管制的戰略效果與中國上千個模型混戰的獲利難題,同時浮上檯面。
本週人工智慧領域最關鍵的數字,不是參數量,也不是融資金額,而是三%。彭博產業研究(Bloomberg Intelligence, BI)資深分析師 Robert Lea 在 10 月 5 日發布的報告中計算指出:在最能代表模型能力的獨立基準 LiveBench 上,最強的中國模型與最強的美國模型之間的差距,已經收斂到大約 3%——低於 5 月的約 9%,更遠低於年初的 15%。直接的推手是 9 月發布的 DeepSeek V4.1 Flash:它在 LiveBench 拿下 81.1 分、排名全球第六,是自 2025 年初 DeepSeek 以 R1 推理模型震撼業界以來,中國模型寫下的最佳名次。
過去兩年,華府與矽谷的共同假設是:美國的出口管制能把中國的前沿 AI 擋在一臂之外。3% 的差距不是一臂之外,是排行榜上的捨入誤差。
報告實際上說了什麼
Lea 的分析以 LiveBench 9 月榜單為基礎,經《海峽時報》、《商業時報》與 Yahoo Finance 等媒體轉載。計分板是這樣的:Anthropic 的旗艦模型以 83.4 分居冠,DeepSeek V4.1 Flash 以 81.1 分緊隨其後——2.3 分的落差,BI 概括為「大約 3%」。在 Lea 的評估中,這代表 V4.1 Flash 的表現已與 Anthropic、OpenAI 的主力系統「相當」,也是 BI 迄今記錄到的最小美中差距。
軌跡跟快照一樣重要:差距從年初的 15%,到 5 月的 9%,再到現在的 3%——不是一次性的暴衝,而是持續、單向的壓縮。而且這段期間絕對前沿本身也在前進:中國模型追趕的不是靜止的靶子,而是一個同樣在衝刺的靶子。
報告點出兩個結構性驅動力。第一是 AI 人才縱深——後 R1 時代這兩年,中國實驗室累積了前沿規模的研究團隊。第二更顛覆:中國研究人員已成為「為國產硬體優化模型」的專家。當輝達最強的晶片買不到,你就用工程繞過管制——稀疏激活、激進的 KV 快取壓縮、針對手上真的拿得到的加速器調校的量化方案。DeepSeek 的 V4 架構論文,讀起來就像這套紀律的宣言。
BI 也清楚這個數字不代表什麼:LiveBench 前 15 名中只有 3 個是中國模型;排名逐月變動;而正如 Lea 所言,能力不等於商業實力。
撬動指針的模型
DeepSeek V4.1 Flash 作為「中國追上來了」論述的戰利品,其實有點尷尬——因為它根本不是堆料旗艦。它於 9 月 10 日以 MIT 授權開放權重發布,支援原生視覺與百萬 token 上下文。骨幹是 5,520 億參數的混合專家(MoE)架構,但處理輸入時只激活約 80 億參數、生成輸出時激活 160 億——這種非對稱激活設計讓推論成本激進地便宜。V4.1 版本加入因果編碼器—解碼器(Causal Encoder-Decoder)架構,並把 KV 快取記憶體需求砍到前代約四分之一(每 token 約 890 位元組)——百萬 token 上下文因此才真正伺服得起。
這個工程輪廓,才是故事中的故事。一個與 Anthropic 最強模型差距 3%、卻只激活自身 1.5% 參數、而且任何人都能以 MIT 授權下載的模型,是對封閉前沿 API 經濟學的直接攻擊。這正是 2025 年 1 月讓 R1 成為震撼事件的那套打法——比的不是任何代價下的能力,而是每一美元能買到多少能力。
承受壓力的出口管制
地緣政治的解讀相當直白。美國晶片管制的设计目標,是遏止中國 AI 進展、讓華為等業者拿不到打造可信替代品的算力。Lea 的結論——中國的進展「讓人更進一步懷疑美國在 AI 領域技術霸權的長期可持續性」——等於對出口管制投下懷疑票:如果在制裁之下差距還能從 15% 縮到 3%,管制買到的戰略緩衝,比設計時想像的少得多。
報告也點出反作用力。中國模型因「模型蒸餾」指控(即中國實驗室用美國前沿模型的輸出來訓練)在美國面臨升高中的監管審查乃至潛在禁令。而中國的實驗室沒有一家有清晰的獲利路徑:BI 預期中國 AI 產業大約要到 2030 年才可能轉虧為盈,被困在低毛利的 token 供應與價格戰中,而國內市場塞了超過 1,100 個大型語言模型。字節跳動的豆包在應用變現上領先;DeepSeek 與騰訊的聊天機器人至今免費。用 Lea 的話說,「要讓中國 AI 產業站上可持續的獲利基礎,需要競爭壓力降溫、產業整併洗牌,以及更理性的定價。」
與此同時,美國實驗室正朝著兆美元估值的股票上市推進,OpenAI 與 Anthropic 行銷的正是自己的能力優勢。3% 仍然是差距——但拿它當霸權敘事的地基,已經越來越勉強。
為什麼重要
對所有在 AI 上建造或投資的人,有三個 takeaway:
- 基準分數收斂的速度,快過商業模式的收斂。 中國開放權重模型在綜合分數上已進入與封閉前沿的誤差範圍。若能力平價成立,競爭軸線將移往可靠性、工具鏈、企業信任與監管保障——這些仍是美國實驗室領先的場域。
- 開放權重是不對稱武器。 V4.1 Flash 的 MIT 授權意味著那個 81.1 分的 LiveBench 成績是可以下載的。每一家在「封閉最強」與「開放次強、可自架、成本零頭」之間權衡的企業,現在都多了一個只落後前沿 3% 的活選項。
- 政策面臨數學問題。 如果管制無法守住有意義的能力緩衝,華府的工具箱就窄化成禁止採用與盟友施壓——更鈍的武器,而且無論怎麼用,美國晶片商都照樣失去中國市場。
「3%」這個數字本週會被大量引用。但更耐久的訊號是那條斜率:15、9、3。除非美國前沿實驗室能再度拉開差距——而過去九個月顯示他們沒有——那麼「差距」這個框架本身,可能正在接近它的保存期限。
Sources
- [1] https://www.bloomberg.com/news/articles/2026-10-04/us-lead-in-ai-over-china-narrows-after-deepseek-gains-bi-says
- [2] https://www.straitstimes.com/world/united-states/us-lead-in-ai-over-china-narrows-after-deepseek-gains-bloomberg-intelligence-says
- [3] https://finance.yahoo.com/technology/ai/articles/us-lead-ai-over-china-210300658.html
- [4] https://www.livemint.com/ai/deepseek-narrows-ai-gap-with-us-rivals-to-just-3-threatening-american-dominance-11791173222487.html
- [5] https://www.siliconflow.com/blog/deepseek-v4-1-flash-api-migration
- [6] https://www.mindstudio.ai/blog/deepseek-v4-1-flash-specs-architecture