← All posts / Research

SemiAnalysis 研究揭露:開源模型追上閉源前沿的速度,每個 AI 時代都縮短一半

SemiAnalysis 最新研究發現,開源權重模型追平閉源前沿模型所需的時間,隨每個 AI 時代以減半速度壓縮——從擴展時代的 12 個月,到如今不到 5 個月,而 Fireworks 單日處理量已突破 40 兆 token。

SemiAnalysis 研究揭露:開源模型追上閉源前沿的速度,每個 AI 時代都縮短一半

SemiAnalysis 分析團隊本週發布了最受矚目的研究之一:〈Are Open Models Catching Up?〉(開源模型正在追上嗎?)。這份由 Evan Cloutier、Max Kan、Jordan Nanos 與 Dylan Patel 撰寫、於 2026 年 8 月 21 日刊出的分析,重建了近三年的模型發展史,得出一個看似簡單卻意義深遠的結論——在 LLM 的每一個新時代,開源權重模型追平該時代首款閉源前沿模型所需的時間,都以減半的速度壓縮。

時機點至關重要。過去兩個月是開源 AI 的爆發期。2025 年 1 月的「DeepSeek 時刻」雖然攻佔了所有頭條,卻沒有人真正用 R1 做出有經濟價值的工作;相較之下,如今的 GLM 5.3 與 Kimi K3 已「真正能勝任許多讓 Anthropic 衝上 650 億美元以上 ARR 的編程與代理任務」,作者如此寫道。光是他們追蹤的推理服務商 Fireworks,每日處理量就超過 40 兆 token——約為 OpenAI API 三月底流量的兩倍。這不再是新奇現象,而是一場承載真實經濟工作負載的結構性轉變。

三個時代,一條加速曲線

這項研究在方法論上的核心洞見,是拒絕用同一組基準測試跨時代比較。「每個基準測試都是特定時代的產物,」作者論證:基準誕生是為了區分當時模型的能力,一旦被爬升至飽和便遭棄用。因此他們將 LLM 歷史切分為三個時代,各自採用精心策劃的基準組合評分,並將每個時代的最佳成績常態化為 100 分。

時代一:早期擴展(2022–2024)。 參照點是 GPT-3.5 Turbo 與 Llama-2-70B,採用 GSM8K、HumanEval、TriviaQA 與 MMLU-Pro 衡量。GPT-3.5 Turbo 的常態化綜合得分為 75.7;Llama-2-70B 僅拿到 39.9——差距高達 35.8 分。開源模型花了大約 12 個月才由 Llama-3.1-405B(2024 年 7 月)填平這道鴻溝。隨後 DeepSeek V3 在 2024 年 12 月以 94.1 對 95.5 的綜合分追平該時代最後一款前沿模型 GPT-4o,而 Qwen2.5-72B 更以六分之一的參數量逼近 GPT-4o。

時代二:推理(2024–2025)。 OpenAI 的 o1-preview 於 2024 年 9 月 12 日發布,徹底重寫了基準測試版圖——小學數學讓位給 AIME 與 Humanity’s Last Exam。但這次起跑差距小得多:僅 12.1 分,功臣是 DeepSeek R1。R1-0528 檢查點於 2025 年 5 月以 78 分封閉差距,追平耗時 8.5 個月。

時代三:代理(2025–今)。 隨著 Claude Code 於 2025 年 5 月正式發布,重要的基準測試移師終機:Terminal-Bench 2.1、BrowseComp-Plus、𝜏³-banking 與 DeepSWE。多數專家以 Opus 4.5 標記這個時代的起點,因為它的可靠度樹立了標竿。然而儘管利害關係空前——OpenAI 與 Anthropic 在此時代平均每 51 天就發布一款新模型(時代一為 213 天、時代二為 120 天)——差距收斂的速度卻快過以往任何時期。Kimi K2.6 以 56.3 分在 4.8 個月內超越 Opus 4.5;GLM-5.2 以 72.4 分在 6 個月內越過 GPT-5.2。

12 個月、8.5 個月、不到 5 個月。「追平時間隨每個後續時代減半的趨勢,一致得驚人,」作者指出。

他們如何測量

團隊自行執行了大部分基準評測,採用 Prime Intellect 的評測技術棧——包含其 environments hub 與 Prime-RL 內建的 evals harness——其餘分數取自 Artificial Analysis 與 Datacurve 的 DeepSWE 排行榜。開源模型以發布當時的方式部署:對應年代的 vLLM 版本、當時使用的硬體、模型卡上的取樣設定;閉源模型則針對鎖定的 API 版本評測。Prime Intellect 的 Florian Brand(@xeophon)協助挑選基準並驗證正確性。

作者自己承認的限制

這份研究對自身局限異常坦白。基準測試並非實際工作的完美代理:「Kimi K3 在我們的策劃組合上得分高於 Fable 5,但我們在 SemiAnalysis 的日常工作中仍偏好使用 Fable,」作者坦承——部分歸功於 Anthropic 透過 Claude Code 與 Claude Tag 將模型產品化的功力,部分則是承認公開基準可能被「針對性建構高度模擬基準任務的 RL 環境」刷分。

他們也預先回應了另一種質疑:時代三的追平時間是否因西方實驗室投入更長的安全測試而被人為壓低?答案是否定的——GPT-4 在發布前 218 天就完成訓練,而即使假設 Mythos 在 2 月中旬完訓,距 Fable 發布的延遲也只有 114 天。

為何此時此刻重要

這份研究發表於前沿實驗室經濟學承壓的敏感時點。Anthropic 的銀行團正以近 2 兆美元估值為 IPO 造勢,背後是 650 億美元以上的年化營收;同一週,OpenAI 將 GPT-5.6 Sol API 價格調降超過 20%——這是不到一個月內的第二波降價——以應對從下方擠壓前沿價位帶的開源強權。如果開源模型持續以零頭成本追平閉源模型,最直接的問題便是模型層是否走向商品化,作者也承認這個結局「顯然會對前沿實驗室的利潤造成災難」。

不過,這份報告對閉源模型的前景,其實不如標題趨勢暗示的那麼悲觀。完整的未來推演藏在付費牆後,但論述主軸很清楚:每個新時代都以一次前沿研究突破開場、重置差距,而護城河正持續從原始模型能力,轉移到包裹模型的產品本身。差距終會閉合;然後總有人發明下一個時代。

對於所有「消費 token」而非「販售 token」的人而言,作者的結論值得謹記:「這是 token 消費者的黃金時代。」