Real-SWE:在沒有任何模型見過的程式碼上評測 Coding Agent——Fable 5.1 以 38.8% 奪冠
Specific Labs 推出的 Real-SWE 基準測試,在授權取得的私有企業程式碼庫上評測 coding agent,杜絕訓練資料記憶作弊。Fable 5.1 解決率 38.8%、GPT-6 Astra 33.8%,開放權重的 GLM-5.3 意外以 28.8% 緊咬——但十項樣本任務中有六項解決率低於 15%。
過去三年問世的每一個 coding agent 基準測試,都共享同一個結構性弱點:任務取自公開的 GitHub 儲存庫,這意味著受測模型很可能早已在訓練資料中看過那個 bug——以及修好它的那個 pull request。9 月 10 日,YC F25 新創 Specific Labs 發布了一個讓這條捷徑徹底失效的基準測試。Real-SWE 只在私有、授權、上線中的企業程式碼庫上評測前沿 coding agent:這些系統從未出現在公開網路上,任何模型都不可能訓練過。第一份排行榜本週上線,結果發人深省。
前提:99% 的企業 token 是看不見的
Real-SWE 背後的論點很直白。Specific Labs 的說法是:「真實企業環境中 99% 的 token,都被藏在前沿模型看不到的地方。」公開基準測試——SWE-bench 及其眾多後繼者——衡量的是 agent 辨識開源 Python 與 JavaScript 專案常見模式的能力。Real-SWE 衡量的則是另一件事:agent 能不能走進一個陌生的專有系統,像新工程師第一週上班那樣讀懂它的業務邏輯,然後做出與現有架構相容的修改。
為了打造這個基準,Specific Labs 向真實公司(具有相當使用規模與嚴苛生產工作負載)取得了授權程式碼庫。他們點名的例子包括:一款擁有超過 20 萬用戶、曾登上 App Store 前 100 名的 Luma/Partiful 競品;一個處理超過 10 萬份銀行對帳單的消費金融平台;以及支撐複雜業務流程的企業級 AI 銷售平台。每個任務都「取自或改編自」分配給支薪工程師的實際工作——帳單修復、稅務計算、客戶遷移——意味著每個任務都與真金白銀直接相關。
任務設計刻意保留模糊空間,程度與 DeepSWE、Terminal-Bench 相當:典型指令長度為 1,742 字元,而參考解答的中位數需要改動 11 個檔案,是 FrontierCode 與 DeepSWE(各為 6 個)的近兩倍。Agent 以原生工具執行——Claude Code、Codex CLI、Gemini CLI、Grok Build、Kimi Code、Muse Code——因為這個基準評測的是「模型+工具鏈」組合,也就是企業工程師實際的工作方式。每個任務對每個模型獨立跑八次,解決率等同 pass@1。
排行榜:Fable 5.1 居首,GLM-5.3 是最大驚奇
頭條結果,附每次 rollout 的估計成本:
| # | 模型(工具鏈) | 解決率 | 每次 rollout 成本 |
|---|---|---|---|
| 1 | Fable 5.1(Claude Code) | 38.8% | $6.96 |
| 2 | GPT-6 Astra(Codex CLI) | 33.8% | $4.67 |
| 3 | Gemini 3.8 Flash(Gemini CLI) | 31.2% | $2.50 |
| 4 | GLM 5.3(Claude Code) | 28.8% | $5.12 |
| =5 | Grok 4.6(Grok Build) | 23.8% | $3.44 |
| =5 | Muse Spark 1.3(Muse Code) | 23.8% | $2.74 |
| 7 | Kimi K3(Kimi Code) | 18.8% | $3.90 |
| 8 | GPT-5.6 Sol(Codex CLI) | 16.2% | $2.65 |
兩個結果特別醒目。第一,Anthropic 的 Fable 5.1 鞏固了它最強 agentic coder 的名聲,但每次 rollout 6.96 美元也是全场最貴——Gemini 3.8 Flash 用約三分之一的價格,拿到只落後 7.6 個百分點的成績。第二,開放權重的 GLM-5.3 以 28.8% 排名第四,引發最多社群討論。正如 explainx.ai 所指出,Real-SWE 上的強勢表現,與 Z.ai 自家的基準分數是截然不同的證據:它暗示 GLM-5.3 的程式能力提升,能夠泛化到真正陌生、私有的企業程式碼——這是大多數開放權重主張很少被要求跨越的門檻。
任務層級的細項,才是這個基準真正殘酷的地方。在分析的十項樣本任務中:
- 多區域掃描與 API 金鑰與環境最可行(解決率 67.2% 與 65.6%)。
- 權益超額明細為 50.0%,客戶身分遷移為 40.6%。
- 然後地板直接塌陷:帳單排程遷移 14.1%、API token 計量 12.5%、S3 資料儲存度量 10.9%、可線性化掃描 4.7%、稅務管轄 3.1%——而分析串流 reducer 是刺眼的 0.0%。所有模型、全部八次 rollout,全數失敗。
十項樣本任務中有六項解決率低於 15%,而且沒有任何模型能解開所有任務。也有出人意料的反轉:總排名第五的 Grok 4.6,在客戶身分遷移上繳出 8/8 全過——這是 Fable 5.1 只拿到 3/8 的任務。GLM-5.3 則是唯一在 S3 資料儲存度量上有進展的模型。即使總分接近,各模型的強弱分布差異極大。
模型怎麼失敗:漏需求,而不是崩潰
Real-SWE 沿用 DeepSWE 的分類法歸納失敗模式,而這個分布說明了「還沒準備好」的真正含義:
- 漏掉需求(省略了指令要求的行為)幾乎是所有模型最常見的失敗模式——Grok 4.6 失敗run 的 67.2%、Kimi K3 的 53.8%、GLM-5.3 的 38.6%、Fable 5.1 的 36.7%。
- 未驗證的假設——對系統瞎猜後直接動工,而不是先在工作區裡查證——以 GPT-5.6 Sol 的 43.3% 最高。
- 整合錯誤(方向對、接線錯)佔 Gemini 3.8 Flash 失敗的 49.1%,是它的主要死因。
- 回歸(改 A 壞 B)相對少見,而改錯檔案——把修改放在執行中的程式根本不會呼叫的地方——幾乎是 GLM-5.3 與 Kimi K3 專屬的行為。
有點違反直覺的是,給模型更多時間並沒有幫助:10 分鐘內結束的 rollout 有 71.4% 失敗,跑更久的反而有 73.4% 失敗。瓶頸不在思考時間,而在梳理多個系統、理解埋在既有業務邏輯裡的需求。
為什麼這件事重要
對於挑選 coding agent 的企業,啟示很直接:公開儲存庫的分數,高估了 agent 在私有程式碼上的準備度,而 Real-SWE 式的分數,是「這個 agent 能不能像新員工一樣上手我們的系統」的更好代理指標。但誠實的結論是:我們離那個現實還很遠——最好的模型也只能解決不到一半的真實工程工單。
Real-SWE 同時也具體呈現了 2026 年評測方法的更大趨勢:隨著排行榜趨於飽和,還能區分模型高下的基準,是那些在結構上就無法被記憶的基準。Senior SWE-Bench 用欠規格的 Slack 風格指令做到;Terminal-Bench 用完整終端環境做到;Real-SWE 則在資料源頭做到——用不可能洩漏進訓練資料的程式碼。這幾種做法互補而非互斥,未來的基準測試大概率會將它們結合。
限制也真實存在、必須講清楚:這個基準問世才幾天,尚無獨立複現;排行榜由建造它的實驗室自己營運;而且因為程式碼庫是私有的,外部研究者無法像審計 SWE-bench 那樣逐題檢查。私有性正是重點——它讓基準無法被記憶——但這是用可審計性換取公正性,排行榜的長期信譽,取決於能否持續輪換新的企業程式碼庫以抵抗過擬合。
儘管如此,第一個數據點彌足珍貴。當 coding agent 終於在它們從未見過的 99% 程式碼上被打分數:前沿模型解決約三分之一的真實工單,最好的開放權重模型落後領先者十個百分點,而最困難的業務邏輯任務無人能解。基準污染一直在恭維我們。Real-SWE 是那面鏡子。
結果與方法學詳見 realswe.withspecific.com。解決率為每任務八次獨立執行的 pass@1 平均;成本為 Specific Labs 公布之每次 rollout 估計值。