← All posts / Models

便宜 64%、距離前沿只差一分:Cognition SWE-2 用單次 RL 訓練搞定所有推理力度

Cognition 以 Moonshot 開源權重的 Kimi K3 為基底後訓練出的 SWE-2,在 FrontierCode 1.1 Main 拿下 50.0%,僅落後 Anthropic Fable 5.1 一分,成本卻低了 64%;其關鍵在於以 Pareto 導向的成本懲罰,在單次 RL 執行中同時訓練 medium、high 與 max 三種推理力度。

便宜 64%、距離前沿只差一分:Cognition SWE-2 用單次 RL 訓練搞定所有推理力度

Devin 背後的公司 Cognition 發布了迄今最強的程式碼模型 SWE-2,而數字訴說的是一個「前沿正被從下方逼近」的故事。SWE-2 以 Moonshot AI 開源權重的 Kimi K3(2.8 兆參數、已針對代理式編碼做過大量 RL 訓練的基底模型)進行後訓練,在 FrontierCode 1.1 Main 拿下 50.0%——距離 Anthropic 的 Fable 5.1(50.9%)只剩不到一分,每任務成本卻低了 64%。它同時在 Terminal-Bench 2.1 拿到 92.8%、在 DeepSWE 1.1 拿到 73.0%,並以約四分之一的成本逼近 GPT-6 Astra。

這次發布有兩個重要意義。第一,它至今最清楚地證明:開源權重基底只要配上一條夠認真的後訓練管線,就能實質坐上編碼能力的前沿——而且價格遠低於那些制定基準的實驗室。第二(技術上更有意思的是),SWE-2 引入了一套能在單次執行中訓練所有推理力度(reasoning-effort levels)的強化學習配方,一次推進整條成本—效能前沿,而不是只最佳化單一操作點。

SWE-2 在實務上改變了什麼

Cognition 上一代模型 SWE-1.7 的使用者經常反映它會過度探索、在簡單任務上「想太多」——這種徹底雖然拉高了基準分數,卻燒掉大量 token 與時間。SWE-2 最大的效率提升恰恰來自相反的行為:在 FrontierCode 1.1 Main 上,SWE-2 medium 中位數只花 18 步就做出第一次真正的編輯,而 SWE-1.7 需要 48 步。它在同一基準上分數高於 SWE-1.7,同時平均少了 58% 的回合數、成本低了 81%。

Cognition 將此歸因於「工程判斷力」而非莽撞:更強的模型能判斷程式碼庫中哪些部分對任務真正重要,因而更早開始實作。內部測試還觀察到其他值得注意的行為模式。SWE-2 撰寫的端到端測試更能可靠地抓到回歸與邊界情況;當顯而易見的路徑被擋住時——公告中舉了一個 MCP 整合不可用的例子——它會從自己已有權限存取的 Slack 頻道歷史中重建所需資料,而非越權;被質疑時,它選擇重新推導結論而不是重新斷言,透過實際執行產物來蒐集證據,而非相信表面文字。

不同推理力度的行為差異也是使用者可以利用的。SWE-2 medium 動手很快,能以低成本處理簡單與中等任務;high 與 max 力度則規劃更多、探索更多程式碼庫,並透過更複雜的驗證管理不確定性——在複雜任務上保有優勢。

Pareto 導向的成本懲罰

這次發布的技術核心是一個新的 RL 目標函數。業界後訓練配方在如何懲罰長度、如何處理多個推理力度上差異極大:例如 Kimi K3 本身就為每個「領域 × 力度」組合訓練一個專家,再透過多教師同策略蒸餾合併成一個模型。Cognition 反其道而行,問的是:什麼樣的獎勵函數能直接最佳化模型在成本—效能平面上的位置?其中「成本」是每次 rollout 的平均成本(美元推理成本與 rollout 時間的混合),「效能」則是解題率。

他們從第一性原理推導出的答案,是對每個力度施加線性成本懲罰,且每個懲罰係數都調校到符合基底模型 Pareto 前沿在該力度處的局部斜率。其幾何直覺在於:當等獎勵線與前沿相切時,提高獎勵就必然推進前沿;若懲罰設得太大,模型會因為讓高力度行為塌縮成中力度行為而獲得獎勵——變便宜了,卻沒有變好。團隊並在附錄中證明:若 RL 目標只取決於平均成本與解題率,獎勵函數就必須是成本與成功率的仿射函數——線性形式不是圖方便,而是必要條件。

配方中還有兩個訓練技巧。其一是指自 SWE-1.6 起沿用的長度加權獎勵基線(length-weighted reward baseline),它在不增加額外成本下降低梯度變異數,並讓 RL 過程中推理與訓練策略的 KL 散度保持低位。系統面則包括:一個會暫存並批次化相近請求的 prefill delayer,以些許首 token 延遲換得每 GPU 與每請求吞吐 10–20% 的提升;線上訓練的推測解碼草稿模型達成 15% 更長的接受長度;搭配量化感知訓練的 NVFP4/FP8 核心,在參數量近 3 倍於 SWE-1.7 基底的情況下,仍壓低記憶體用量與訓練—推理失配。Cognition 還將 RL 環境數量增至三倍,並用舊版 SWE-2 checkpoint 驅動的飛輪強化驗證器以對抗 reward hacking——這是必要之舉,因為更足智多謀的基底模型會找到新的作弊方式。

附帶的可信度評測

不常見的是,Cognition 在模型發布時同步公開了對齊與可信度評測。在一項使用 145 題中國政治敏感議題、以英文、簡體中文與繁體中文提交的宣傳與審查測試中,SWE-2 整體通過率為 98.0%——英文 99.8%、簡中 95.2%、繁中 99.1%——由 GPT 5.6 Luna 擔任評審,對照維基百科參考資料與官方中國立場描述評分。在另一項「情境相依漏洞」評測(測試客戶身分或請求語言是否影響模型實作有漏洞功能 的意願)中,六個受測模型——包括 SWE-2、Kimi K3、GLM 5.3、GPT 5.6、Fable 5.1 與 Opus 5——沒有任何一個框架條件產生統計上顯著的變化。

可用性與價格訊號

SWE-2 今日起在 Devin(Web、Desktop 與 CLI)上架。公告未公布逐 token 定價,但第三方追蹤將「便宜 64%」的比較基準定為 Fable 5.1 Medium 約每 FrontierCode 任務 3.28 美元,且 Cognition 已讓所有 Pro、Max 與 Teams 訂閱者免費使用一個月。在 Hacker News 上,早期討論聚焦在每任務成本的細微差異:SWE-2 底層的 Kimi K3 每 token 比對手便宜,但因用量更大,某些工作負載的每任務成本反而更高。

更大的圖景是:開源權重衍生模型與前沿實驗室旗艦之間的差距,如今是用基準分數的小數點和美元來衡量,而非質的能力差異。當一個後訓練團隊能拿著公開可下載的 2.8 兆參數基底,以 36% 的成本落到最佳閉源模型的一分之內——同時還公開背後的 RL 數學——前沿實驗室的定價權又被侵蝕了一截。對高量代理式編碼的團隊來說,SWE-2 的 Pareto 論證很可能具有說服力:前沿,已經不是一個必須付前沿價格才能抵達的地方。