← All posts / Models

122B MoE 終端 Agent 拿下 Terminal-Bench 64%:T1 把 Agent 強化學習變成一場基礎設施工程

騰訊 Hy 團隊的 T1 以 Qwen3.5-122B-A10B 為底座、純用驗證器驅動的強化學習後訓練,在 Terminal-Bench 2.1 拿下 64.0%——而它真正的貢獻是那些不性感的管線工程:TITO token 保真訓練、R³ 路由回放,與按斷言計數的稠密獎勵。

122B MoE 終端 Agent 拿下 Terminal-Bench 64%:T1 把 Agent 強化學習變成一場基礎設施工程

本週最值得注意的終端 Agent,不是在舊金山某場發布會上亮相的。它以一篇 arXiv 論文的形式出現,提交於 2026 年 9 月 10 日,團隊橫跨騰訊 Hy 基礎模型前沿部門、新加坡國立大學、喬治亞大學、印第安納大學與馬里蘭大學。模型名為 T1——一個 122B 參數的 Mixture-of-Experts Agent,以 Qwen3.5-122B-A10B 為底座,用 PPO 後訓練而成,能在雲端沙箱中操作真實的 shell,單一任務最多進行 300+ 次工具調用,獎勵來自執行每個任務自帶的留出驗證器。

頭條數字相當亮眼。在 Terminal-Bench 2.1 上,T1 解決了 64.0% 的任務,相較底座模型的 43.8%——純靠後訓練拉升了 20.2 個百分點。在 Long-Horizon Terminal Bench 上達到 27.9%,作者報告此成績超過 GPT-5.4(27.2%)與 GLM-5.1(26.7%),並與 Gemini 3.1 Pro 持平。在獨立構造、更困難的 Terminal-Bench Hard 上,T1 拿下 38.0%,勝過 DeepSeek V4 Pro 的 36.0%。在同一評測 harness 下,T1 的 64.0% 高於 GPT-5.4(54.8%)、DeepSeek-V4-Flash(56.9%)與 Claude Opus 4.6(63.8%),僅略低於 Claude Opus 4.7(66.1%)——是同規模區間最好的模型。

但分數並不是這篇論文重要的原因。T1 之所以重要,在於它揭露了 2026 年的 Agent 能力究竟是怎麼被做出來的:不是靠新穎的架構,而是靠一整套多數實驗室不會公開發表的、近乎偏執的基礎設施修補。

從底座到最終模型,四分之三的增益來自強化學習

流水線的分解很說明問題。底座模型在 Terminal-Bench 2.1 上從 43.8% 起步。一個從示範資料初始化的 SFT checkpoint 達到 49.4%——貢獻 5.6 個點。接著,終端任務上的強化學習再添 14.6 個點,抵達 64.0%。按團隊自己的會計,RL 掙到了從底座到最終模型約 72.3% 的距離。模仿學習把模型帶到了五分之一處;從執行結果中學習走完了剩下的路。

獎勵設計解釋了原因。團隊的第一場實驗用的是二值結果——任務要嘛通過驗證器、要嘛沒有——而那場實驗從未超過監督式基線。問題出在資訊密度:一個 rollout batch 要燒掉數百沙箱小時,而二值結果對每條軌跡只回報一個位元。難到無法一次解掉的任務全部得零分,哪怕其中一半的要求已經被滿足。

於是 T1 改為花掉驗證器的全部分辨率。每個任務的驗證器逐條報告每一個斷言,獎勵是通過斷言的絕對數量,在一個為整場訓練固定一次的尺度上歸一化。設計選擇皆有深意:用絕對個數而非比例(長任務完成一半,不會被看成跟短任務完成一半等值);用固定的全域歸一化常數而非逐 batch 最大值(critic 永遠不用追一個漂移的目標);逐斷言報告缺失時回退到二值結果(真正解掉的任務永不會得零分)。

TITO 與 R³:關上稀疏模型的訓推落差

論文技術上最新穎的核心,處理的是所有 MoE 模型 on-policy RL 的夢魘。沙箱產出的軌跡與訓練器施加的梯度之間,橫著幾十個輪次、兩套獨立的執行棧與一個離散路由器——每一個都可能悄悄把更新歸因給一個從未產生該資料的策略。

兩個機制分頭進攻。TITO(token-in, token-out)讓 Agent 交換的是 token id 而非文字:採樣器回傳 token id 及其對數概率,編碼每輪只做一次而不是每次歷史重放都做,模板被釘住以保證渲染是 append-only。在 harness 仍強制產生失配之處,裝配器按四種遞升情形修復輪次邊界——strict、normalized、retokenized、split——隨後一個審計器在下一輪 prompt 內重新定位每段補全,報告損失區內零 token 漂移。關鍵在於:harness 重新分詞的那份副本,永不進入訓練流。

R³(rollout routing replay)處理路由器。MoE 的專家選擇是離散的 top-k,因此一個遠低於任何 logit 容差的數值差,就可能把被選專家換成次席——在 rollout 與訓練之間把一個子網路替換成另一個。R³ 記錄推理時選中的專家集,約束訓練前向複用這些選擇,同時門控仍讀取當前參數的即時分數,讓路由器保持可訓練。capture 缺失會中止整個 rollout,而不是靜默丟樣本。

兩者合力,TITO 與 R³ 把遮罩加權的訓推對數概率平均落差從 0.021 壓到 0.013——約三分之一——且損失區內 token 完全對齊。

他們刻意不用的東西

「刻意不用」一節讀起來像份逆向清單。兩個 KL 項都被關閉,因為凍結的 reference 用自己的專家選擇做路由,會為一個記帳差異懲罰策略。MoE 負載均衡係數設為零,因為均衡壓力要求路由器重新分配的,恰好是回放要求它複現的那些選擇。沒有學習率排程、沒有熵獎勵、沒有長度整形——他們試過的加性長度懲罰反而造成了無界的軌跡增長,而純粹的稠密獎勵讓輪數自行翻倍後趨於平穩。

訓練資料同樣經過審計。T1-15k 是歷經遞迴任務合成(15 輪改寫、五階段篩選)與 LLM 審計後存活下來的 15K 任務子集,審計權重為驗證器 45%、解法 25%、指令 20%、任務價值 10%。任務在四類問題上被硬性拒絕:隱藏需求、測試洩漏、解法投機、以及弱到無法驗證任務目標的驗證器——因為對抗獎勵作弊的第一道防線,是讓可被鑽空子的任務根本進不了池子。

必須講清楚的但書

論文對局限相當坦白。TITO 只在重分詞歷史之內精確;要消掉殘差,需要 harness 把 token id 當作唯一真相來源。二值與稠密獎勵的對比是實驗級證據,不是一場軸對齊的消融實驗。驗證器在 Agent 控制的沙箱內運行,沒有執行期防竄改偵測。而過 sampling——每步啟動多於 batch 所需的試驗、接納最先完成者——系統性地把最難的試驗從訓練中丟掉,而這恰恰是評測失敗集中之處。權重發布、成本與延遲數字均未報告。

還有一個數字值得留意:T1 的平均每任務輪數是 94.4,而 SFT checkpoint 是 31.5。更長的互動既是能力也是成本——在代表性的未解任務上,T1 花掉數百輪,更強的基線只用幾十輪,然後 T1 超時。同樣的 harness 敏感性但書也適用於比較:Claude Opus 4.6 在 Claude Code 下得分 70.1%,在 T1 使用的 Terminus-2 harness 下是 63.8%,所以跨 harness 的榜单數字只能當脈絡,不能當判決。

給從業者的結論,就是 AI Weekly 編輯所下的那一句:終端 Agent 強化學習已經變成一張基礎設施修補的購物清單,而非建模技巧——而一份有系統地關上 on-policy 對數概率落差的 122B 配方,正是那種決定哪些團隊有資格嘗試這類工作的細節。