← All posts / Research

BrowseComp 88.6 分、承諾開源權重:AllSpark 的 Iris 搜尋代理登上開源王座

AllSpark 團隊發表 Iris-mini 與 Iris-pro 兩個開放權重搜尋代理,在 BrowseComp、DeepSearchQA 與 HLE 寫下同級開源模型最佳成績,並完整公開 SFT-RL climbing 訓練配方。

BrowseComp 88.6 分、承諾開源權重:AllSpark 的 Iris 搜尋代理登上開源王座

開源搜尋代理出現了新的標竿。一個名為 AllSpark 的團隊於 2026 年 9 月 3 日提交論文《Iris: Climbing to the Search Frontier》(arXiv:2609.04304),全文 12 頁,介紹了 Iris-mini 與 Iris-pro 兩個開放權重搜尋代理。在目前最嚴苛的幾個代理式搜尋基準上,它們寫下了各自參數量級中開源系統的最佳綜合成績。論文發表幾天內就衝上多個 AI 新聞追蹤器的頭條,原因很簡單:這不只是一次排行榜的攻頂,而是一份完整的配方。

釋出了什麼

Iris-mini 是以 Qwen3.6-35B-A3B 為底座的 35B-A3B 混合專家(MoE)模型;Iris-pro 則是以 Qwen3.5-397B-A17B 為底座的 397B-A17B 模型。兩者都保留了基底模型的 256K token 上下文視窗。型號中的「A」很關鍵:每個 token 分別只啟用 30 億與 170 億參數,這讓一個 397B 參數的搜尋代理得以在超大雲端訓練叢集之外被實際部署。

在啟用上下文管理、以單一 ReAct 代理評測(無子代理、無測試時驗證)的設定下,核心數字如下:

  • Iris-pro:BrowseComp 88.6、BrowseComp-ZH 85.1、DeepSearchQA(F1)92.9、Humanity’s Last Exam 純文字子集 56.4。
  • Iris-mini:BrowseComp 82.2、BrowseComp-ZH 84.8、DeepSearchQA 86.9、HLE 52.3。

開源陣營的競爭有多激烈,從對比可以看出:在 30–35B 級距,Iris-mini 在 BrowseComp 上以 82.2 擊敗前一屆最佳 XYZ-Aquila-mini 的 78.8,領先 3.4 分。在約 400B 級距,Iris-pro 在 BrowseComp 領先 XYZ-Aquila-pro 3.8 分、在 HLE 領先 3.1 分,BrowseComp-ZH 以 85.1 打平,DeepSearchQA 則以 92.9 對 92.5 略勝。團隊並指出,Iris-mini 在 BrowseComp 上已接近 Kimi-K2.6(83.2)與 DeepSeek-V4-Pro(83.4)這類 1T 級模型——而它每個 token 啟用的參數大約只有對方的三十分之一。

與前沿的差距當然還在。GPT-5.6 Sol 在 BrowseComp 拿 90.4,Kimi-K3 達 91.2,Claude Fable 5 在完整版 HLE 拿 64.5、DeepSearchQA 拿 94.2。Iris 是開源權重的王者,不是搜尋能力的總冠軍——這個區分作者自己也講得很清楚。

真正有趣的部分:訓練資料怎麼造

排行榜數字很快就會過時,讓這篇論文值得一讀的是資料管線。訓練搜尋代理的核心難題在於:網路上自然出現的問題太簡單——模型往往不靠搜尋、光憑參數記憶就能回答。近期的系統多半透過遍歷超連結圖或知識圖譜、沿路遮蔽實體來製造難題;Iris 則把這個思路推成一條全自動、由 LLM 驅動的三階段管線。

網頁圖譜建構。 把語料庫建模成有向圖:頁面是節點、超連結是邊。以「答案錨定」模式選出種子頁——先固定目標答案實體,再抓取描述它的頁面——然後沿出鏈擴展成局部子圖,頁面全文保留至固定預算。

任務合成。 子圖先被蒸餾成緊湊的實體圖,只保留位於通往種子主題多跳路徑上的實體與帶型別的語意關係。接著在圖上出一道題,附帶硬性約束:推理路徑必須穿越至少 N 個相互耦合的關係,且答案不得出現在題目中。然後是最漂亮的一步——錨點抽象:題目中每個非答案實體都被改寫成一段描述性指涉,能唯一辨識該實體,但絕不使用它的名稱或別名。得到的題目無法靠字串比對丟進搜尋框破解,代理必須靠推理來消歧。

雙準則驗證。 一道題只有同時滿足兩個條件才被採納:參考模型在閉卷(無工具)狀態下答錯——證明它真的需要搜尋;但在供給證據圖後答對——證明它可解且答案唯一。兩項檢查都由語意匹配的裁判模型判定,只取交集。

SFT-RL climbing,以及對評測框架的誠實

訓練配方讓監督微調(SFT)與對真實網路搜尋的強化學習(RL)交替進行。強教師模型在獲採納題目上產生的軌跡經過兩道過濾——先在軌跡層級過濾正確性、退化行為與搜尋深度,再由裁判在回合層級過濾,而裁判的評分準則是從資料中歸納出來的,不是人手寫的。RL 跑在開源框架 Relax 上,獎勵裁判與觀測摘要器都部署在訓練叢集內部,過長的 rollout 會在請求層級被中斷、並在下一步從已提交的前綴恢復。

這種交替就是團隊所稱的「SFT-RL climbing」:每一輪 RL 中最難解出、最有效率的 rollout 會被送回下一輪監督訓練,讓探索期發現的行為先被鞏固,再展開下一輪探索。這是一個帶棘輪的自舉迴圈。

同樣值得注意的是評測紀律。論文的核心方法論主張是:推論時的上下文管理(CM)——摘要、歷史壓縮、DeepSeek-V3.2 帶起的 discard-all 重置——在這些基準上的影響力,大於多數系統之間的帳面差距。因此每個基準都同時報告有無 CM 兩種設定,並固定工具集、上下文長度與裁判。團隊還在三個強制點封鎖了對 Hugging Face 上承載基準答案的 dataset 與 Space 頁面的存取,防止基準洩漏污染 RL rollout。在一個「解出來」常常等於「在訓練資料裡看過答案」的領域,單是這一段就值得肯定。

為什麼重要

第一,開源搜尋能力正在快速複利成長。400B 級距開源模型之間的領先幅度只剩個位數分數,而一個 35B-A3B 模型已能在 BrowseComp 上與 1T 級系統纏鬥。專精化——Iris 只為網路搜尋與長程資訊檢索而訓練——正在買到過去只有堆疊規模才買得到的效能。

第二,這次發布的意義大於分數本身。團隊計畫連同模型權重,一併公開資料建構、訓練與評測的完整配方。可重現的代理式搜尋 SFT-RL 管線過去一直藏在閉門實驗室裡;一條有文件、防洩漏、雙重驗證的資料管線,才是其他團隊真正能拿來蓋房子的地基。

第三,上下文管理的發現對所有看榜的人是一記無聲的警訊。如果框架選擇造成的分數擺動大於系統之間的差距,那麼代理排行榜的排名有一部分量測的是推論鷹架,而不是智慧。Iris 的「有無 CM」雙軌報告,立下了其他評測應該跟進的標準。

懸而未決的問題仍是老幾樣:這些模型在真實、對抗性、非基準任務上的表現如何;當基準答案本身成為下一代代理的訓練資料,汙染風險會怎麼累積;以及只透過論文現身、格言是「做對的事,把事做對」的 AllSpark,是否兌現權重釋出的承諾。但就本週而言,開源搜尋的前沿有了新的標記——而且附上了說明書。