← All posts / Models

Apodex 1.1 提出「環境規模化」代理人新路線,同步開源可在本地部署的 35B Mini 模型

一篇 70 位作者共同掛名的論文主張:代理能力的下一波躍升來自規模化「可執行環境」與「多代理人協作」,並以 35B 開源權重模型在財務與科學基準闖進前沿地帶。

Apodex 1.1 提出「環境規模化」代理人新路線,同步開源可在本地部署的 35B Mini 模型

當整個 AI 產業的目光還鎖定在原始模型規模與聊天基準分數時,一個更安靜的論點正在成形:代理人的下一波真正突破,將來自規模化它們工作的「環境」,而不只是它們思考用的「參數量」。8 月 24 日,一支約 70 位作者組成的團隊發表了論文《Apodex 1.1: Scaling Agentic Intelligence for Complex Work》,隔天旋即登上 Hugging Face Papers 當日研究趨勢榜首。與論文同步發布的,還有一項對研究作品而言相當罕見的組合:一個 350 億參數的開源權重模型、一套執行框架(harness),以及一個已經上線的線上工作台。

這次發布的核心主張看似簡單:深度研究類產品擅長閱讀網頁、產出結構化報告,但真正的專業工作——清洗一份混亂的臨床資料集、逐條梳理合約檔案、為匯率風險設計避險結構——是在報告本該交付之後才真正開始。Apodex 1.1 的設計目標,是直接「走進」檔案、程式碼與工具之中,從原始輸入一路做到可驗證的交付成果,而不是站在外圍做摘要。

兩條新的規模化軸線

論文的核心論點是:代理能力沿著兩個尚待開發的維度擴展:

環境規模化。 團隊沒有單純增加程式設計資料,而是系統性地圍繞真實情境建構訓練任務——複雜檔案處理、程式碼執行、工具使用與多步驟任務推進——涵蓋搜尋、檔案與工具等多種環境類別,規模達數千萬個任務。其前提是:推理必須透過工具才能落地——當判斷需要資料時,模型讀檔案、跑程式;當前提需要驗證時,模型搜尋、查證。

代理協作規模化。 第二條軸線規模化的是任務被拆解、協調、整合與重組的能力——跨越多個代理人、多個分支與多個時間點。在產品的「Deep Discover」模式下,決定任務能否拆分、如何拆分、派出幾個子代理的,是模型本身,而不是預先寫好的編排腳本。中間成果持續回流到共享的任務狀態,主任務可以即時吸收新發現、重排優先順序,不必等每條分支都跑完。

這兩個維度共同運行在一個稱為 AgentOS 的共享執行層之上:它維護工具呼叫、檔案狀態與任務進度,管理子代理的建立、調度與生命週期,並提供統一的驗證機制。團隊特別強調,兩條規模化路徑並非硬拼在一起的兩個獨立功能——它們共享同一個底層執行環境,這也是檔案環境的能力增益與代理協作的增益能夠在同一套訓練與評測系統中同步推進的原因。

數字會說話

在評測方面,團隊報告 Apodex 1.1 在 Agent Team 設定下,於專業工作、財務與科學研究領域達到前沿水準:APEX-Agents 38.5、GDPVal 78.8、FrontierFinance 54.3、FrontierScience-Research 63.3、BioMysteryBench 35.3、Humanity’s Last Exam 56.1。Agent Team 設定在全部六項基準上都穩定優於單純的 ReAct 設定,並在 FrontierFinance 與 FrontierScience-Research 上取得所有受測系統中的最高分。為防範基準污染,團隊在評測期間封鎖了對基準托管網站的存取。

更引人注目的結果來自 Mini。35B 的 Apodex-1.1-mini 在專業工作、財務與科學領域達到部分前沿系統的表現區間——它在 FrontierFinance 上以 50.2 領先,在 APEX-Agents 上拿到 27.7,緊咬完整版系統。由於多家專有競爭對手不公布參數量,團隊刻意避免無依據的規模比較;真正的重點在於:一個公開 35B 規模的模型,能在同一批複雜工作榜單上與前沿系統同台競爭。

技術細節

從技術報告與模型卡可以看出幾個亮點:

  • 基礎模型。 Apodex-1.1-mini 建構於 Qwen3.5-35B-A3B 之上——一個約 3B 有效參數的混合專家架構,以 Apache 2.0 授權釋出。NVFP4 量化版搭配 8-bit 混合精度,上下文視窗達 262,144 tokens。
  • PIVOT-RL。 長任務只提供粗粒度的終端獎勵——一條成功的軌跡仍可能包含證據薄弱的決策,一條失敗的軌跡也可能包含大量有價值的前期工作。PIVOT-RL 對數十萬條軌跡做事後回溯分析,定位模型「轉錯彎」的關鍵決策點,並在這些位置建構局部續跑任務。糾正提示只在訓練時使用,推論時完全不出現。
  • Statement Review(陳述審查)。 關鍵結論在交付前,會經過獨立審查步驟,對照來源、資料與運算結果檢查。當引用不符或證據不足時,結果會被退回修正,而不是直接放行。
  • AI4AI。 在一個極具啟發性的實驗中,團隊讓 Apodex 1.1 擔任全自動教師——出題、篩選軌跡、評估進度,全程無人類介入——教會 Qwen3.5-0.8B 使用搜尋工具與權威資料庫。經過 10 輪自動迭代,這個小模型在 200 題臨床試驗、蛋白質結構與蛋白質註解任務上的總分從 51.0% 升到 56.0%。

工作台與開源框架

這次發布的主體,是驅動 apodex.ai 線上工作台的完整版 Apodex 1.1 模型:使用者可以把論文、資料集、試算表與程式碼帶進同一個長時間執行的任務,並在過程中隨時介入。展示的實際案例不像聊天機器人示範,更像初級分析師的工作產出:破產撤銷權分析中,模型逐筆重建六筆優先清償移轉,算出 55 萬美元淨曝險,並提出 17.5 萬至 35 萬美元的和解區間與客戶備忘錄;外匯避險任務中,模型不僅算出各選擇權結構的權利金與 760 萬美元淨成本,還抓出 CFO 一開始就錯誤的會計假設,依 ASC 815 重新推導三種結構的損益影響;分子動力學任務中,模型讀取 7M6J 蛋白質結構,選用 Martini 3 粗粒化方法完成轉換,為下游模擬做好準備。

對開發者而言,開源的 FrontierAgent 框架(GitHub:ApodexAI/FrontierAgent)提供終端機 TUI,支援兩種模式——ReAct 單代理循序執行,以及 Agent Team 平行子代理調度。它在 macOS 與 Linux 上單條命令即可開箱執行,無需預裝或依賴 Docker;有 Docker 時改用容器以獲得更強的執行隔離。團隊還預告了 FrontierSearchBench 與 FrontierResearchBench 兩個新基準,將以專文說明並開放。

為什麼重要

這次發布為今年持續蓄勢的一個轉向提供了新佐證:代理能力的 frontier 正從「更大的模型」移向「更豐富的環境與更好的協作」。如果一個 35B 的 MoE 模型加上開源框架,就能在財務與科學工作的榜單上與前沿系統平起平坐,那麼專有聊天模型的護城河,恰恰會在企業真正付費的地方——長時程、可驗證、重度依賴檔案的專業任務——變得更窄。

當然也有但書。這些基準相對小眾、部分更是團隊自己提出的,自我評測永遠值得多一分審視。但完整的開放組合——權重、框架、論文與線上產品,並明言污染防護措施——已比多數前沿實驗室更透明,而「環境規模化」這個框架,大概率會被同行迅速仿效。

下一代模型的預訓練已經展開,團隊表示這一版的工程與資料成果將直接延續到未來版本。這兩條規模化軸線,預期將成為圈內的新標準詞彙。