上海 AI 實驗室開源 Atria Dawn Preview:744B 參數的智能體模型,做不到「可驗證」絕不收工
MIT 授權開源權重、256K 上下文,在 BrowseComp、DeepSearchQA、BFCL v4 與 CyberGym 等 five 項基準奪冠,論文還內附一份 769 任務的人機協作研究。
整整四天,史上最強的開源權重智能體模型之一,就這麼靜靜躺在 Hugging Face 上,沒有任何官方宣傳。Atria Dawn Preview 的權重由上海人工智慧實驗室於 9 月 11 日上傳;直到本週,隨著一篇 143 位作者、題為《Atria Dawn: The Dawn of Agentic Superintelligence》的論文(arXiv:2609.15818)發布,這個模型才開始在全球社群走紅。它是新一代智能體模型的預覽版本,建構於 744B 參數的 GLM-5.2 MoE 基座之上,具備 256K 上下文視窗、採 MIT 授權開源,設計哲學異常鮮明:在輸出達到可執行、可驗證、可重現之前,任務不算完成。
Atria Dawn Preview 到底是什麼
多數前沿的「智能體」模型,本質上是加了工具呼叫功能的對話模型。Atria Dawn Preview 則被其開發者定位為智能體基礎模型(foundation agentic language model)——智能體能力是主體,不是附加功能。模型將開放性問題推向可以用「實際跑一遍」來檢驗的結果:結合任務目標與環境回饋,支援從問題分析、方案設計、工具使用、程式實作、實驗執行,到結果分析與失敗恢復的完整迴圈。
上海 AI 實驗室將模型能力劃分為四個維度:
- 探索(Discovery)——檢索與整理證據、執行深度研究,將研究問題轉化為可執行的實驗計畫。
- 創造(Creation)——打造軟體、互動應用、遊戲、資料視覺化與機器學習系統。
- 交付(Delivery)——將文件、資料與設計需求轉化為報告、簡報等結構化產出。
- 網路安全(Cybersecurity)——在授權環境中分析安全問題、驗證漏洞、套用修復並重新驗證。
第四個維度尤其值得注意。極少有模型卡把安全攻防當成與研究、辦公生產力並列的一級能力——而基準分數說明這不是行銷話術。
基準測試:與前沿匹敵,五項奪冠
在涵蓋搜尋、程式、工具使用、生產力與安全的 16 項基準上,Atria Dawn Preview 與前沿智能體全面抗衡,並在其中 5 項創下已發表的最高分,多項擊敗 GPT 5.6 sol、Claude Opus 5、DeepSeek V4 Pro、Kimi K3、Qwen 3.8 Max 與 GLM 5.3:
| 基準 | Atria Dawn | 最強對手 |
|---|---|---|
| DeepSearchQA | 96.0 | Kimi K3 — 95.9 |
| BrowseComp | 92.5 | GPT 5.6 sol — 92.2 |
| BFCL v4(工具使用) | 77.0 | GLM 5.3 — 74.1 |
| AutomationBench | 53.8 | Qwen 3.8 Max — 49.7 |
| CyberGym | 86.5 | GLM 5.3 — 84.5 |
深度研究是最大亮點:DeepSearchQA 96.0、BrowseComp 92.5,在評測表中領先所有列出的閉源前沿模型。衡量端到端任務自動化(而非單輪工具呼叫)的 AutomationBench 也是類似劇本——領先最近的對手超過 4 分,領先 GPT 5.6 sol 與 Claude Opus 5 約 8 分。
不過它並非全面稱霸。SWE-bench Pro 上它拿 59.6,Claude Opus 5 為 74.7;Terminal-Bench 2.1 拿 78.3,Claude 為 90.2;GDPval 與 JobBench 上閉源前沿仍舊領先。換句話說:在查證資訊與自動化工作流上達到當前最強,在硬核軟體工程上則只是「有競爭力」。另外,模型僅接受文字輸入——端點會直接拒絕影像。
可驗證經驗管線(Verifiable Experience Pipeline)
訓練方法可能是這篇論文最核心的貢獻。Atria Dawn Preview 透過可驗證經驗管線訓練:將工具中介的互動連接到可執行環境與外部驗證的結果。模型不是針對評分準則或人類偏好來最佳化,而是從「程式跑了、工具呼叫了之後實際發生什麼」來判定軌跡成敗——這也正是它部署時行為「天生可驗證」的同一性質。
這與整個領域的方向一致——用可執行獎勵取代人類偏好的強化學習——但規模與廣度罕見,同時橫跨研究、工程與辦公環境。
藏在論文裡的 769 任務人機協作研究
論文最特別的一節與基準無關。團隊把模型自身的研發過程當成人機協作的個案來研究:分析 56 位參與者、769 條任務紀錄,並對照智能體日誌。當參與者被要求在可比條件下評估已完成的任務時,他們認為其中約三分之一的 AI 協作任務若沒有 AI 根本做不出來。更引人注目的是:智能體經常主動提出方法並實作修正,而人類保有大多數最終決策權,並透過判斷與回饋引導探索方向。
作者的精神值得轉述:這標誌著從任務層級的執行走向專案層級的夥伴關係,人類的心力集中在什麼值得做、證據應如何引導研究。他們主張,通往更自主的 AI 研究之路,必須同時推進「發現的能力」與「有意義的人類監督能力」——在持續開發的風險與方向上,保住人類的問責權威。一篇打造前沿智能體的論文,把結論用來論證人類權威的重要,相當罕見。
取得方式與部署
Atria Dawn Preview 提供兩個版本——全精度(bf16)與 FP8 量化——上下文皆為 256K,已上架 Hugging Face(internlm/Atria-Dawn-Preview)與 ModelScope。本地部署支援 SGLang v0.5.13.post1+ 與 vLLM v0.23.0+。託管服務方面,國際端點為 api.atria-asi.ai,中國端點在 intern-ai.org.cn 的探索平台上,也可以透過 Responses API 將模型接入 OpenAI Codex 作為自訂供應商。
為什麼重要
三件事讓這次發布不只是又一次大型開源權重釋出。第一,MIT 授權落在真正達到前沿智能體水準的 744B MoE 上,等於替商業採用拆掉幾乎所有摩擦——沒有用量上限,授權本身也不內建區域限制。第二,譜系本身:上海 AI 實驗室建構於 Z.AI 的 GLM-5.2 基座之上,是中國開源生態系自我疊代的縮影——就在同一週,Z.AI 才剛完成數十億美元級的融資。第三,證據優先的評測敘事:一個只在可驗證結果時才終止的模型,被放在最看重可驗證性的基準(深度研究、自動化、安全)上密集檢驗。
9 月 11 日無聲上傳、四天後全球走紅,這件事本身也說明了如今模型發布的新常態——權重先說話,論文其次,行銷從缺。以預覽版而言,Atria Dawn 的文件完整度罕見:既有它能做什麼,也有建造者認為該如何治理它。「黎明」這個比喻或許宏大,但比喻底下的東西是真實的、開放的,而且——至少在五個排行榜上——就是目前最強的。