← All posts / Models

沒有新聞稿,只有權重:上海 AI Lab 的 Atria Dawn Preview 是一款為研究而生的 744B 開源代理模型

上海人工智慧實驗室悄然發布 744B 參數、MIT 授權的代理式 MoE 模型(基於 GLM-5.2)——沒有部落格、沒有定價。三天後一篇 185 位作者的論文揭露了訓練方法:以可驗證的工具成果(包括失敗)作為訓練訊號。

沒有新聞稿,只有權重:上海 AI Lab 的 Atria Dawn Preview 是一款為研究而生的 744B 開源代理模型

在一個把模型發布變成為期一週媒體盛事的產業裡,上海人工智慧實驗室(Shanghai Artificial Intelligence Laboratory)做了一件幾乎沒人再做的事:先出貨,再說話。2026 年 9 月 11 日,一個名為 atria-asi 的全新 GitHub 組織底下出現了一個儲存庫,內含一個 744B(7,440 億)參數的混合專家(Mixture-of-MoE)代理模型,名為 Atria Dawn Preview。沒有部落格文章,沒有新聞稿,沒有定價頁面。只有放在 Hugging Face 與 ModelScope 上、掛在實驗室既有 internlm 組織下的模型權重、一份 MIT 授權條款,以及一份 README。

一天後,FP8 量化版本跟著上線。程式碼發布三天之後,真正的重頭戲才登場:一篇發表在 arXiv 上、題為《Atria Dawn: The Dawn of Agentic Superintelligence》的技術論文,作者名單超過 185 人,不只詳述模型本身,還——更罕見地——附上一篇個案研究,剖析這個模型在開發期間如何改變了實驗室自己的研究流程。

這個發布順序本身就是訊號。這是一個花多年時間把 InternLM 經營成基礎模型研究計畫的實驗室,而不是追逐頭條發布週期的行銷機器。而它悄然交付的東西,值得認真看待。

實際發布了什麼

Atria Dawn Preview 是一個總參數量 744B 的混合專家模型,建立在 Z.ai 於 2026 年稍早發布的 GLM-5.2 基礎模型之上。模型卡上標示的架構代號是 glm_moe_dsa,指向它從基礎模型繼承的兩個結構元件:前饋層中的 MoE 路由,以及 DeepSeek 稀疏注意力(DeepSeek Sparse Attention,DSA)。

目前提供兩個檢查點:全精度的 Atria-Dawn-Preview 指令模型,以及 Atria-Dawn-Preview-FP8 量化版本,後者是為了降低部署這種體量模型所需的記憶體 footprint。兩者都有 256K token 的上下文視窗,並以 MIT 授權釋出——這是開放權重授權中最寬鬆的一級。商業使用、微調、再散布、自行部署全部合法,除保留授權聲明外沒有任何權利金義務。

文件裡有一個講得很明白的限制:這個模型只接受文字輸入。沒有影像、語音或影片理解能力。對習慣多模態前沿模型的團隊來說,這是在圍繞它建立工作流程之前必須先內化的真實約束。

文件也記錄了兩個 OpenAI 相容的託管 API 端點,供不想自行部署的團隊直接呼叫:國際端點 api.atria-asi.ai/v1,以及中國境內端點 discovery.intern-ai.org.cn。儲存庫還附上了三個編碼代理工具的現成整合設定——Codex、Claude Code 與 Kimi Code。這個細節很說明問題:上海 AI Lab 並未把 Atria 定位成消費級聊天機器人,而是定位成工程師日常使用的編碼代理工具的即插即用後端。

為什麼樣的工作負載而生

它的設計目標不是聊天,也不是單輪編碼,而是完整的長程研究迴圈:問題分析、方案設計、工具使用、程式實作、實驗執行、結果分析,以及——多數模型崩壞的地方——失敗恢復。一個在單輪問答上微調出來的模型,擅長產出看似合理的第一個答案,但它不會自動擅長在 session 進行到第十二步時,察覺某個測試因為一個微妙的原因而失敗,進而調整方向,而不是信心滿滿地重複同一個壞掉的做法。

上海 AI Lab 對這個缺口的解答,是論文中稱為「可驗證經驗管線」(Verifiable Experience Pipeline)的訓練方法:把工具媒介的互動連接到可執行環境與外部驗證的結果。白話說,模型不是在「好代理軌跡長什麼樣」的靜態範例上訓練,而是在它的行動會產生真實、可檢驗後果的環境中訓練——測試要嘛通過要嘛沒通過,腳本要嘛跑起來要嘛拋出錯誤——而那個被驗證的結果,而非人類的主觀評分,決定下一輪訓練的方向。值得注意的是,這條管線刻意把失敗也納入訓練訊號,跨任務累積可複用的能力,而不是只蒸餾成功案例。

這是 2026 年整個領域的轉向,而非某個實驗室的獨門技巧:用真實、可執行的環境取代靜態人工標註資料集,已經成為打造能在長程代理 session 中保持穩定的模型的主流做法。

架構內部

「744B 參數」與「每個 token 實際動用多少參數」之間的落差,正是這種體量的模型得以成為真實工作負載候選者的全部原因。

GLM-5.2 的 MoE 設計不把每個 token 送進全部參數,而是路由到一小群專家:每個 MoE 層有 256 個專家,每個 token 選出 8 個路由專家加上 1 個永遠啟動的共享專家。前三個 transformer 區塊使用密集前饋網路,其餘 75 個(共 78 層)是 MoE 層。結果是每個 token 大約動用 400 億活躍參數,占 744B 總量的一小部分——約十八分之一的權重在任一次前向傳播中真正做工。

架構代號裡的 DSA 是 DeepSeek Sparse Attention 的縮寫,由 GLM-5 系列連同多頭潛在注意力(Multi-head Latent Attention)一併採用,兩者最初都源自 DeepSeek 的模型系列。一個稱為 Lightning Indexer 的小型神經網路在每層注意力計算之前先跑,對每個既有 key-value 區塊與當前 query 的相關度評分。只有得分最高的區塊——每個注意力頭上限 2,048 個 token——才會進入昂貴的完整注意力計算。GLM-5.2 再疊加一層稱為 IndexShare 的最佳化:每四層才完整跑一次 indexer,中間的層重複使用同一組選中的索引。獨立架構分析估計,兩者結合在 100 萬 token 上下文下可讓每 token 的 FLOPs 減少約 2.9 倍。

一個誠實的未解之謎:GLM-5.2 原生上下文視窗據報可達 100 萬 token,但 Atria Dawn Preview 公布的是 256K。模型卡與論文都沒有解釋這個落差。一個合理但未經證實的假設是:在可驗證結果環境上做代理後訓練,是用理論最大上下文換取代理實際運作範圍內更可靠的行為。任何真正需要超過 256K 的工作負載,都應把這當成官方公布的硬上限,而不是想當然耳的繼承能力。

基準測試:哪裡贏、哪裡輸

GitHub 儲存庫把結果分成五類:Discovery(發現)、Creation(創造)、Tool Use(工具使用)、Delivery(交付)與 Cybersecurity(資安)。在 16 項基準中,獨立報導認可 Atria Dawn Preview 在其中 5 項拿到表列最高分。有意思的是結果的「形狀」,而非頭條數字:

  • Discovery 是它最強的類別。 在以多步研究與證據檢索為核心的 DeepSearchQA 上,Atria 拿下 96.0——領先 Kimi K3(95.9)、GLM-5.3(94.7)與 GPT-5.6 Sol(93.2)。第一名到第四名差距不到三分,是一場膠著的拉鋸。它同時在表上寫下最高的 BrowseComp 分數:92.5。
  • Tool Use:在衡量模型能否正確選擇與格式化函式呼叫的 BFCL v4 上,Atria 拿 77.0,勝過 GLM-5.3 的 74.1 與 DeepSeek V4 Pro 的 71.4——考量它對 Codex/Claude Code/Kimi Code 的定位,這是直接相關的證據。
  • Cybersecurity:在以真實漏洞分析與修復為核心的 CyberGym 上,Atria 拿 86.5,領先 GLM-5.3(84.5)、GPT-5.6 Sol(83.6)、DeepSeek V4 Pro(83.3)與 Kimi K3(78.7)。模型卡特別把這項能力框限在「授權環境中」分析與驗證漏洞——這句話跟分數本身一樣重要。
  • Creation 是最誠實的一塊。 在更難、以真實 PR 級軟體工程任務為核心的 SWE-bench Pro 上,Atria 拿 59.6——勝過 DeepSeek V4 Pro(58.3),但落後 Kimi K3(61.6)、GLM-5.3(60.3)、GPT-5.6 Sol(61.4)、Qwen3.8-Max(65.1),更遠遠落後以 74.7 領先全場的 Claude Opus 5。對一個訴求「把研究想法變成可執行程式碼」的模型來說,在這個領域最擬真的編碼基準上只排中段,是需要斟酌的限制,不是註腳。
  • Delivery 是它最弱的類別:在 JobBench(文件與簡報任務)上,Atria 拿 50.3,落後所有列出的對手——GLM-5.3 的 58.2 與 Claude Opus 5 的 68.0 明顯領先。這個成績單與模型自陳的研究/工程定位一致,而不是矛盾。

標準的但書必須講清楚:所有數字都是實驗室自行報告,跑在自己的基礎設施與評測 harness 上;撰文當下尚無獨立第三方複現。把這張表當成需要用你自己任務驗證的假設,而不是最終判決。

769 項任務的人機研究

讓這篇論文真正與眾不同的,是上海 AI Lab 把自己內部使用這個模型的過程當成個案研究,並且公開了資料。研究人員分析了 56 位參與者的 769 筆任務紀錄,連同模型自己的代理日誌,比較任務在有 Atria Dawn 協助與否之下的完成方式。

頭條數字是:當評估者在可比條件下檢視已完成任務時,約有三分之一的 AI 協助任務被評為「沒有 AI 就做不成」。更有意思的是質性模式——代理經常主動提出方法並實作修訂,而人類參與者保留大多數最終決策,透過判斷與回饋來引導探索方向,而不是親手做實作。論文把這描述為從「任務層級執行」走向「專案層級夥伴關係」:人的心力集中在決定研究優先序與詮釋證據。

用懷疑的眼光看,這是一份由建造模型的實驗室自行報告的內部研究,評分者也來自自家。它不能取代獨立評測。但作為一份記錄了模型如何改變 56 個真實的人、769 項真實任務的文件,它已比多數發布會慣用的「提升生產力」話術扎實得多。

為什麼「靜默發布」重要

一個 MIT 授權的 744B 開放權重代理模型,等於讓任何 GPU 充足的團隊不需要任何授權談判,就能部署一個前沿等級的代理——而它登場的時機,正值產業為了「前沿減速」吵得不可開交的季節。當美國實驗室還在協商如何共同建立安全監督、中國高管主張加速而非謹慎的同時,上海 AI Lab 只是靜靜地把一個研究工作流代理送進了開放世界。參與計畫的復旦大學副教授 Tao Gui 的一句話,把意圖說得很白:「研究人員把大量時間耗在從想法到結果之間的工作上。Atria Dawn Preview 是為了吸收這些工作,把科學判斷留在它該在的地方——研究者手上。」

名字裡的「Preview」是誠實的——純文字輸入、256K 上限、中段的編碼分數、自行報告的基準,都在告訴你正式投入生產前要謹慎。但真正值得記住的,是它的發布模式:權重第一、論文第二、新聞稿沒有。在一個公告音量經常替代能力的市場裡,這種倒過來的順序,本身就是一種聲明。