← All posts / Models

單卡跑 262K 上下文的 Apache 2.0 多模態模型:Agnes-3.0-Flash 讓混合注意力推理走進單 GPU 時代

Agnes-AI 開源 33B 混合注意力多模態模型,支援 262,144 token 上下文、圖片與影片理解,GPQA Diamond 拿下 85.05——bf16 下單張 H100 即可部署。

單卡跑 262K 上下文的 Apache 2.0 多模態模型:Agnes-3.0-Flash 讓混合注意力推理走進單 GPU 時代

單卡跑 262K 上下文的 Apache 2.0 多模態模型:Agnes-3.0-Flash 讓混合注意力推理走進單 GPU 時代

「開放權重」與「真的跑得動」之間的落差,一直是開源模型時代最安靜的失望。太多被捧上天的開源版本,實際載入時才發現需要整個節點的 GPU,能力悄悄重新集中在付得起機房費的人手裡。Agnes-AI 於 9 月 11 日悄悄上架 Hugging Face、並在 9 月 12 日早上衝上新聞聚合器頭條的最新作品,正是針對這個痛點的反例:Agnes-3.0-Flash 是一個 33B 參數的多模態推理模型,具備 262,144 token 上下文視窗、圖片與影片理解、工具呼叫,採 Apache 2.0 授權——而整個 bf16 檢查點,放得進一張 NVIDIA H200(141 GB)或 H100(80 GB)。

這次發布了什麼

剝掉行銷包裝,規格表讀起來像一份本地部署的願望清單:

  • 33B 參數,混合注意力解碼器,共 72 層
  • 262,144 token 上下文視窗——四分之一百萬 token
  • 透過 27 層視覺塔實現文字、圖片與影片理解
  • 可調推理強度(high / medium / low,外加關閉思考的開關)
  • 原生工具呼叫,直接由 chat template 渲染
  • Apache 2.0——商用、微調、再散布全部允許
  • bf16 檢查點約 66 GB;建議主機記憶體 128 GB 以上

這個組合——逼近前線的推理能力、四分之一百萬 token 上下文、多模態、真正寬鬆的授權、單卡可跑——正是這次發布值得關注而非僅僅是漸進式更新的原因。

架構:每三層循環層,配一層注意力層

模型卡裡最有趣的數字不是某個 benchmark,而是 3:1 這個比例。

Agnes-3.0-Flash 是混合注意力解碼器:72 層之中有 54 層採用** gated delta rule**——一種循環機制,每層的狀態大小不隨序列長度增長——只有 18 層跑標準全域注意力。換句話說,每四層只有一層持有會隨上下文膨脹的 KV cache。

這正是循環-注意力混合架構(RWKV、Mamba-2 衍生、gated delta network 這一家族)多年來許諾的路線:循環層以固定記憶體成本攜帶長程狀態,稀疏的注意力層則保留純線性模型難以做到的精確檢索。對一個以 262K 上下文為賣點的模型來說,這個設計不是學術裝飾——它是唯一的可行解。33B 的全 transformer 模型在該上下文長度下,光 KV cache 就會吃掉 80 GB 顯卡的一大半;在這裡,四分之三的層根本沒有 KV cache。

細節同樣講究。Delta-rule 層使用 16 個 key head / 48 個 value head(head 維度 128),前方掛 kernel 為 4 的因果卷積、gated RMS-norm,循環狀態以 fp32 儲存以確保長序列的數值穩定性。全域注意力層採 grouped-query attention(24 個 query head / 4 個 KV head,6:1),head 維度 256,q 與 k 上做 RMS-norm,輸出端 sigmoid 門控。前饋網路是 SwiGLU(中間維度 17,408),且每一層都有一條寬度 2,048 的平行 SwiGLU 分支。位置編碼採三軸旋轉位置編碼(文字 / 高 / 寬,mrope 區段交錯 11:11:10,base 1e7),只施加在每個 head 維度的前 25%——正是讓單一模型能一致索引 token、影像列與影格的 rope 設計。詞表大小 248,320。

視覺塔是 27 層、hidden size 1152、patch 16 的設計,2×2 空間合併後投影進 5,120 寬的解碼器隱藏維度。

Benchmark:誠實的框架,有競爭力的數字

這張模型卡做了同類文件中罕見的事:把免責聲明放在最前面。參考數據「來自不同來源、不同 harness 與不同模型快照,不構成受控的正面對決」——這是業界更多 benchmark 表格都該掛上的但書,閱讀時值得放在心裡。

在此前提下,數字在同等級中確實有競爭力:

  • GPQA Diamond:85.05——領先 Qwen3.6-35B-A3B(84.1)與 Kimi K2.5(78.9),但落後 DeepSeek V4 Flash、Qwen3.8、Gemini 3.5 Flash、MiniMax M3 那個 90+ 的梯隊
  • IFBench:74.20——指令遵循具競爭力,Qwen 家族約在 75–83 之間
  • AA-LCR:68.33——長上下文推理優於 Qwen3.6-35B-A3B 與 Kimi K2.5
  • SciCode:38.08——中段班,落後 DeepSeek V4 Flash 的 50.3
  • AA-Omniscience 準確率:23.00——除 Gemini 3.5 Flash(51.4)與 DeepSeek V4 Flash(40.4)外領先所有對比模型

持平地解讀:Agnes-3.0-Flash 並未宣稱前線霸權,在知識密集型評測上最大型的模型仍保有明顯優勢。它真正能主張的是效率調整後的成績——這些數字來自 33B 參數與單張 GPU,而對照組包括 1T 參數的 MoE(Kimi K2.5)、284B 的 MoE(DeepSeek V4 Flash)、428B 的 MoE(MiniMax M3)。以每美元 token 數與每 GB 能力密度來看,這個提案相當鋒利。

為 Agentic 工作而建

兩個特徵讓它超越純研究展示。

第一,可調推理強度。Chat template 提供 high(預設)、medium、low 三檔,外加 enable_thinking=False,讓部署端按請求在延遲與深度之間取捨——難題用高檔,延遲敏感的流量用低檔。建議取樣參數(temperature 1.0、top_p 0.95、top_k 20、max_tokens 2000+)直接以檢查點自身的 generation config 出廠。

第二,原生工具呼叫。Chat template 直接渲染工具定義,模型輸出結構化的 <tool_call><function=…><parameter=…> 區塊,結果以 tool 角色訊息回填。走 OpenAI 相容 API 時 tools= 用法相同——Agnes 還附上 SGLang 服役配方(官方 nightly 容器加三檔案覆蓋),把整套東西放進標準 /v1 端點後面,最大上下文與併發可用 --tp 2。

再加上 262K 視窗與影片理解,產品定位再明顯不過:給想要自架骨幹的 Agent 開發者——長逐字稿、螢幕錄影、多步工具迴圈,全部裝進單 GPU 預算的基礎設施裡。

但要注意:remote code

這次發布並非全無摩擦。檢查點需要 trust_remote_code=True——它自帶模型實作,而非依賴已併入上游 transformers 的支援(在 transformers 5.12.1 上測試,圖片/影片處理需要 torchvision)。對重視安全的團隊來說,執行不受信任的模型程式碼是必須認真考慮的因素,這也意味著生態系工具(量化分支、替代執行環境、SGLang 配方之外的推理引擎)需要時間跟上。Apache 2.0 的權重本身沒有疑義,只是整合故事還很早期。歷史經驗是:只要模型獲得關注,上游支援通常隨後就到。

為什麼重要

開放權重運動這兩年來在兩種失敗模式之間擺盪:模型小到無關緊念,或大到跑不動。真正有趣的中間地帶——夠強、真多模態、真長上下文、真單卡——一直比炒作所暗示的更稀薄。Agnes-3.0-Flash 正正落在這裡。

對新創公司,經濟帳很直接:一張 spot 價格的 H100,就能服務一個四分之一百萬 token 的多模態推理模型,沒有按 token 計費的 API 帳單,沒有廠商鎖定。對研究者,一個 3:1 delta-rule 對注意力、此等規模、授權寬鬆的混合架構,是許多架構研究正在收斂的「循環-注意力混合」問題的可用試驗台。對整個生態系,每一次這樣的發布,都在縮小 API 寡占與資金充裕的個人自架者之間的實際差距。

Benchmark 表格不會為它加冕,也不應該。但「GPQA Diamond 85 分、262K 上下文、影片理解、工具呼叫、Apache 2.0、單卡」——這句話在上週還不成立,而這正是這一層次的進步真正的樣子。