模型優化系統,系統運行模型:Z.ai 的 Infra Agent 在十萬顆中國加速器上打造 GLM-5.3-Flash 推理叢集
Z.ai 表示,由 GLM-5.3 驅動的 Infra Agent 完成了大部分工程,讓 GLM-5.3-Flash 在超過十萬顆中國自研 AI 加速器上進入量產——兩週內吞吐量提升三倍。
9 月 17 日,Z.ai 發布了一篇技術長文,讀起來像是 AI 工程史上的一個檢查點——取決於你的立場,它既令人振奮,也令人不安。該公司為 GLM-5.3-Flash(總參數 320B、激活參數 18B 的原生多模態模型)在超過十萬顆中國自研 AI 加速器上,從零打造了一套量產級推理服務。真正新穎的不是硬體,也不是模型,而是「誰」做了這些工作:其中大部分系統工程由一個由 GLM-5.3 驅動的 Infra Agent完成——模型親手參與建造為它自己服務的基礎設施。用原文最精煉的一句話:「模型優化系統;系統運行模型。」
實際建造了什麼
把一個前沿模型從新硬體上的首次成功運行,帶到可靠、高效能的量產服務,本身就是一項艱鉅的系統工程。Z.ai 的處境更難:從沒有人在這個規模上部署過中國自研加速器,晶片記憶體容量與頻寬相對有限,軟體生態不成熟、kernel 支援不完整,大量「本該有文件說明」的東西只能靠猜。目標堆疊還得支援線性注意力的新架構、100 萬 token 上下文視窗,以及多模態流量。
最終的服務堆疊整合了一系列激進的記憶體優化:
- 針對線性注意力層與 LM Head 的節點內張量平行(tensor parallelism)
- ReplaySSM——以算力換取頻寬與裝置記憶體的技術
- W8A8 量化,加上跨 INT8/FP8/BF16 的混合精度 KV cache 量化
- Layer Split,以及在其上建構的 Encode-Prefill-Decode(EPD)分離式架構
結果:端到端服務效能提升約 3 倍,從最初的模型適配到具備量產條件只花了不到兩週,硬體使用率與單 token 成本達到该公司所稱「與主流 NVIDIA GPU 相當」的水準。上線後,先前以「Ox-Alpha」匿名名稱在 OpenCode 與 OpenRouter 上實測的 GLM-5.3-Flash,六天內處理了超過 62 兆 token,成為兩個平台上最多人使用的模型。
真正的貢獻:「密集回饋」
這篇文章最有趣的部分,不是任何單一優化,而是 Z.ai 為了讓 agent 勝任系統工程角色所提出的工程方法論。該公司的診斷是:一個能讀懂整個 codebase 的 agent,仍然會在稀疏回饋(sparse feedback)上碰壁。告訴它「TTFT 增加 30%」或「準確度測試失敗」,並不能告訴它哪一層該負責——是 kernel、平行策略、通訊、記憶體管理還是排程——也不知道下一步該測什麼。端到端指標能說明「變糟了」,卻無法解釋「為什麼」。
Z.ai 的答案是「密集回饋(dense feedback)」,有三個定義性特徵:
- 足夠局部——回饋應綁定到具體的啟動參數、kernel、程式碼路徑、輸入形狀、執行緒或執行區間,讓 agent 能收斂問題範圍,而不是每次都從整個模型的層級重新診斷。
- 取得成本低且即時——能用 kernel 測試或本地 microbenchmark 回答的問題,不應該每次都得部署整套服務跑端到端壓測。驗證週期越短,agent 越能及早放棄沒有生產力的假設。
- 支援客觀驗證——正確性與效能的判斷必須由參考實作、對照實驗與可比較的指標來裁定,而不是靠執行期訊號之間的相關性。
三個案例展示了這個迴圈的實際運作。在正確性案例中,agent 追蹤到 KDA kernel 的 Context Parallelism 路徑中,tl.dot 預設 silently 降級到 TF32 精度;修正方式——明確指定 input_precision="tf32x3",用三次 Tensor Core 運算重構出更高精度——已向上游合併進 Flash Linear Attention(PR #1180)。在系統案例中,agent 發現 DeepEP v1.2.1 的 intranode dispatch/combine 呼叫從不釋放 Python GIL,讓同行程內負責 Mooncake KV 傳輸的執行緒拿不到鎖;在 C++ 執行區間釋放 GIL 之後,原本超過 20% 的效能落差收斂到 1% 以下。在 kernel 案例中,agent 從 SGLang、Flash Linear Attention 與 DeepGEMM 的手寫 kernel 中提煉出可複用的「優化骨架(optimization skeletons)」,然後重構了一個因 V 維度 tiling 而把同樣的 FP32 正規化重算四次的 KDA decode kernel——犧牲部分平行度,換來 1.71 倍的 kernel 加速。
為什麼框架重要:RSI,但附帶但書
Z.ai 並沒有宣稱已經征服遞迴自我改進(RSI)。文章明說:「我們尚未達到遞迴自我改進。選擇目標、設定邊界、評估風險,仍然是人類的責任」——而且該公司認為人類「在很長一段時間內都應該繼續守住這條線」。但它也毫不掩飾地描出了軌跡:GLM-5.3 已成為團隊「不可或缺的日常 coding 夥伴」,而「如果這個趨勢持續,只要有足夠的算力與時間,終點就是一個能完全自主設計並訓練自身後繼者的系統。」兩週、三倍吞吐、十萬顆加速器——這些數字「告訴我們,這條邊界上的進展不會因為我們希望它慢下來就慢下來。」
地緣政治的潛台詞不難讀出,Hacker News 上也立刻吵了起來。如果中國實驗室已經能完全依靠國產晶片撐起前沿規模的推理服務——且單 token 經濟性據稱達到與 NVIDIA 相當的水準——那麼出口管制買到的籌碼就比預期少得多,美中之間的能力差距會從基礎設施層開始收斂。也有留言點出較不光彩的訊號:Z.ai 的 coding 訂閱方案似乎大幅漲價,暗示即使在這個規模上,產能依然吃緊。
對整個產業而言,更深一層的啟示是方法論。所有人都在把 agent 對準軟體工程;Z.ai 的文章主張,真正的瓶頸不是模型能力,而是回饋環境——把稀疏的端到端結果,轉化成精細、可歸因、能直接指導 agent 下一步行動的訊號。這是一套任何基礎設施團隊、在任何硬體上都可以抄走的配方。人類定義目標與約束、agent 提出並測試變更、實驗環境讓每個假設的檢驗都變得便宜——這個迴圈在兩週內產出了三倍的吞吐量。
Z.ai 先前已開源過部分相關工作,而 Flash Linear Attention 的上游合併也意味著 agent 的至少一個修復已進入公共堆疊。該公司自身的資安經驗——自 2025 年 10 月以來,合作夥伴用 GLM 在真實 codebase 中找到了數千個漏洞——則提醒我們,同一條能力曲線是雙面刃。一個能優化運行自身系統的 AI,也是一個值得被小心工程對待的 AI。