← All posts / Models

打造自己房子的模型:Z.ai 的 Infra Agent 在十萬顆國產加速器上優化 GLM-5.3-Flash

Z.ai 詳述一個由 GLM-5.3 驅動的 Infra Agent 如何在兩週內,於超過十萬顆中國自研 AI 晶片上完成 GLM-5.3-Flash 的生產級推論部署,並將端對端吞吐量提升三倍——這是遞迴自我改進(RSI)最早期的真實案例。

打造自己房子的模型:Z.ai 的 Infra Agent 在十萬顆國產加速器上優化 GLM-5.3-Flash

當 Z.ai 在 9 月 17 日發表技術長文《邁向遞迴自我改進:GLM 如何打造自己的推論基礎設施》時,他們宣布的不是一項新的基準測試成績,而是在記錄一件更奇怪的事:一個前沿 AI 模型承擔了「服務它自己」所需的大量系統工程——在一座由超過十萬顆中國自研 AI 加速器組成的叢集上,從首次成功運行到達成生產就緒只花了不到兩週,端對端吞吐量在過程中提升約三倍。

這篇文章開頭是一段罕見直白的告白:「當我們開發 GLM 時,模型有時展現出令我們驚訝、甚至不安的能力。」接下來的內容既是工程案例研究,也是一份關於整個產業在遞迴自我改進(Recursive Self-Improvement, RSI)路線上實際位置的政策宣言——RSI 指的是 AI 系統完全自主地設計並訓練自己後繼者的假想終點。

實際打造的東西

GLM-5.3-Flash 是 GLM-5 系列中第一個原生多模態模型,總參數量 320B、激活參數約 18B,支援 100 萬 token 的上下文視窗。要在成熟的 NVIDIA 硬體上提供這樣的模型服務已經不容易,而 Z.ai 是在一座超過十萬顆中國自產 AI 加速器的叢集上完成——該公司表示,在這之前從未有人在中國自研晶片上營運過這種規模。

限制條件相當嚴苛:晶片記憶體容量與頻寬相對有限、軟體生態系不成熟、kernel 支援不完整,而且「許多本來應該有文件的東西只能靠猜」。在這之上,團隊還得支援全新的模型架構、百萬 token 上下文以及多模態請求。

最終的技術堆疊疊加了多層激進的記憶體優化——包括用算力換頻寬、用通訊換裝置記憶體的自訂技巧——其中有線性注意力與 LM Head 的節點內張量平行、ReplaySSM、W8A8 量化、跨 INT8/FP8/BF16 的混合精度 KV 快取量化,以及 Layer Split,再配上 Encode-Prefill-Decode(EPD)分離式服務架構。綜合效果:端對端服務效能提升約三倍,硬體使用效率與每 token 成本達到 Z.ai 稱與主流 NVIDIA GPU 相當的水準。

但真正的重點是「誰做了這些工作」。文中寫道:「這不是由一組基礎設施工程師獨力完成的。其中大部分工作是由一個由 GLM-5.3 驅動的 Infra Agent 執行的。」

密集回饋:真正的核心教訓

這篇文章最有料的部分不是硬體故事,而是 Z.ai 稱之為密集回饋(dense feedback)的方法論。核心洞見在於:一個 agent 的工程效能,取決於周邊系統能否持續提供「可歸因」的回饋,而不只是程式碼生成能力。

「吞吐量下降 20%」這類端對端指標只能告訴 agent 結果變差了,卻無法解釋原因。Z.ai 的答案是將正確性測試、執行日誌、執行軌跡、執行事件、微基準測試與端對端指標全部納入 agent 的迭代迴圈,把系統優化拆解成可以局部觀察與驗證的步驟。「密集」不是指塞進更多日誌,而是指回饋必須具備三個特性:局部性(綁定到具體的 kernel、執行緒與程式路徑)、取得成本低(能用微基準回答的假設,永遠不需要完整部署)、以及可驗證(相關性不能當成根因,必須用對照實驗確認)。

三個案例具體展示了這套方法:

  • 正確性:透過建立平行策略到 kernel 實作的映射,agent 抓到 KDA kernel 在 Context Parallelism 路徑上的數值精度 bug——TF32 預設精度在狀態合併時讓誤差累積,且隨上下文長度增加而惡化。修復方式以三次 TF32 張量核心運算組合出更高精度,並已上游合併進 Flash Linear Attention(PR #1180)。
  • 系統行為:當 KV Transfer 場景超出 5% 的效能預算達 20% 以上時,agent 追蹤時間軸、沿呼叫鏈走到 Python/C++ 邊界,發現 DeepEP v1.2.1 的 dispatch/combine 呼叫在等待 GPU 期間從未釋放 GIL——導致 Mooncake Transfer 執行緒被餓死、重疊效果盡失。在相關 C++ 區段釋放 GIL 後,差距降到 1% 以下。
  • 效能:agent 從 SGLang、Flash Linear Attention 與 DeepGEMM 的手寫 kernel 中蒸餾出可複用的「優化骨架」,再應用到自己的 KDA decode kernel 上——合併 V 維度的 tile 以消除重複四次的 FP32 正規化計算、將中間結果常駐暫存器,用部分平行度換來 1.71 倍的 kernel 加速。

這個迴圈有種 Z.ai 直白道出的循環性:「模型優化系統;系統運行模型。」

Ox-Alpha 的連結

這個故事可以回溯到八月下旬:一個名為「Ox-Alpha」的匿名模型現身 OpenCode 與 OpenRouter,一週內成為兩個平台上最多人使用的模型——六天處理超過 62 兆 token——隨後被揭露就是 GLM-5.3-Flash,而且完全運行在中國晶片上。智證(Zhipu AI)港股在那次揭露後大漲超過 12%。9 月 17 日的這篇長文正是那則頭條背後的技術「怎麼做到的」:這就是承載那 62 兆 token 的基礎設施。

它也落在敏感的政策脈絡中。中國工信部數日前才發布第十五個五年規劃,目標 2030 年智慧算力達到 9,800 EFLOPS,並在包括 EDA、微影、先進記憶體在內的六個半導體環節追求「全鏈條突破」。一場示範「不需要 NVIDIA 硬體也能達到前沿級服務經濟性」的展示,正是該規劃賴以成立的證明——也正是美國出口管制企圖防堵的結果。

誠實的但書,以及為什麼重要

Z.ai 對「這不是什麼」說得很謹慎。「當然,我們還沒有達到遞迴自我改進,」文末寫道。「選擇目標、設定邊界、評估風險,仍然是人類的責任。我們相信這條線應該由人類繼續守很長一段時間。」在整個過程中,工程師定義目標、系統邊界,並審查每一個觸及數值語義、並發行為與生產風險的變更;agent 則在這些邊界內提出假設、實作變更、執行實驗。

這個框架出現的時機點值得注意——就在這一週,美國各實驗室正公開辯論是否要「為前沿調速(pace the frontier)」:馮德萊恩在歐盟國情咨文中表態支持放慢,華為輪值董事長徐直軍卻在上海採取相反立場,主張中國業者必須加速。Z.ai 的結尾幾乎像是對兩邊的同時回應:「這些數字——兩週、三倍吞吐量、十萬顆加速器——告訴我們,這個邊界上的進展不會因為我們希望它放慢就放慢。」

這篇文章的工程啟示值得比新聞週期活得更久:agentic 系統的瓶頸不是模型能力,而是回饋架構。把稀疏的端對端結果轉換成細粒度、可歸因、低成本的回饋,才是讓一個模型做到「過去需要一組資深基礎設施工程師花數週」的工作的關鍵。這一課——而不是晶片數量——才是其他實驗室與基礎設施團隊真正該抄的作業。