兩步,不是十步:獨立研究者「Tauon」優化器宣稱在 GPT-Mini 上摘下 Muon 王冠
獨立研究者的 Tauon 優化器——以多項式正交化與頻譜濾波為核心——據報在 GPT-Mini 上達到約 1.6 驗證損失,優於 Muon 的 1.65 與 AdamW 的 1.8,每步還快約 8.5%。優化器已是 2026 年最安靜的主戰場。
這個週日早晨 AI 圈討論度最高的故事,不是模型發布、不是募資、也不是監管戰火,而是一個優化器。一位獨立研究者發布了「Tauon」,一個建立在多項式與正交化想法上的類神經網路優化器,宣稱它在 GPT-Mini 小型 transformer(TinyShakespeare 資料集)上擊敗了 Muon——那個前沿實驗室真正用來訓練大模型的優化器——達到約 1.6 的驗證損失,優於 Muon 的約 1.65 與 AdamW 的約 1.8,而且每一步的耗時還比 Muon 短約 8.5%。這篇貼文登上 AI Weekly 2026 年 9 月 27 日即時榜的頭條,正在機器學習社群快速發酵。
如果這些數字經得起覆現,它很重要——不是因為 TinyShakespeare 能預測前沿訓練,而是因為優化器已經悄悄成為實驗室槓桿率最高的決策之一。
Tauon 到底宣稱了什麼
根據研究者的描述,Tauon 從與前輩不同的方向切入最佳化問題。AdamW 依動量估計調整每個座標的學習率;Muon 用 Newton–Schulz 迭代把更新矩陣正交化;而 Tauon 依靠多項式與正交化技術,並點名兩個機制:
- 頻譜濾波(spectral filtering)——依頻譜特性選擇性衰減更新的各分量,讓優化器的力氣集中在梯度資訊真正可靠的子空間上。
- 係數排程(coefficient scheduling)——把更新規則的多項式係數當作可排程的量,而非固定的超參數;作者說這能把每次迭代的有效最佳化步驟降到兩步。
在 GPT-Mini 小基準上的頭條數字:Tauon 約 1.6 驗證損失、Muon 約 1.65、AdamW 約 1.8——而且每步的墙上時間比 Muon 便宜約 8.5%。在一個 Muon 本身已經碾壓 AdamW 的速度賽基準上,這是雙重勝利:更少的步數達到更好的損失,而且每步更便宜。
顯而易見的但書必須說清楚。這是單一獨立研究者的貼文,不是附帶消融實驗的同儕審查論文。GPT-Mini 加 TinyShakespeare 在前沿標準下是玩具——數百萬參數、字元級莎士比亞、幾分鐘的算力。「在小規模獲勝、在大規模發散」的優化器墳場已經很大。而且 2026 年已經出現過一次尖銳的提醒:Muon 的成功未必來自粉絲講的那套精確幾何故事——五月的一篇分析(〈Muon is Not That Special: Random or Inverted Spectra〉)主張,即使刻意扭曲頻譜預條件,這個優化器家族的增益依然存在,暗示部分好處比理論描述的更平凡。
為什麼一篇優化器貼文能爆紅:Muon 吃下了前沿
要理解一篇 Reddit 優化器貼文為何能在一個新聞週期裡蓋過十億美元級的交易新聞,看看 Muon 過去兩年做了什麼。
Muon 由 Jeremy Bernstein 於 2024 年底發表,最初只是速度賽圈的奇觀——NanoGPT 與 CIFAR-10 訓練紀錄背後的優化器。認真的轉折發生在 2025 年 2 月,Moonshot AI(月之暗面)證明 Muon 可以擴展到大語言模型預訓練,接著以行動背書:用改良版 Muon 訓練並開源了 3B/16B 的 MoE 模型 Moonlight。
然後是大規模的證明。Kimi K2——總參數一兆、激活 32B 的 MoE——用 MuonClip 預訓練了 15.5 兆 token;MuonClip 是 Muon 的延伸,用 QK-clip 技術消除 attention logit 的不穩定。Moonshot 報稱整趟訓練沒有出現任何一次損失尖峰——對於任何盯過兆級 token 訓練任務的人,這幾乎是炫耀等級的宣稱。圍繞 Moonshot 部署的報導(包括 PyTorch 部落格上用 DeepSpeed 跑 Muon 的文章)流傳過相對 AdamW 約 25–35% 的訓練提速——在前沿規模下,這等於每次訓練省下數億美元的算力。
這個趨勢在 2026 年只加深。Kimi K3 的訓練stack據報對每個 attention head 各自套用 Muon 以求穩定;阿里巴巴 Qwen 團隊也描述過把 Muon 與 AdamW 分配到不同權重類別的訓練配方,把優化器的選擇當成架構層級的決策,而不是事後想想的超參數。當全球最燒算力的實驗室全都收斂到 2024 年速度賽圈的一個優化器上,「誰能打敗 Muon」這個前沿席次是真的敞開——而且值錢。
賭注:效率是唯一剩下的免費午餐
2026 年的訓練經濟學很殘酷。Akamai 才剛與 Anthropic 簽下 116 億美元、為期七年的雲端承諾;Brookings 預估美國 AI 基礎建設到 2032 年將達 10.3 兆美元——美國史上單一產業占 GDP 比例最高的建設潮。在這樣的世界裡,一個能用更少、更便宜的步數達到相同損失的優化器,不是學術裝飾;它是每個前沿實驗室最大預算科目上的槓桿。
這正是優化器利基持續產出病毒式成果的原因:Keller Jordan 的 Modded-NanoGPT 速度賽(Newton-Muon 變體正與 NorMuon 互刷步數紀錄)、Kaon 批判論文,以及現在的 Tauon。每一個都是對同一個獎盃的出價——在所有人都必須走的那條路上,拿到可測量、可覆現的效率優勢。
Tauon 的「兩步最佳化」框架若經得起檢驗,會剛好嵌進這套經濟學。Newton–Schulz 正交化——Muon 的核心迴圈——每次迭代要付出數個矩陣乘法密集的子步驟。一個用兩步就達到相近條件數、每步還便宜 8.5% 的方法,攻擊的正是 Muon 為換取穩定性而加進來的開銷。
什麼能讓它成真
Tauon 要從病毒貼文畢業進訓練stack,社群會想看到,大致依序:
- 獨立的速度賽覆現——在 Modded-NanoGPT 類基準上,那裡的 Muon 紀錄是被持續驗證的。
- 擴展行為——Kimi 式考題:優勢能否撐過數十億參數的 MoE 訓練,還是多項式機制會在 AdamW 那種笨拙穩健滑過去的地方發散?
- 一篇論文——附帶消融實驗,把頻譜濾波與係數排程的貢獻分開,最好能正面回應 Kaon 批判那個「扭曲頻譜幾乎無傷」的發現。
- 與穩定性技巧的互動——它能否像 MuonClip 那樣與 QK-clip 類修正共存。
這些都還沒發生。已經發生的是:九月下旬一個安靜的星期天,AI 追蹤圈裡互動最高的故事,是一份草根優化器成果——這健康地提醒了所有人:在所有兆級基礎建設頭條之下,這個領域後果最深遠的未解問題,依然是最古老的那一個——什麼是走下坡損失曲面的最好方法?
本文來源見下方。