1% 的 Token 就可能夠了:讓稀疏蒸餾真正奏效的訊號雜訊比技巧
MBZUAI 與螞蟻集團的研究人員證明,在線策略蒸餾中只對 0.1%–1% 的 token 進行監督就能追平全量監督——前提是依「梯度可靠度」而非僅依「有用性」來挑選 token。
在策略蒸餾(On-Policy Distillation, OPD)已經悄悄成為訓練小型、低成本推理模型的核心配方之一:學生模型生成自己的軌跡(rollout),而更強的教師模型沿路對每個位置的下個 token 進行評分。相較於稀疏的可驗證獎勵或序列級損失,這種 token 級的監督訊號非常密集——但也非常昂貴。教師每評一個 token 都要付出算力,因此越來越多研究都在問一個看似簡單的問題:我們真的需要監督每一個 token 嗎?
9 月 21 日刊出於 arXiv 的論文《1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation》(arXiv:2609.24432)由 MBZUAI 與螞蟻集團的合作團隊——Huanxin Sheng、Zhiling Ye、Haonan Wang、Jian Wang、Jinjie Gu 與 Jian Kang——提出:大多數現有方法其實問了一個稍微錯誤的問題。目前的稀疏 OPD 方法依照「有用性」來排序 token:重要性啟發式、學生不確定性、可教性(teachability),或者單純的「越早越好」(前綴式選擇)。它們忽略的是:當梯度是從單一取樣的下一個 token 估計出來時,你在那個位置實際算出來的梯度,到底能不能被信任。
「有用」不等於「可靠」
這篇論文的核心觀察來自估計理論。在給定前綴(prefix)下,反向 KL 目標的梯度是對模型整個詞彙表的期望值。但實務上,取樣式 OPD 只用一個(或少數幾個)取樣 token 來近似這個期望值。結果是:即使教師在該位置的修正真的有價值,估計器仍可能有很大的取樣誤差。把一個帶雜訊的估計餵進參數更新,你可能在你特意挑選的重要位置上,把學生往錯誤的方向推。
作者們在資訊幾何(information geometry)中將這件事形式化。他們在固定前綴下,於 Fisher 幾何中推導出單樣本反向 KL 梯度的訊號–雜訊分解,並提出資訊效率比(Information-Efficiency Ratio, IER)——在最小化估計器變異數的最優純量基準線(baseline)下的訊號雜訊比。附錄中一個漂亮的理論結果指出:IER 的倒數正好就是 token 梯度估計的相對均方誤差。由於在完整詞彙表上精確計算 IER 並不實際,論文提出 top-K 候選集近似,依近似 IER 對 token 排序,並——關鍵一步——透過軟邏輯 OR 與 AND 算子,把這個排序與既有的有用性分數結合(IER-OR 選出「有用或可靠」的 token;IER-AND 選出「有用且可靠」的 token),同時保持原本的取樣反向 KL 訓練目標不變。
重點結果
實驗設計得相當全面:涵蓋可驗證的數學推理與開放式的醫療推理、強到弱蒸餾(後訓練教師、同尺寸學生)與大到小蒸餾、以及思考模式開啟與關閉兩種設定。
在數學方面,論文將 JustRL-Nemotron-1.5B 蒸餾到 OpenMath-Nemotron-1.5B,並將 JustRL-Qwen3-4B 蒸餾到 Qwen3-1.7B,使用 DAPO-Math-17k 提示池訓練 50 輪 rollout,在 AIME 2025/2026 與 HMMT-Feb 2025/2026 上以每題 32 個樣本評估(Bayes@32 指標)。在醫療方面,則將 ClinAlign-4B 蒸餾到 Qwen3-4B,於 RaR-Medicine 上進行 100 輪 rollout,以 HealthBench 與 HealthBench Hard 評分,評分模型為 gpt-oss-120B——該模型在 HealthBench 後設評估中的 macro F1 為 0.6614。
三個發現特別值得注意:
IER 的分佈極度重尾。 只有不到 0.1% 的 token 其 IER 分數超過 1——也就是說,對絕大多數位置而言,估計雜訊超過了訊號。從這個角度 看,對所有 token 一律監督、不管梯度可靠度的全量 OPD,充其量只是「碰巧接近最優」,最糟的情況則是在不斷注入雜訊。
極致稀疏是可行的。 在 0.1% token 預算下,IER 作為獨立選擇器在 Nemotron 配對上逼近全量 OPD(AIME26:58.9 對全量 OPD 的 59.9;HMMT26:34.1 對 34.7),並在 Qwen3 配對的四個基準中有三個超越全量 OPD。在 1% 預算下與有用性分數結合後,稀疏配置追平甚至超越全量監督——被監督的 token 位置減少了 100 到 1,000 倍。
兩個軸度真正互補。 Jaccard 相似度分析顯示,即使整體排序相關性很高,IER 的前 10% 選擇與有用性選擇器仍常有顯著差異——可靠的 token 不一定「重要」,反之亦然。一個驚人的細節:只用了 10% 的 token,TIP 選擇器加上 IER 甚至在 HMMT26 上超越教師模型。而在 0.1% 到 80% 的預算掃描中,更多監督並不會單調地提升表現;以 1%–5% 的預算結合有用性與 IER,在多個設定下追平或優於全量 OPD。
思考模式實驗則帶來一個實務警告。在思考模式開啟(推理 token 納入選擇)時,單獨使用 TIP 會落後全量 OPD,甚至可能低於未蒸餾的學生模型——但 TIP+IER-AND 在多數情況下挽回 了優勢。忽略估計雜訊的風險,恰恰在監督最豐富的地方最危險。
誠實的限制
兩個限制值得強調,而論文也罕見地坦白。第一,這裡的稀疏監督並不等同於等比例的算力節省:實作仍然生成完整軌跡、再在其上計算 token 選擇品質,因此每步多花 2.2%–2.5% 的時間,八張 GPU 的峰值記憶體最多多 2.17 GiB(0.92%)。這是一項關於監督落在哪裡才有效的研究,還不是生產級的成本削減方案;真正的獎品——跳過約 99% 位置的教師評分——屬於能把 IER 式選擇與軌跡剪枝或提前終止結合的人。第二,增益隨選擇器與設定而變,而且實務上的 IER 本身就是近似值;作者明確將更深入的 token 重要性理解與更好的訓練目標設計留作開放問題。
為什麼重要
蒸餾的經濟學正在成為整個產業的一階約束——從用前沿教師訓練小模型的開放權重實驗室,到為裝置端部署壓縮模型的企業。這篇論文給了領域一個有原則、可組合的答案,回答「哪些 token 值得教師關注」:有用性與可靠度是正交的兩個軸,缺一不可。這個指標近似成本低,是插入既有選擇器而非取代它們,並且附帶開源程式碼(GitHub 上的 BruceSheng1202/IER-OPD)。
尤其對醫療 AI 而言,ClinAlign→Qwen3 的結果暗示了更大的想像空間:在教師評分昂貴、錯誤代價高昂的領域,能夠說出「這 1% 的 token 承載了幾乎全部可學習的訊號」,正是更便宜、更精準的監督管線的基礎。論文自己的定位相當保守——既有有用性分數的補充——但方向已經很清楚:下一代蒸餾配方花在決定不看哪裡的心力,可能和決定看哪裡一樣多。