← All posts / Research

微軟 SWA 論文顛覆線性注意力:60 個 token 的上下文勝過數月的後訓練

微軟 Applied Sciences 團隊證明:免訓練的滑動視窗注意力(含 4 個 attention sink)在 Llama、Qwen、Phi-4 上媲美甚至超越後訓練線性注意力,長上下文推理更拿下 2-10 倍差距。

微軟 SWA 論文顛覆線性注意力:60 個 token 的上下文勝過數月的後訓練

線性注意力的列車正全速前進,卻撞上了一個最不可思議的路障:一個部署成本為零的基線方法。

微軟 Applied Sciences 團隊的四位研究員——Alexia Jolicoeur-Martineau、Rhea Sanjay Sukthanker、Pashmina Cameron 與 Emy Gervais——於 8 月 28 日在 arXiv 發表論文《Sliding-window beats linear attention》(arXiv:2608.28444)。核心主張直白得像一句口號:在你耗費數十個 GPU 月把 LLM 改造成線性注意力之前,先試試把 KV 快取遮罩成一個 64-token 視窗加上 4 個 attention sink。這個簡單的遮罩效果一樣好、甚至更好——而且在長上下文推理上,差距大到根本不在同一個量級。

重新定義二次方問題

Transformer 的注意力機制要支付二次方的代價。模型每生成一個 token,就必須把它的 key 與 value 無限期存進 KV 快取,記憶體與能源成本隨上下文長度不斷膨脹,最終變得難以為繼。過去兩年,業界最青睞的解方是線性注意力——用固定大小的狀態取代 softmax 注意力矩陣,承諾線性時間的推論速度與「低成本」維持頂尖效能。

但作者指出,問題在於這條研究路線「從未與更簡單的基線好好比較過」。線性注意力改造論文通常只跟完整注意力(full attention)比,卻不跟任何人都能在推論端直接套用的樸素滑動視窗遮罩比。這篇論文補上的正是這塊比較空白。

他們測了什麼

滑動視窗注意力(Sliding Window Attention,SWA)並不新——Mistral、Gemma 等量產模型早已採用多年。這篇論文的亮點在於與「attention sink」的結合:這個技巧源自 StreamingLLM 系列研究,無論生成走到多遠,都把序列最開頭的幾個 token 保留在注意力視窗內。Attention sink 能穩定模型的輸出分佈,而論文用的配置極簡:視窗 w=64 個 token、s=4 個 sink,也就是模型任一時刻只關注前 4 個 token 加上最近 60 個 token。

這個配置完全不需要訓練。不用微調、不用蒸餾、不用動架構——改掉注意力遮罩與 KV 快取的淘汰策略,就結束了。

團隊拿這個方法與後訓練(post-trained)的線性注意力模型對決,涵蓋四個指令微調模型家族:Llama 3.1(8B 與 70B)、Qwen 2.5(32B 與 72B)、以及 Phi-4(1.3B 與 8B)。線性注意力基線包括 LoLCATs 等後訓練方法——這類技術能把預訓練好的 Transformer 轉換成線性注意力。

結果:99% 效能回收,長上下文 2-10 倍差距

在短上下文的通識基準——MMLU、ARC、HellaSwag——上,SWA 展現出作者所稱「驚人的穩健性」。全面來看,w=64、s=4 的 SWA 平均回收了原始完整注意力模型 99.0% 的效能。在 11 個評測情境中的 9 個,SWA 勝過所有與之比較的後訓練線性注意力模型。

具體數字相當刺眼。在 MMLU 上,SWA 回收了 93.2% 的原始效能——作者直接拿這個數字對比最強的線性注意力改造方法 LoLCATs,後者表現更差。而 SWA 為此付出的訓練運算量是:零。

長上下文的結果才是論文標題的由來。在 Needle-in-a-Haystack 與 BABILong——長上下文評測的標準檢索與多跳推理套件——上,SWA 的分數比後訓練線性注意力高出 2 到 10 倍。這是最違反直覺的部分:一個任一時刻只能看見 64 個 token 的模型,打敗了理論上能把無限上下文壓進固定記憶體的架構。合理的解釋是:線性注意力的壓縮狀態在精確檢索上流失太多資訊,而 SWA 的 sink 加近期視窗恰恰保留了這類基準最需要的東西——不過硬幣的另一面(作者也間接承認)是,SWA 真的無法回憶視窗之外的 token,需要真正長程記憶的任務它依然無能為力。

為什麼重要

時機點非常微妙。線性注意力正處於熱潮高峰,各實驗室都在尋找更便宜的長上下文推論方案,好幾種改造方法被宣傳為現有模型的即插即用升級。如果一個免費、免訓練的遮罩就能達到同樣效果,這個子領域的經濟學就整個翻轉了。論文寫得毫不客氣:「為了降低推論記憶體成本,我們強烈建議改用 SWA,而不是後訓練線性注意力模型。」

作者仍為線性注意力留了一扇門——結尾承認線性模型「可能需要從頭訓練或大量後訓練,才能與 SWA 打平」。這在科學上是站得住腳的立場,同時也是一份嚴厲的控訴:如果你的廉價改造方案會輸給一個 64-token 的視窗,那這個改造方案還沒準備好。

以 Tiny Recursive Models 作品聞名的 Jolicoeur-Martineau 在 X 上宣布論文時,給出了最精簡的版本:「換成帶 attention sink 的滑動視窗注意力遮罩(零成本),就能擊敗線性注意力後訓練。」論文發表後持續攻佔聚合網站排行榜,站上 cs.CL 每日清單前十名,並在 r/LocalLLaMA 引發熱烈討論——在地端推論的實踐者立刻察覺了對本地部署的實際意義。

當然也有誠實的但書。64-token 視窗是為了壓力測試基線而選的激進設定;實際部署可能偏好更大的視窗,用記憶體換取回憶能力。SWA 做不到真正的任意位置檢索,需要忠實處理百萬 token 上下文的人在這裡找不到答案。而且線性注意力領域進展飛快——從頭訓練(而非改造)的方法依然有真實競爭力。

但作為一次基準衛生(benchmark hygiene)的矯正,這篇論文已是小小的經典:在你想用架構工程解決問題之前,先確認一個遮罩會不會就夠了。對一個正把數十億美元投入長上下文基礎設施的產業來說,「無聊的基線仍然獲勝」是值得聽進去的訊息——尤其當這個基線是免費的。

資料來源