← All posts / Research

從 16.79% 到 34.97%:一場預填充實驗,讓 Qwen 3.8 的訓練資料站上被告席

獨立研究者的推理預填充分析發現:注入 GPT-5.5 Pro 前百分之一的思考鏈後,Qwen 3.8 的答案重疊率翻倍——這是蒸餾爭議至今最尖銳的技術訊號。

從 16.79% 到 34.97%:一場預填充實驗,讓 Qwen 3.8 的訓練資料站上被告席

就在 NSA、CISA 與 FBI 正式指控六家中國 AI 公司對美國前沿模型發動工業級蒸餾攻擊的兩天之後,一位獨立研究者發表了這場爭論中迄今最尖銳的技術訊號——而它指向的,是那份聯合公告裡沒人點名的模型。

9 月 9 日,Tabby 程式碼助理的作者 Meng Zhang(GitHub 帳號 wsxiaoys)發表了一篇低調的後續實驗,標題是「Reasoning prefills on a few open models, v1.1」。到了 9 月 10 日,它已衝上 Hacker News 首頁前端,累積超過 230 點與 91 則討論。實驗結論一句話就能說完,卻很難輕易撇清:把 GPT-5.5 Pro 思考鏈的前 1% 注入 Qwen 3.8 A95B 的推理通道、再讓它自行續完,它的最終答案向 GPT-5.5 Pro 收斂的幅度,超過基線的兩倍。

實驗怎麼做

方法便宜得令人意外。針對 45 道題目——15 題 STEM、15 題非 STEM、15 題由作者自撰、保證不存在於任何訓練集的合成謎題——研究者對每個目標模型各生成兩種回應:一種是普通的未預填充回應;另一種是在推理通道開頭插入 GPT-5.5 Pro 自身推理的前 1%,然後讓模型接手。可見答案一律自由生成。重疊分數取 unigram、bigram 與 trigram source recall 的平均,衡量範圍是目標模型答案的前 100 個 token。

全部題目的關鍵數字如下:

模型未預填充GPT-5.5 Pro 預填充變化
DeepSeek V4 Flash27.30%26.13%−1.17 pp
Inkling19.99%20.45%+0.46 pp
Kimi K331.11%35.65%+4.54 pp
Qwen 3.8 A95B16.79%34.97%+18.18 pp

四個開源模型裡有三個幾乎不動。Qwen 3.8 的收斂幅度卻直接翻倍。分類細項讓結果更有趣而非更平淡:STEM 題的躍升是 +26.99 個百分點(19.26% → 46.24%),作者私人合成謎題上是 +14.75 個百分點(10.49% → 25.23%)。合成謎題的結果尤其關鍵——這些題目不可能出現在任何爬取的語料裡,因此讓 Qwen 跟隨 GPT 的那個東西,是後訓練學到的「行為」,而非記住的「內容」。

方法背後的直覺是:推理模型傾向用自己訓練出來的語感續寫一段被起頭的思考。如果某模型的後訓練吃過另一個模型的推理軌跡,注入那位「老師」的一小段思考,對它來說就像「回家」——續寫與最終答案會可測量地被拉向老師。訓練史無關的模型則會對預填充無動於衷,DeepSeek V4 Flash(−1.17 pp)與 Inkling(+0.46 pp)正是如此。

工具從哪來

預填充方法學的血統來自一份鋒利得多的研究。2026 年 8 月,由 Maksym Andriushchenko、Alexander Panfilov 等人發表的《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)揭露了各家供應商傳遞隱藏思考鏈的架構性漏洞:回傳給客戶端的加密推理區塊,在同一供應商生態系內可以跨連線、跨使用者、跨模型互換。把強模型的加密軌跡注入同一家供應商的弱模型,就能迫使弱模型把軌跡原封不動解碼成明文——完全不必直接越獄強模型。

論文展示了四種攻擊向量:繞過 Anthropic、OpenAI 與 Google 的反蒸餾防禦;大規模抽取私有資料(從公開儲存庫爬取的 315,320 個推理區塊中,回復出 367 件個人識別資訊與 182 組憑證);洩漏藏在推理過程裡、而可見輸出已安全拒絕的危險內容;以及完全嵌入加密區塊、針對公開 agent 部署軌跡下毒的隱形提示注入。

同一作者 9 月初的 v1.0 實驗以 Opus 4.8 作為老師種子,發現收斂最強的是 Kimi K3——與論文軼事一致:「僅用幾個 token 的 Opus 推理預填充 Kimi-K3,就能可測量地把它的回應推向 Opus」。那一輪裡 Qwen 對 Opus 幾乎不動。v1.1 換成 GPT-5.5 Pro 當老師後,圖像翻轉:Qwen 3.8 成了異常值,而作者的結論措辭謹慎——「資料顯示 Qwen 可能向 GPT-5.5 Pro、或某個相近的 GPT 模型學習過,而非向 Opus」。

時機為什麼讓事情升溫

讓一份 45 題的 gist 升級為值得追蹤的新聞的,是地緣政治脈絡。9 月 8 日,NSA、CISA 與 FBI 發布聯合公告 AA26-251A,點名 DeepSeek、月之暗面、阿里巴巴、MiniMax、StepFun 與 Z.AI,指控其蒸餾行動「構成核心——而非僅是補充」的 AI 發展策略。阿里巴巴——Qwen 的母公司——就在名單上。公告甚至把重建隱藏思考鏈列為明確的攻擊者技術。

48 小時後,一份設計乾淨、指向相同方向的獨立技術證據落地,這種佐證的壽命遠超單一新聞週期。但它目前是證據而非鐵證,缺口必須誠實陳述:效應是相關性的、樣本只有 45 題、真正的老師(GPT-5.5 Pro 本尊、某個 GPT 兄弟變體、或混合)尚無定論,而且高預填充收斂理論上也可能源於趨同的後訓練配方,而非直接吞食軌跡。作者自己標明了這些限制;HN 討論串則進一步拷問,包括「兩個模型受過同一份基準答案資料訓練」的替代假說。反方考量是:保證沒見過的合成謎題,照樣顯現效應。

這意味著什麼

對阿里巴巴而言,時機至少極度尷尬。8 月 2 日發表的 Qwen 3.8-Max 擴展到 2.4 兆參數,被定位為 coding 與協作的新標竿,以所有公開基準衡量都是真正強悍的開源權重家族。蒸餾的問號不會抹滅工程實力,但它給了監管者、客戶與對手一個具體、可重現的實驗可以引用——而且相關機構已經證明會對這一類指控採取行動。

對研究社群來說,更持久的貢獻或許是方法學的。預填充收斂便宜、跨模型通用、且事後難以規避:你無法「取消學會」一位老師。正如一位 HN 留言者所說,「只要存在一致的潛在空間表徵,推理就會生效」——老師在學生身上留下的指紋是結構性的,不是化妝品级的。可以預期這個模板會被套用在每一組重要的前沿模型配對上,配上對照模型與更大的題集。作者自己的「觀察清單」正是從這裡開始:獨立重現,理想情況下加入一個沒有蒸餈指控的對照模型。

對其他人來說,九月 AI 新聞的主旋律是:這個產業最大的爭論,已經不再由新聞稿定奪。聯邦聯合公告負責指控;加密區塊漏洞負責揭露;45 題的預填充實驗負責測量。文件與資料在做所有的發言——而這一次,其中一份正在談論 Qwen。

實驗的完整表格與方法註記公開於 GitHub Gist;底層軌跡抽取技術詳見 arXiv:2608.09867。