當 AI 生成藝術沒有作者:MIT「歸因衰減」研究動搖版權論戰的根基
MIT CSAIL 研究者證明,擴散模型規模越大,單一訓練圖像——甚至整個創作者的作品集——對輸出的可測影響力越小。這個被他們稱為「歸因衰減」的現象,對版權、合理使用與創作者補償機制都有深遠影響。
AI 版權戰中最激烈的爭論之一,建立在一個直覺上:每張 AI 生成的圖像其實都是拼貼,只要在訓練資料裡仔細找,總能找到它「來自」哪張圖、哪位藝術家。MIT 電腦科學與人工智慧實驗室(CSAIL)8 月 18 日發表於《Nature Communications》的新研究指出,這個直覺經常就是錯的。而研究者證明它的方法,其重要性可能不亞於研究發現本身。
率領這項研究的前 MIT CSAIL 研究員戴振(Zheng Dai,音譯)與 MIT 教授、CSAIL 主要研究者的 David Gifford,測量了當特定訓練資料被移除後,擴散模型的輸出會發生什麼變化——不是近似估算,而是真正刪除、徹底消除其影響。結果是:訓練資料集越大,任何單一圖像對模型生成結果的影響就越小。在夠大的規模下,有些生成圖像根本無法追溯到任何單一訓練來源。作者將這個現象命名為歸因衰減(attribution decay)。
反事實問題
研究者提出的核心問題是個優雅的反事實提問:如果某張圖像從未出現在訓練集裡,模型會生成什麼?直接回答這個問題極其困難。最天真的做法——移除一張圖、從頭重新訓練整個模型、重新生成輸出,然後對成千上萬張圖重複這個過程——在運算上根本不可行。過去的影響力追蹤研究為了繞過這一點,都用近似方法估計單一來源圖像對輸出的貢獻度。
戴與 Gifford 拒絕了近似。「以前所有的方法都是近似的,」Gifford 說。「它們無法絕對地證明刪除個別資料不會改變輸出。這篇論文提出了第一個絕對的方法。你是在真正刪除輸入、刪除輸入的所有影響。這是第一個能有效率地做大規模刪除、並證明結果不變的精確方法。」
他們的解法是一種稱為擴散集成(diffusion ensemble)的架構。不是用一個模型訓練整個資料集,而是訓練多個模型元件,各自學習經過精心設計、彼此重疊的資料子集。關掉看過某張特定圖像、某個人或某位藝術家的元件,就等於移除了那個來源的因果影響,而且不需要從頭重新訓練。在完全相同的控制條件下重新生成圖像,就能「精確」觀察被移除的資料究竟重不重要。
用戴的話說,歸因的邏輯近乎公理:「如果你拿走一筆資料,模型的輸出不變,那這筆資料就沒有影響輸出。所以把輸出歸因於這筆資料沒什麼道理。如果你對其他每一筆資料逐一做同樣的事,發現輸出通通不變,那把輸出歸因於任何一筆資料都沒什麼道理。」
他們究竟測了什麼
團隊在七個公開圖像資料集的子集上訓練了 24 個擴散集成模型,訓練集規模從僅 256 張圖像到超過 162,000 張不等。他們將集成模型與 24 個在相同資料上訓練的傳統擴散模型做基準比較,結果顯示圖像「以標準指標來看品質差不多」——也就是說,集成這一招並不會讓輸出品質變差。
浮現的模式非常一致:訓練資料集越大,任何單一樣本的影響力越小。關鍵的是,歸因衰減不只發生在單張圖片上。在某些實驗中,研究者把某個人的所有照片視為一個單位;在另一些實驗中,把某位藝術家的所有作品視為一個單位。衰減依然成立。其中一個示範格外醒目:一個以 744 位藝術家公共領域作品訓練的模型,無論移除哪一位藝術家,生成的圖像幾乎沒有差別。
研究者也明確表示,這不是 AI 公司的免死金牌。模型確實會記憶並重現特定訓練樣本,即使在超大規模資料集下,可歸因的輸出仍可能出現。歸因衰減描述的是統計傾向,不是保證。
為什麼重要
法律與政策層面的意涵相當可觀。Gifford 將結果直接連結到模型輸出是否僅屬衍生作品的問題。「一種理解方式是,這些模型是有創造力的,」他說。「它們不是單純複製餵給它們的東西,而是創造全新的輸出。如果這些輸出與任何個別訓練資料都無關,那就引發了合理使用的問題、這些輸出本身能否作為新作品獲得版權的問題,以及當模型產出的東西無法歸因於網路上的任何內容時,創作者該如何獲得補償的問題。」
最後那句話最棘手。目前進行中的訴訟與各種授權機制提案,多半預設存在一條從輸出回溯到特定訓練作品的可追溯鏈。如果在大規模下這條鏈經常消解——不是因為證據被藏起來,而是因為沒有任何單一來源具有足夠的因果分量——那麼建立在逐一作品歸因上的侵權主張與補償機制,立足點就搖搖欲墜。AlphaGo 的類比很有啟發性:第 37 手仰賴 AlphaGo 對圍棋的全部所學,卻不是任何人類棋步的檢索。同樣地,一張 AI 圖像可以仰賴龐大的人類創作集合,而不強烈依賴任何單一作品。
還有一個建設性的反面。一個能精確、有效率地從已訓練模型中刪除單一資料影響的方法,正是退出請求(opt-out)、隱私法規與法院命令移除長期需要卻一直缺乏的東西。擴散集成技術只是研究原型,但它證明了大規模「遺忘」可以被精確完成、而非只能近似——這本身就是一個重要的進展。
誠實的但書
這項研究遠不足以宣稱 AI 具有人類意義上的創造力。人類有意圖、想像力、情感與藝術判斷;擴散模型有的是大規模的模式合成。這項發現也不能為未經授權使用版權作品訓練開脫——「攝取本身是否屬於合理使用」與「輸出是否可追溯」是兩個不同的問題,而研究只處理了後者。此外,實驗使用的資料集最多約 162,000 張圖像,前沿模型的訓練規模是以十億計;趨勢線指向一個方向,但最大的規模仍是外推。
儘管如此,在一個由強烈主張與薄弱證據主導的辯論裡,一個精確的測量是稀缺品。歸因衰減給了版權戰的雙方一個過去沒有的東西:一個嚴謹、可重現的基準,來界定「AI 圖像的來源」究竟是什麼意思——而有時候,答案是:沒有來源。