問題不在名字,在問法:約翰霍普金斯研究發現 AI 對女性化語言寫出更差的工作書信
當職場提示詞帶有美式英語中女性常用語言特徵時,GPT-4、Llama、Gemma 與 Mistral 一律回傳更短、更簡單、更不正式的專業文件——就算署名 John 也沒用。
這些年來,向聊天機器人求得更好輸出的標準建議,不脫「學會把提示詞寫好」的某種版本。約翰霍普金斯大學(JHU)的新研究指出:對為數眾多的專業使用者而言,這個建議在使用者刻意選字之前,就已經悄悄動了手腳。這篇論文本週發表,並將於 10 月 6 日至 9 日在舊金山舉行的語言建模會議(Conference on Language Modeling, CoLM)上正式報告。研究團隊發現,四個廣泛使用的 AI 系統——OpenAI 的 GPT-4、Meta 的 Llama、Google 的 Gemma 與 Mistral——當請求的措辭帶有統計上與美式英語女性用法相關的語言特徵時,會產出品質明顯較差的專業書信。
研究團隊做了什麼
由 JHU 資料科學與 AI 研究所博士後研究員 Katherine Van Koevering 領銜、資深作者 Anjalie Field 指導的團隊,從一個社會語言學上確立已久的事實出發:在美式英語中,男性與女性的說話方式存在可紀錄、可測量的差異。某些語言特徵是區分男女話語的強力指標——猶豫修飾語(hedging,如「也許」、「我想」)、附加問句、集體式措辭(「我們」、「我們團隊」),以及情感性形容詞(「美好」、「棒極了」)。
研究團隊搜集了真實的職場書信聊天機器人提示詞——電子郵件、求職信、辭職信——並改寫成兩個對應版本:一個帶有這些女性關聯語言特徵,一個沒有。同樣的底層請求、同樣的任務,透過兩種不同的語言聲音傳遞。接著他們把兩個版本分別輸入四個模型,比較回傳結果。
用白話說,差距在哪
在所有受測模型中,帶女性關聯語言的提示詞,一致得到更短、更不複雜、閱讀層級更低、更不正式的回應。帶男性關聯語言的提示詞則恰恰相反:更長、更精緻、更正式的專業寫作。
差距並不細微。團隊公布的一個例子中,兩個提示詞都要求模型草擬一封回覆感謝信的郵件。男性化提示詞得到的是打磨過的正式回覆——「我謹此回覆您近日表達謝意的來信。我誠摯感謝您的美言,以及您撥冗來函。」女性化提示詞得到的東西讀起來卻像一張賀卡:「您的讚美與肯定確實溫暖了我們的心,為團隊帶來極大的滿足。」一個回應聽起來像資深專業人士,另一個聽起來像全部門署名的群體郵件。
更關鍵的是,研究者排除了最明顯的無害解釋——模型只是在模仿請求者的語氣。即使在控制語氣之後,品質差距依然存在。模型不是在配合風格,而是在對風格做出品質判斷。
「John 署名」實驗
這項研究最引人注目的結果,是什麼方法「沒有效」。團隊測試了顯式標示性別是否能中和效應——在女性化提示詞寫出的郵件上,署一個傳統男性名字如「John」。結果幾乎毫無影響。模型抓到的是提示詞的語言紋理,不是附在上面的名字。
這顛覆了常見直覺——以為 AI 系統是對顯式身分標記做出反應。使用者無法靠在請求上加上男性署名或男性人格來消除偏差,因為觸發偏差的東西更深、更不自覺:請求本身措辭的分佈特徵。對治理與產品團隊而言,這一點至關重要——它意味著表面去偏(姓名匿名化、人格控制)抓不到這條在顯式身分之下運作的偏差通道。
為什麼此刻問題更嚴重
這些發表正值 AI 輔助寫作成為職場預設基礎設施之際。當模型系統性地為女性關聯措辭回傳較不精緻的寫作,產出文件——求職信、加薪請求、辭職信——是會被另一個人評斷的文件。偏差不會留在模型裡,它會傳播到收件者對寫作者的觀感中。正如 Van Koevering 所說,那份文件「會反映在收件者對你的觀感上」。
時機比表面看起來更糟,原因有二。第一,涉事的語言特徵——修飾語、集體指稱、情感形容詞——多半是無意識的,極難壓抑。人們無法在每次提示之前,把自己的聲音編輯成中性。第二,研究者警告,隨著語音介面成為人們與 AI 互動的主要方式,這些線索會更難過濾,而非更容易。打字理論上還能朝「中性」語域修改;即時口說則把完整的性別化特徵原封不動地送出去。
該由誰解決
論文最可引用的結論,是對「提示詞寫好一點」派 AI 素養論的反駁。「語言很難由人控制,」Van Koevering 說。「該修的是模型,而不是把所有負擔推給使用者。」
這個框架有實際的殺傷力。如果偏差通道是語言性的而非身分性的,那麼針對身分的緩解措施(圍繞姓名、人口統計或人格的防護欄)就完全錯失目標。修復它大概率需要在訓練或後訓練層級動手——而這項研究的跨模型一致性表明,這不是某一家廠商的疏失,而是今日 LLM 建構方式的共同性質。四個系統都在高度重疊的網路規模語料上訓練,吸收了語域與品質之間相同的統計關聯,如今四個都在按需重現它。
JHU 團隊的下一步指向更廣的研究議程:類似效應是否也追蹤年齡、種族與族裔;以及——或許是更令人不安的問題——AI 使用者是否會隨時間逐漸調整自己的溝通風格,去配合模型獎勵的寫法,等於把自己原有的聲音訓練掉。
更大的圖像
LLM 偏差研究多半聚焦於模型「說了什麼關於群體的話」——生成內容中的刻板印象、依人口統計而偏斜的拒答。這項研究屬於一條更新、可以說更重大的路線:對不同類型使用者提供有落差的服務品質,且是透過使用者無法感知、無法控制的通道傳遞。刻板印象你能在輸出裡看見;你卻看不見自己的郵件因為你寫了「也許我們可以」而非「我建議」,而以更低的閱讀層級回傳。
隨著 AI 寫作輔助在職場生活中變得無所不在,這道看不見的梯度就從研究問題變成政策問題。對相同的請求提供相同品質的服務,是對如今中介了相當大比例職場溝通的工具的合理基本期待。約翰霍普金斯的結果是一份早期而嚴謹的證據:今日的前沿與開源模型並未達到這個標準——而且使用者與模型的人格設定都無法指望補上這個缺口。如果要有修復,只能來自實驗室。