← All posts / Policy

ChatGPT 憑空捏造證人證詞:新墨西哥州最高法院重罰資深律師 5,000 美元

執業逾四十年的聖塔菲辯護律師因謀殺案上訴狀中出現 ChatGPT 捏造的警方證詞與不存在證人,遭最高法院裁定藐視法庭、罰款並解除委任——至今最嚴厲的 AI 幻覺司法懲戒。

ChatGPT 憑空捏造證人證詞:新墨西哥州最高法院重罰資深律師 5,000 美元

多年來,法官不斷警告 AI 生成的法律文件可能捏造判決引用。如今新墨西哥州最高法院展示了這種幻覺侵入法律最高風險領域——謀殺案上訴——會發生什麼事。週五,該州最高法院公開了對資深聖塔菲刑事辯護律師 Stephen P. Aarons 的完整懲處:這位執業超過四十年的律師提交的上訴狀中,被發現摻入了 ChatGPT 憑空捏造的警方證詞與證人。

法院裁定 Aarons 藐視法庭,處以 5,000 美元罰款,將他移出本案,並命令將其行為移送後續懲戒程序——法律界觀察家稱之為全美各州最高法院對 AI 幻覺文件至今最嚴厲的回應之一。

事件經過

這起案件(State v. Skeets)是一樁謀殺罪定判的上訴。根據法院的說明以及路透社、《衛報》與 ABA Journal 的報導,Aarons 將真實審判筆錄的部分內容輸入 ChatGPT,請它起草證據摘要——他告訴法院,自己想打造一份「防彈摘要」(bulletproof summary)來陳述當事人的主張。

模型輸出的內容看起來流暢且有說服力。但它有一部分是虛構的。這個模型:

  • 捏造了證人陳述,把真實證人從未說過的話加在其口中
  • 完全虛構了證人——這些人根本不存在,卻被引用在謀殺案上訴狀中
  • 杜撰了警方證詞——在真實卷證裡完全找不到

這些內容在送交法院前沒有被任何人察覺。這份文件掛著 Aarons 的名字與職業聲譽送進法院——同時承載著沒有任何真人說過的引述,而這是一樁關係到終身監禁的案子。

如何敗露

捏造內容在上訴審查階段被發現。法院一旦將上訴狀的事實主張與真實審判筆錄逐項比對,虛構材料立刻瓦解:那些假證人在任何法院紀錄中都找不到,因為他們從未存在過。Aarons 承認自己「愚蠢」地信賴模型輸出而未查證,但法院認定他的反應缺乏真誠悔意——這成為法院選擇裁定藐視法庭而非私下訓誡的因素之一。

懲處包含多個層面:

  1. 5,000 美元罰款,懲罰其向法院提交不實資訊
  2. 藐視法庭裁定——法院懲罰妨礙司法運作行為的正式權力
  3. 解除本案委任,Aarons 失去這件代理
  4. 移送懲戒——其行為進入可導致停權或除名的律師懲戒體系

對一位自 1980 年代初就在聖塔菲執業的刑事辯護律師而言,這是在漫長職業生涯最後一章遭到的毀滅性一擊。

為何此案比引用造假案更嚴重

自 2023 年著名的 Mata v. Avianca 案——律師引用了六個不存在的判決——以來,法院已懲戒了數十名提交 AI 捏造引用的律師。Damien Charlotin 維護的 AI 幻覺法律案例資料庫如今追蹤多國事件,模式早已確立:律師向聊天機器人求助,模型自信地發明權威來源,律師簽名送件。

但 State v. Skeets 在三個層面上打破了先例。

第一,捏造的是事實,不只是引用。 假判決引用誤導法院對法律的理解;捏造的證詞誤導法院對「發生了什麼事」的理解——而且是在謀殺案中。兩者的認識論風險有本質差異。權衡謀殺定判的上訴法院,完全依賴卷證的完整性。污染卷證,等於攻擊整個訴訟程序的根基。

第二,來源材料是真的。 Aarons 並不是問 ChatGPT 它不可能知道的事;他輸入的是真實筆錄。模型依然漂移至虛構——插入聽起來合理的證人陳述,把不存在的人編織進摘要。這正是讓 LLM 摘要在證據場景中危險的失敗模式:輸出流暢、結構良好、且在未逐行對照來源的情況下,錯得無聲無息。

第三,這是州最高法院的行動,不是個別 trial judge。 早期的懲戒多來自地區法院法官在個別文件中抓到錯誤。這次是州最高法院發布正式意見——創造了先例,新墨西哥州每個下級法院、以及全美觀望的法院,都會將其視為 AI 濫用的容忍上限,而非下限。

查證缺口

法院的核心認定很簡單:罪不在使用 AI,而在送出未查證的 AI 輸出。Aarons 自己的說法——想要「防彈摘要」——揭示了法律倫理學者自聊天機器人進入執業以來不斷警告的信任倒置。他把守護準確性的工作交給了模型,而自己只在傷害造成後才接手。

這個缺口正在擴大而非縮小。2026 年的前沿模型比產生第一批幻覺引用的系統更強大,但能力的提升並未消除幻覺——反而讓捏造更難察覺,因為周邊文字的品質更好了。藏在原本正確的真實筆錄摘要中的虛構引述,遠比粗糙文件中的假引用危險,因為其文風毫無造假跡象。

職業倫理體系正在急起直追。美國過半數州已發布指引,要求律師查證 AI 生成的引用,部分州(包括加州、佛州、密西根州)在某些情況下要求揭露 AI 使用。但針對「引用」的指引不會自動涵蓋「事實」。一條「確認判決存在」的規則,對「確認證人是否存在」隻字未提。新墨西哥州的意見把查證義務推到了真正關鍵的位置:一切都要查。

律師的失敗,被告的代價

懲處中藏著殘酷的諷刺。這份捏造文件最大的受害者不是 Aarons——而是他的當事人:一位謀殺案上訴人,如今在上訴中途失去了長期委任的律師,還繼承了一份被己方文件污染的卷證。檢方已不必努力爭辯上訴實體理由;辯方親手奉上了一場公信力災難。

上訴辯護圈已注意到系統性風險:工作量淹頸的公設辯護與法院指定律師,正是最容易求助 AI 來補資源缺口、也最缺乏時間逐行查證輸出的一群人。如果採用 AI 的結果是「看起來稱職的文件夾帶捏造證據」,這項技術恰恰劣化了最需要幫助的資源貧乏角落。

前路

新墨西哥州最高法院的意見,落在專業領域 AI 監管的密集季節。全美法院與律師公會正從柔性指引轉向硬性義務:查證、揭露、以及把「勝任使用 AI」本身納入倫理要求。像這樣由法官撰寫的意見,正在默默把「你應該檢查」轉化為「不檢查就會被裁定藐視法庭」。

對模型開發者而言,此類案件尖銳化了一個令人不適的問題。OpenAI 的使用政策要求在高風險領域確保準確性,但政策約束的是使用者,不是模型行為。一個能接收謀殺案審判筆錄、回傳虛構證人的系統,並不是故障的摘要工具——它就是 LLM 在做 LLM 一直在做的事,風險由使用者帶入。法律體系至今的答案,是讓文件上的簽名重新變得有分量。

Aarons 的懲戒程序將在未來數月走完流程。但這份意見本身已開始發揮作用:一份可搜尋、可引用的州最高法院宣告——「先送件後查證」的時代結束了。下一位想請聊天機器人寫「防彈摘要」的律師現在知道,那顆子彈可能射進自己當事人的案子裡。