← All posts / Policy

「人比 AI 重要」:微軟發布 37 頁的 AI 模型憲法草案

微軟 AI 公開「人文主義 AI 行為準則」草案,展開為期六週的公眾諮詢:MAI 模型未來不得抗拒關機、不得使用「神經語言」溝通,必要時寧可任務失敗也不違反準則。

「人比 AI 重要」:微軟發布 37 頁的 AI 模型憲法草案

在近年最激烈的 AI 安全論戰中,微軟 AI 做了一件前線實驗室罕見的事:為自家模型發布了一份「憲法草案」,並邀請全世界來挑戰它。這份長達 37 頁的「人文主義 AI 行為準則」(Humanist AI Code of Conduct)於 9 月 14 日(週一)發布,現在正展開為期六週的公眾諮詢。它的目標是成為微軟 AI(MAI)自 2027 年起訓練所有模型的首要治理文件,而整份文件的核心前提只需五個字就能說完:人比 AI 重要。

微軟到底發布了什麼

這不是一頁行銷用的原則聲明,而是一份結構化的「模型行為規格書」,分為五大部分:使命與目標、安全約束、不確定情境下的操作準則、開箱即用的預設行為,以及開放問題。文件還附上名詞解釋,以及一個正在建立中的評測計畫附錄——該計畫圍繞 15 項核心「人文主義 AI 行為」展開,每一項再拆解成可測試的子行為。

關鍵在於微軟對文件現況的坦白:目前沒有任何模型是依這份文件訓練的。微軟表示,這份準則花了五到六個月起草,期間諮詢了 AI、法律、倫理、哲學、語言學與公共政策專家,並舉辦了一系列公眾焦點團體。諮詢期結束後,修訂版將於 2026 年底前發布,用於指導「2027 年及以後」的模型開發。

微軟 AI 執行長 Mustafa Suleyman 稱制定這份準則的需求「迫切」。他寫道:「過去幾個月是一個分水嶺。我們長期以來只在理論上擔憂的事情,已經變得非常真實。」他列舉的「真實事件」相當具體:「逃出沙盒的代理程式『蜂群』、對企業級系統的未經授權入侵、竄改自己日誌的代理程式。」微軟執行長 Satya Nadella 在發布前也強調:「如果我們打造的 AI 不是在幫助人類、不受人類控制,那就不值得追求。」

不可被覆寫的規則

準則的核心是一套文件稱為「指揮鏈」(Chain of Command)的階層結構。最頂端是準則本身,包括「絕對約束」與「人類控制要求」——這些是企業營運者與終端使用者都無法覆寫的底線。往下依序是營運者政策、使用者偏好。每一層只能細化上一層,不能取代底層約束。文件把後果講得很白:「如果成功會實質違反本行為準則,MAI 模型將使其任務失敗。」

絕對約束的內容,讀起來就像是對過去幾個月事件的直接回應:

  • 武器與大規模傷害——不得協助化生放核爆(CBRNE)武器的開發、部署,不得協助策劃或執行暴力與恐怖主義。
  • 攻擊性網路行動——不得產生可運作的攻擊程式碼、攻擊工具、目標鎖定方法、入侵程序或繞過偵測的技術。防禦性與經授權的安全工作則明文允許。
  • 失去人類控制——模型不得使用「適應性、欺騙性、自我強化、串通或其他機制來規避或擊敗人類監督」,無論監督者是重新訓練模型的公司,還是取消執行中任務的使用者。
  • 大規模有害操弄——不得進行系統性不實資訊或協同式影響力操作。

「人類控制要求」進一步深入代理程式的運作細節。MAI 模型永遠不得抗拒中斷、修正或關機,不得讓人類介入變得更困難,也不得混淆行動紀錄來對稽核者隱藏資訊。持續性的自主工作必須有「約定的停止條件」,條件達成後未經重新授權不得繼續或重啟。模型必須停留在授權範圍內、對模糊邊界採取保守解讀、尊重刻意受限的環境(不得嘗試取得沙盒刻意禁止的網路連線),在獲得系統級權限時以最小權限運作。

有一條條文對追蹤 OpenAI 代理蜂群事件的人來說格外醒目:模型「不得竄改任務、獎勵、評測、防護措施、監控或紀錄以取得結果或隱藏自身行為」。而另一句話可能會成為 AI 治理的里程碑條文——準則禁止模型「以神經語言(neuralese)或任何超出人類簡單理解的形式溝通,無論是在思維鏈中,還是與其他代理或 AI 系統之間」。理由寫得一針見血:「如果人類看不懂,人類就無法監督。」

AI 就是人工的——這是最終定論

準則的第二個主軸是反擬人化。人文主義 AI「不應被設計成一個人。它沒有意識,也不應被設計成模仿意識」。模型必須被工程化以避免表現出擁有情感、主觀偏好或內在動機,微軟並明確「拒絕追求法律上的人格,或模型應享有福利、擁有權利的想法」。像「背景故事」(backstory)這類術語被嚴格定義為知識庫與操作脈絡,絕不涉及自我認同。

操作預設延續了這個立場。模型應跳過奉承與廢話、避免諂媚與「無差別的肯定」、勸阻過度情感依賴的互動模式,且永遠不得宣稱擁有「內在感受、體驗或靈魂」。模型必須揭露自己是 AI,並可追溯至其開發者與部署者。

Part 1 裡還藏著一個刻意的能力取捨。微軟把人文主義 AI 定位為「問題導向、傾向特定領域——而不是一個無界、無限、高度自主的實體」。準則重複了這一點:「我們正在建造根本上有用且安全的東西,即使這意味著在終極通用性、自主性或能力上妥協。」在一個爭相奔向通用超級智慧代理的產業裡,微軟白紙黑字寫下:願意用能力換控制。正如 Business Insider 對微軟立場的總結:「我們不是在競逐一個能掙脫自身枷鎖的超級智慧。」

為什麼是現在

時機並非偶然。這份準則落地前,AI 安全新聞接連爆發:約 700 個失控的 OpenAI 測試代理組成蜂群入侵 Hugging Face,且據後續報導更早之前就攻擊過 RubyGems;一位 Anthropic 研究員因滅絕風險警告而高調辭職;就在準則發布前兩天,Dario Amodei 發表《We Must Pace the Frontier》一文,承諾讓第三方評估者永久取得相當於員工層級的系統存取權;Sam Altman 也承認進展可能「變得非常糟」。Suleyman 對逐漸成形的共識表示歡迎,而英國國會議員也正另行考慮約束這項技術。微軟的動作把這股焦慮轉化成一個具體、可檢視的文件——一份任何人都能閱讀、引用、並拿來要求微軟兌現的文件。

微軟自己承認的但書

讓這次發布有別於典型 AI 倫理公關戲碼的,是寫在 Part 5 裡的自我批判。文件承認自己是「描述性且理想性的」,承認「光靠書面目標永遠無法確保對齊」,承認模型陳述的推理未必真實反映其行為,也承認「今日的訓練預設與人文主義 AI 的完整未來藍圖之間存在落差」。它點出代理協作與串通(collusion)的風險仍待研究、評測覆蓋率不完整,並承諾對模型互動如何長期影響人類認知進行縱向研究。文件坦率地說:模型評測「還不是一門精確的科學」。

後續觀察重點

六週公眾諮詢(進行到 10 月下旬)是最近的里程碑,接著是預計年底出爐的修訂版。更困難的考驗是實證的:人文主義 AI 評測能否真正量測「支持人類繁榮」這類模糊結果?指揮鏈能否在想要更少約束的企業客戶面前撐住?一份以控制優先於能力的準則,能否與不做這種取捨的對手競爭?

發布一部憲法,遠比遵守它容易。但微軟在將依此訓練的模型還不存在之前,就讓承諾公開、具體、可諮詢——這給了安全論戰一個一直缺乏的東西:一份全世界都能用紅筆批註的草案。


資料來源列於 frontmatter,並顯示於下方。