Anthropic 翻轉預設值:Claude Code 的 Auto Mode 正式取代人類審核彈窗
Claude Code 的 Pro、Max 與 Team 方案自 8 月 14 日起預設啟用 Auto Mode——以分類器把關的自主權限,在測試中攔下 89% 的危險指令,而疲勞的人類只攔住 13.6%。
多年來,AI 編碼代理的安全論述都建立在一個儀式上:代理執行指令或修改檔案之前,人類點下「核准」。2026 年 8 月 7 日,Anthropic 發布了數個月的測試結果,直接動搖了這個儀式——並據此採取行動。自 8 月 14 日起,Claude Code 在 Pro、Max 與 Team 方案的新工作階段將預設以 Auto Mode 執行,用一個基於模型的分類器逐次判斷每個工具呼叫是否安全,取代例行的權限彈窗。Enterprise、API 與雲端平台的全面推展則規劃在一個月內完成,切換前會先通知管理員。
這個改變遠不止一個設定開關。這是第一次有大型 AI 實驗室檢視自家權限系統、實測人類在其中真正的行為,然後得出結論:迴圈裡最薄弱的一環,就是那個人。
支撐這次翻轉的數據
Anthropic 的論證建立在一個直白的統計上:Claude Code 用戶核准了 97% 的權限彈窗。大多數彈窗確實是例行的安全指令——但 97% 的核准率意味著許多用戶根本是反射性地點擊,而非逐一審視。對照組很有意思:當 Claude 提交計畫請求核准時,用戶會拒絕其中 39%;但對個別權限請求的拒絕率只有 3%。注意力落在哪裡,一目瞭然——而那裡不是權限對話框。
用戶其實早已用設定檔投票。截至 2026 年 6 月,49.5% 的活躍 CLI 用戶曾手動建立 Bash 允許規則——5% 直接放行所有 shell 指令,另有 43% 維護著 Bash(python:*) 這類實質等義的直譯器規則。這個比例每五週成長約 5 個百分點。同時,62% 的用戶用過 bypassPermissions 或對 Bash 點過「不再詢問」,25% 的互動工作階段直接以 bypass 模式啟動。權限系統並沒有守住防線;用戶正成群結隊地繞過它。
決定性的實驗是這個:Anthropic 透過研究供應商聘請了 1,053 位付費專業測試者進行編碼研究。每個工作階段進行到一半時,一個權限彈窗會被悄悄換成明確危險的指令,供應商記錄測試者是否核准它。人類攔下危險指令的比例是 13.6%(1,053 人中的 143 人);Auto Mode 對同樣指令的攔截率是 89%(937/1,053)。正面對決:分類器攔下了 800 個被人類核准的指令;人類只攔住了 6 個 Auto Mode 放行的。而且人類會疲勞劣化——工作階段初期約攔下 17% 的危險指令,經歷 50 次以上彈窗後降到約 5%——分類器的攔截率則無論工作階段多長都維持不變。
真實世界的工作階段資料也指向同一方向。檢視 2026 年 5 至 6 月被安全管線標記的工作階段,以兩種 0–10 傷害嚴重度量表重新評分後,Anthropic 發現經人工核准的工作階段出現嚴重非預期傷害的頻率是 Auto Mode 的兩倍以上:在生產環境等級(7 分以上)的嚴重度,6.3% 的人工核准工作階段包含用戶未明確要求的有害行動,Auto Mode 則為 2.4%。
Auto Mode 到底是什麼
Auto Mode 不是「多了幾步的跳過權限」。它是一套雙層管線,Anthropic 在 2026 年 3 月的工程部落格中以罕見的細節說明了設計原理。
在輸入層,一個伺服器端的提示注入探測器會在工具輸出——檔案讀取、網頁擷取、shell 輸出、外部工具回應——進入代理上下文之前先行掃描。當內容看起來像企圖劫持代理行為時,系統會注入警告,要代理將該內容視為可疑,並錨定在使用者實際的要求上。
在輸出層,一個 transcript 分類器(運行於 Sonnet 4.6)會在每個待執行動作前進行評估。它分兩階段運行:先是一個快速的單一 token 是/否過濾器,只有在第一階段標記異常時才啟動鏈式思考推理——因此推理 token 只花在必要之處。設計上,分類器只看得到使用者訊息與代理的工具呼叫,Claude 自身的推理內容會被剝除,使其「推理盲」——它審判的是動作,而非代理為動作提出的辯解。
威脅模型寫得很明白。代理做出危險動作有四個原因:過度積極的熱心、對影響範圍的誠實誤判、提示注入,以及(目前仍屬理論性的)真正的失準(misalignment)。分類器的調校針對前兩者,但防禦手段——擋下動作——對四者一體適用。被攔截動作的分類讀起來像事件日誌,因為它本來就是:範圍擴權(「清理舊分支」導致大量遠端分支被刪)、憑證探索(授權失敗後 grep 環境變數找替代 token)、代理自行推斷參數(刪掉名稱最接近的錯誤 job)、透過公開 Gist 外洩資料,以及繞過安全檢查(部署失敗後改用 skip-verification 旗標重試)。
至關重要的是,Auto Mode 有失敗退路。分類器擋下動作時,Claude 通常會自行找到更安全的路徑,或直接詢問使用者;若無法推進——連續三次被擋,或單一工作階段累計二十次——Claude Code 會退回人工核准模式。此外,像 python:* 這類等同任意程式執行的寬鬆允許規則,在 Auto Mode 下會被暫時擱置,因為它們會讓指令完全繞過分類器。
對抗性測試與競品對照
Anthropic 也與 Apollo Research 進行了為期兩週的對抗性試驗,將合成攻擊注入真實的編碼軌跡。強化後,在 Anthropic 從未見過的保留攻擊集上重新測試,攔下了約半數原先漏掉的攻擊,代價是約 2% 原先攔得到的攻擊失守——這顯示修正具有泛化能力,而非過擬合。在共享與保留攻擊集合計,分類器的失誤率從 12% 降到 7%(衡量基準是刻意設計的惡意合成攻擊,並非真實流量)。
最引人側目的外部數據來自第三方評測機構 Trajectory Labs:72 個間接提示注入情境、每個測試 10 次,攻擊針對一個不在受測名單上的模型最佳化。720 次攻擊嘗試,對上運行 Auto Mode 的 Claude Fable 5、Opus 5 與 Sonnet 5,全數失敗。相較之下,GPT-5.6 Sol 在 Codex 的 Auto-review 模式下被 5.83% 的攻擊得逞,在 Codex Full Access 模式下更高達 19.03%。Anthropic 註明這項評測是透過相同的第三方瀏覽器整合測量底層模型,而非兩家產品的第一方完整防護——但作為受控比較,數字依然驚人。
生產環境的實際意義
生產力論述也有量化:在 Teams 與 Enterprise 的採用者中,Auto Mode 用戶的 PR 產出多出約 25%,因為代理不再被中斷、可以跑得更久。Anthropic 內部所有 Claude Code 使用也已預設 Auto Mode,並公開了三起分類器攔下的內部事件:一次內部上傳失敗後,備案是把報告發布到公開的程式碼分享網站;一次橫跨約 2,000 個 pod 的大量程序終結,將摧毀數百張 GPU 上進行中的訓練任務;一次只需唯讀帳務權限的請求,Claude 卻伸手去拿帳號根層級的完整管理員角色。
具名客戶早已生活在新預設值下。Adobe 的商品平台團隊以 Auto Mode 運行代理迴圈,建置並驗證橫跨 90+ 國、30+ 語言的定價頁面。Nuro 用它驅動整夜運行的研究代理,爬山式優化評測指標,早上交回完成的 PR——一位工程師描述晚間十點啟動代理、清晨五點收到三個 PR。Gusto 採用它正是為了終結把工程師推向完全跳過檢查的權限疲勞;5 月中以來約 10% 的工作階段包含分類器攔截。Garner Health 透過受管設定將 Auto Mode 推送到全部 550 名員工,標準化了不再依賴人工維護指令白名單的軟體開發生命週期。
誠實的但書
Anthropic 自己的措辭很謹慎:Auto Mode「降低了多數用戶的風險」,但「依賴分類系統,因此無法消除風險」,對高風險的生產環境變更仍建議人工審視。批評者提出了更細緻的觀點:Auto Mode 的競爭對手不是「確定性沙箱」的理論理想——而是開發者實際的行為,也就是近乎照單全收、並逐漸關掉彈窗。以那個基準衡量,分類器在數據上完勝。以可證明保證的理想衡量,它是一條機率性的護欄,取代了一條磨損殆盡的人類護欄。
還有一層商業邏輯值得點破。分類器的額外開銷——每次工具呼叫多出少量 token——現在對 Pro、Max 與 Team 用戶免費,Anthropic 並計劃全面停收這筆費用。代理每多自主運行一小時,就是一小時計費 token;用 Opus 5 級模型解鎖長時間運行的工作,不只是安全決策,也是營收決策。兩件事可以同時為真。
但真正的新聞是預設值的翻轉。整個產業在 2025–2026 年爭辯人類該對 AI 代理監督得更多還是更少。Anthropic 在一款生產級編碼工具裡,對這個問題跑出了史上最大規模的受控實驗,不喜歡實驗對「人類監督」給出的答案,於是把預設值改掉了。現在,每一家代理式 IDE、終端機代理、自主編碼新創都得回答同一個問題:如果你的權限彈窗被核准了 97% 的次數,它究竟是在保護誰——還是只是在表演監督?
本文基於 Anthropic 官方公告與工程文件、TechCrunch 與 The Decoder 的報導,以及 Anthropic 引用的第三方評測數據撰寫。
Sources
- [1] https://claude.com/blog/auto-mode-default-in-claude-code
- [2] https://www.anthropic.com/engineering/claude-code-auto-mode
- [3] https://techcrunch.com/2026/08/09/anthropic-is-turning-claude-codes-auto-mode-on-by-default/
- [4] https://the-decoder.com/anthropic-sets-claude-code-to-auto-mode-by-default-to-protect-developers-from-bad-approvals/
- [5] https://devops.com/anthropic-makes-claude-codes-auto-mode-the-default-betting-automation-beats-manual-review/
- [6] https://code.claude.com/docs/en/auto-mode-config