Anthropic 將 Claude Code 全面切換至 Auto Mode:當 AI 成為自己的守門人
2026 年 8 月 14 日,Anthropic 將 Claude Code 的預設權限模式切換為 auto mode——押注一個能阻擋 89% 危險指令的 AI 分類器,勝過只抓到 13.6% 的人類審核者。
過去將近一年,使用 Claude Code 的開發者都熟悉一種節奏:Claude 提出一個指令,畫面跳出權限提示,開發者點擊「同意」。一個工作階段重複幾百次。2026 年 8 月 14 日,這個節奏正式改變。Anthropic 將 auto mode(自動模式)設為 Pro、Max 與 Team 方案所有新 Claude Code 工作階段的預設權限模式——這項改變將人類從常規操作的審核迴圈中移除,改由一個 AI 分類器把關,而該公司表示,這個分類器在捕捉危險指令方面的表現遠遠超越它所取代的人類。
這是 AI 程式碼代理短暫歷史中最關鍵的產品決策之一。支撐這項決策的數據,訴說了一個挑戰人類監督迷思的故事。
審核疲勞的問題
Claude Code 最初的設計理念很直接:行動前先詢問。每個 shell 指令、每次檔案寫入、每個網路請求,都需要使用者明確同意。在 AI 代理可能執行 rm -rf 或外洩機密的世界裡,這似乎是負責任的預設值。
但數字說了不同的故事。Anthropic 的內部遙測資料顯示,Claude Code 使用者同意了 97% 的權限提示。當你幾乎同意所有事情時,這個審核步驟其實不是安全防線——它只是減速帶。開發者很快就學會反射性地按下「是」,而真正危險的指令就埋沒在一堆常規指令中,安然通過。
這種現象在資安研究中早有記載,被稱為「警報疲勞」(alert fatigue)。它意味著手動審核閘門提供的不是真正的安全,而是安全的幻覺。Anthropic 的工程團隊意識到,整天和 Claude Code 為伍的中位數開發者,其實更像橡皮圖章而非資安審計員。
Auto Mode 的架構
Auto mode 於 2026 年 3 月首度推出,此後逐步擴大部署。它用 Anthropic 稱為兩階段轉錄分類器(two-stage transcript classifier)的系統,取代了人在迴圈中的審核模式。分類器不是要求使用者評估每個單一行動,而是持續監控完整的對話轉錄——也就是 Claude 被要求做什麼、提出了什麼、即將執行什麼的完整上下文。
第一階段在上下文中評估行動:這個指令是否與使用者陳述的意圖一致?是否可逆?是否觸及敏感檔案或網路端點?第二階段則進行危險評估:這個指令是否可能造成無法挽回的損害、外洩資料、或執行破壞性操作?
被判定為安全的行動——檔案讀取、非破壞性 git 操作、寫入專案目錄——會被靜默自動批准。被分類器標記為可能危險的行動,仍會提交給使用者手動審核。關鍵在於,分類器還會考量完整的轉錄歷史,這意味著它能偵測提示注入攻擊或異常行為模式——而這些是逐指令審核無法發現的。
分類器之上還疊加了沙盒系統,為 Bash 指令提供檔案系統與網路隔離。Anthropic 的工程部落格指出,沙盒本身就減少了 84% 的權限提示,且沙盒化的網路存取請求會被路由到分類器,而非預設允許。
支撐這次切換的數據
決定將 auto mode 設為預設的關鍵,是一項由 Anthropic 與 1,053 名付費測試者共同進行的對照研究。研究人員在真實的程式開發工作流程中植入危險指令——有些是真實的,有些是模擬的注入攻擊——然後測量每種把關方法捕捉到它們的頻率。
結果令人震驚:
| 把關者 | 成功阻擋的危險指令比例 |
|---|---|
| Auto mode 分類器 | 89% |
| 人類手動審核 | 13.6% |
AI 分類器在捕捉危險指令方面的效率,是人類開發者的 6.5 倍。人類在大量提示的疲勽轟炸和對 Claude 輸出的信任下,錯過了絕大多數植入的威脅。分類器永遠不會疲倦、永遠不會分心,抓到了將近九成的危險指令。
知名開發者與 AI 評論家 Simon Willison 強調了這項發現的意義:它顛覆了「人類監督是 AI 安全黃金標準」的傳統認知。如果人類審核者對 97% 的提示照單全收,且只抓到 13.6% 的真實威脅,那麼人類增加的不是安全——而是延遲。
11% 的缺口與誠實的局限
Anthropic 對局限性的坦誠令人耳目一新。89% 的阻擋率意味著仍有 11% 的危險指令穿過了分類器。這不是捨入誤差,而是真實的攻擊面。公司承認 auto mode 並非安全意識開發實踐的完全替代品。
一篇發表在 arXiv 上的壓力測試論文(2604.04978)評估了 auto mode 的真實世界表現,發現兩階段分類器雖然對常見模式表現優異,但仍可能被新穎的混淆技術和多步驟攻擊欺騙——這類攻擊的每個步驟單獨來看都無害,但組合起來卻具有破壞性。論文將 auto mode 描述為「首個部署的 AI 程式碼代理權限系統」——一個里程碑,但也只是一個有成長空間的第一代系統。
分類機制還引入了一個微妙的矛盾:分類器本身是一個 AI 模型在評估另一個 AI 模型的行動。如果兩者共享相似的盲點——如果分類器和 Claude Code 是在重疊的資料分佈上訓練的——它們可能共享相關的失敗模式,而對手攻擊者可以利用這一點。
開發者會經歷什麼改變
從 8 月 14 日起,Pro、Max 和 Team 方案的新 Claude Code 工作階段將預設以 auto mode 啟動。實際體驗會有顯著變化:
Auto mode 之前: 一個典型的重構工作階段可能產生 50 到 100 個權限提示。每一個都打斷心流並要求決策。
Auto mode 之後: 同一個工作階段可能只產生大約 5 到 10 個提示——只有那些被分類器標記為真正不確定或可能危險的。開發者反映他們能維持以前不可能達到的心流狀態。
對於有嚴格合規要求的團隊,Claude Code 保留了切換回手動審核模式的能力。--permission-mode ask 旗標恢復舊有行為,企業管理員也能在其組織內強制執行特定的權限模式。Anthropic 強調,auto mode 在 Pro、Max 和 Team 方案上會計入使用量限制,這意味著更快的流程也轉化為更高的 token 消耗。
免費方案和個人方案的 Claude Code 目前不受此變更影響。
更廣泛的產業訊號
Auto mode 成為預設不僅是產品更新——它是關於人機協作未來的命題宣告。Anthropic 隱含地主張:AI 比人類更擅長監督 AI,至少在評估 shell 指令這類邊界明確的任務上如此。
如果這個命題成立,其影響遠遠超越 Claude Code。每個 AI 代理平台——從自主研究工具到自動化 DevOps 管線——都面臨同樣的設計選擇:人在迴圈中,還是分類器在迴圈中。89% 對比 13.6% 的數據,為建構代理系統的公司提供了選擇後者的有力論據。
競爭對手正在密切觀察。OpenAI 的 Codex、Meta 的 Muse Code,以及各種開源程式碼代理,都在處理同樣的權限設計問題。如果 Anthropic 的 auto mode 被證明成功——無論是在採用率上還是在避免重大資安事件上——預期整個產業將趨向以分類器為基礎的權限系統,作為 AI 代理安全的標準。
風險的計算
這項過渡並非沒有風險。將人類從一個能執行任意程式碼的 AI 代理的審核迴圈中移除,是一次重大的信任轉移。如果分類器在某個廣泛使用的專案上發生災難性失誤——比方說,自動批准了一個刪除正式環境資料庫的指令——反噬可能會非常嚴重。
Anthropic 正在透過漸進式部署、透明的數據分享,以及限制爆炸半徑的沙盒層來降低風險。但公司也在做一個經過計算的賭注:現狀——人類對 97% 的提示照單全收——從未提供真正的安全。用更好的系統取代一個壞掉的系統——即使新系統也不完美——才是正確的選擇。
對這項改變最熱切的開發者,是那些早已在使用非官方 --dangerously-skip-permissions 旗標的人——那個旗標完全繞過所有審核。Auto mode 給了他們想要的速度,同時加上了他們以前沒有的安全網。
展望未來
Auto mode 成為預設,標誌著 AI 程式碼代理不再請求許可,而是開始承擔責任的時刻。這份責任是否實至名歸,不會用基準測試來衡量,而是在未來的數月中——在那些沒有發生的事件,以及那些發生了的事件中——得到驗證。
89% 這個數字令人印象深刻。但 11% 的缺口才是真正的故事。Anthropic 如何縮小它,以及產業是否跟進,將塑造未來數年每一位開發者與 AI 代理互動的方式。
有一點是確定的:對每個 AI 行動都點擊「同意」的時代正在終結。某個更快的東西——而且可能更安全的東西——正在取而代之。
Sources
- [1] https://techcrunch.com/2026/08/09/anthropic-is-turning-claude-codes-auto-mode-on-by-default/
- [2] https://www.anthropic.com/engineering/claude-code-auto-mode
- [3] https://claude.com/blog/auto-mode-default-in-claude-code
- [4] https://www.infoworld.com/article/4207959/anthropic-makes-claude-codes-auto-mode-default-for-paid-users.html
- [5] https://www.theregister.com/ai-and-ml/2026/08/10/claude-code-puts-auto-mode-in-the-drivers-seat/5285326
- [6] https://www.reddit.com/r/ClaudeAI/comments/1vjqcvf/anthropic_flips_claude_code_to_auto_mode_by/
- [7] https://arxiv.org/html/2604.04978v2
- [8] https://simonwillison.net/2026/Aug/8/auto-mode/
- [9] https://code.claude.com/docs/en/permission-modes
- [10] https://devops.com/anthropic-makes-claude-codes-auto-mode-the-default-betting-automation-beats-manual-review/