← All posts / Tools

當 AI SRE 掉球時:正在侵蝕事件處理能力的「去技能化」陷阱

自主式「AI SRE」代理人接管例行事件後,工程師失去了磨練直覺的機會,一旦罕見的 SEV0 降臨將更難以應對。Sylvain Kalache 的新文章重新搬出 Bainbridge 1983 年的「自動化的諷刺」,主張每個 on-call 團隊都該導入航空業式的事故模擬訓練。

當 AI SRE 掉球時:正在侵蝕事件處理能力的「去技能化」陷阱

「AI SRE」工具的推銷話術極具誘惑力,而且平心而論,正快速成真。現代的事件處理代理人會檢查告警、形成假設、查詢遙測數據、把爆炸半徑與最近的部署關聯起來,在更大膽的部署中甚至會自己動手修復。「這些工具什麼都做,」Rootly AI 實驗室負責人 Sylvain Kalache 在 9 月 4 日發布、本週衝上 Hacker News 首頁的文章中寫道,「但我有一個很大的疑慮:我們正在與自己的系統脫節。」

這一句話就是整篇論證的縮影。Kalache 不是 AI 懷疑論者——他自己多年來就在打造這類能力,文章開頭甚至是一段自白:2012 年他在 LinkedIn 當 SRE 時,曾設計過一套能自我治癒、從歷史事件中學習的系統。當年 AI 能力遠不如今日,那套系統止步於原型——但那個願景如今正以產品之姿落地。他擔心的不是這些工具做不好例行工作,而是它們做得太好。

這個悖論已經 43 歲了

文章看似反直覺的核心論點,其實是公開而刻意地借自人因研究學者 Lisanne Bainbridge。她 1983 年的論文〈自動化的諷刺〉(The Ironies of Automation)至今仍是這個悖論的經典表述:自動化恰恰移除了讓人類「安全地」累積系統直覺的例行工作,卻把新穎、異常、自動化搞不定的情境原封不動留給人類。

Bainbridge 當年的結論在今日讀來近乎預言:自動化系統的操作員需要比以前更熟練、更多訓練,而不是更少——因為剩下來給他們的工作,全是最難的部分。軟體工程過去四十年之所以多半躲過了這條鐵律,是因為維運從未自動化到足以讓肌肉萎縮的程度。AI SRE 時代終結了這段寬限期。當自主代理人解決了深夜的容量告警,手機不再把你吵醒——而你也永遠失去了那種只有親自穿過一次次故障才能建立的模式庫。

Kalache 的預測具體到可以被檢驗:受 AI 輔助事件處理之賜,例行事件的 MTTR(平均解決時間)會下降,但複雜事件的解決時間會暴增——因為最終接手的人已經缺乏練習,在調查一個自己不再從內部理解的系統時寸步難行。

航空業的解方:預演罕見事故

如果問題是自動化造成的,那麼一個更早擁抱自動化的產業正好指出了解方。商業航空數十年前就自動化了大部分的飛行,而它面對技能退化的風險,答案是強制模擬機訓練。依照美國 FAA 規定,客機機長每六個月必須回模擬機接受複訓或熟練度檢定——包括起飛時引擎失效這類情境。現代渦輪引擎罕見到什麼程度?每十萬引擎飛行小時不到一次空中停車,也就是說一位民航機長可能終其職業生涯都不會在模擬機之外遇到一次。模擬機,就是讓罕見緊急情況變得尋常的地方。

文章最令人心驚的一段是一份事故報告:一架雙引擎螺旋槳飛機起飛後不久,右發螺旋槳自動順槳。這架飛機的設計完全可以在單發狀態下繼續飛行——照手冊程序,這次失效是可存活的。但機組員誤判了問題,飛機失速,在第一次警告後 117 秒墜毀。罕見事件、退化的實作熟悉度、災難性結局。「雖然大多數軟體事故不至於危及人命,」Kalache 寫道,「但這不是我們不精益求精的理由。」

需要的是事故模擬器,不是事故觀眾席

文章的建設性後半段主張:軟體業需要自己的模擬機,而且造成去技能化的同一套 LLM 技術,正好可以拿來驅動訓練。在 Rootly,Kalache 的團隊已與夥伴合作打造擬真事故模擬:工程師坐上電商大當機模擬中的事件指揮官(incident commander)位置,操作真實的 observability 工具,並在 Slack 上與 LLM 扮演的利害關係人協調——包括一位步步進逼的 CEO 和喘不過氣的客服團隊。

「那種臨場感非常真實,」他寫道。被演練的技能恰恰是最先退化的那批:在資訊不完整的情況下理清現況、清晰溝通、協調多人,以及真正「主持」一場應變,而不是旁觀一場應變。

他也明確拒絕了最省事的版本。沒錯,工程師可以要求 AI 代理人解釋它採取的每一步、看過的訊號、以及診斷背後的證據——這種解釋確實有價值。「但解釋與旁觀取代不了練習,」文章強調,「看 Serena Williams 打球或許能學到一兩招,但網球只有站上球場才學得會,事件處理也一樣。」這個論點之所以有分量,是因為 Kalache 花了五年多創辦 Holberton School、推行做中學的漸進式教育——當 Dropbox 告訴他錄用的畢業生在不擅長除錯時,他的答案是給學生一套故意弄壞的基礎設施,要求他們診斷並修復。

理解債

文章最耐用的鑄詞是理解債(comprehension debt):系統實際運作方式,與 on-call 人類理解程度之間不斷擴大的鴻溝。它是 Bainbridge 在駕駛艙裡量化過的現象的技術表親——而且它會隨著每一次「AI 自己解決、人類不在迴路內」的事件無聲地複利累積。文章承認,桌上演練(tabletop exercises)和混沌工程都不是新發明;是 LLM 時代把它們從選配變成了必配。定期親手操作你負責的系統、刻意暴露於陌生故障、壓力下練習、SEV0 級的協調演練——這些現在都該寫進 on-call 戰備檢查表。

結尾的諷刺正是 Bainbridge 的原話,為 AI 世代改寫:自動化愈成功,人類在它失靈那一刻的準備就愈不足。

對平台與 SRE 主管來說,這篇文章登場的時機格外尷尬。就在它傳遍 Hacker News 的同一週,各家廠商正忙著把「全自主維運」包裝成終極願景。Kalache 的論點並不反對那個終點——他自己就正在往那個方向打造。他反對的是「人類會被動繼承戰備能力」這個假設。航空業自動化了飛行,然後砸下數十億美元蓋模擬機,讓飛行員為那關鍵的 117 秒保持敏銳。正在自動化自身維運的軟體業,迄今在對應的投資上幾乎是零。那個永不眠的「AI SRE」無論如何都會抵達;真正的開放問題是——當 AI 終於把 pager 遞回來的那一刻,迴路裡的那個人類,對系統還醒著嗎?