AI 事故應變全自動化,工程師正在失去對自家系統的理解|AIRUN AI 新知
把系統事故全交給 AI 處理,短期省下的是深夜被叫醒的次數,長期賠掉的是團隊看懂自家系統的能力。真正的風險在 AI 解不了的那一次。
前 LinkedIn SRE(網站可靠性工程師)Sylvain Kalache 的一篇文章在 Hacker News 上引發討論,累積 397 分(原文,發布日期原文未標示)。他的觀察很直接:AI 事故應變工具愈強,工程師親手排查的機會就愈少。他本人就在做這類工具,也在事故管理公司 Rootly 任職;這話等於自己人在提醒自家產品的副作用,反而值得多聽。
這篇文章拆解他的論點,並把同一套邏輯套到台灣中小企業最愛的 AI 客服與自動化維運上。結論先講:省人力與保能力可以並存,但要靠老闆把演練排進制度,否則能力會在沒人察覺的情況下流掉。
AI 事故應變工具到底替工程師做了什麼?
AI 事故應變(AI incident response)指的是讓 AI agent 自動讀取警報、提出假設、查詢監控數據、比對最近的部署紀錄,最後自己動手修復。業界常叫它們「AI SRE」,原文作者說他不太喜歡這個名字,但承認這些工具在很多方面確實出色。
Kalache 在 原文 提到,他 2012 年在 LinkedIn 當 SRE 時就設計過一套能自我修復、從過去事故學習的系統。當年 AI 能力遠遠不夠,那套東西停在原型階段。如今它已經是現實:例行事故在半夜發生,AI 自己處理掉,工程師不用起床。
這種體驗確實迷人。問題出在「例行事故」的另一個身分:它們正是工程師在安全範圍內建立系統直覺的場合。你知道系統平常怎麼壞、壞了長什麼樣,靠的就是一次次親手處理小事故。
為什麼 AI 處理得愈好,工程師反而愈危險?
因為自動化拿走的是練習機會,留給人的是最難的題目。AI 解決得了例行事故,解決不了從沒見過的複雜事故;到時候接手的工程師,手感比從前更生疏。
這個矛盾有名字。人因研究者 Lisanne Bainbridge 在 1983 年發表的論文《自動化的諷刺》(The Ironies of Automation)指出:自動化減少了操作者練習例行工作的機會,卻把新的、異常的狀況留給他們負責。她的結論在四十多年後依然銳利:自動化之後,操作者需要的技能與訓練量要比以前更多,而非更少。
Kalache 據此做了一個預測:接下來幾年,大多數事故的平均修復時間(MTTR,從發生到解決的平均時間)會因為 AI 而下降,但複雜事故的解決時間會暴增,因為工程師已經跟自己的系統脫節,卡在調查階段動彈不得。原文用的是假設語氣,這是他對未來幾年的預測,並非已經發生的觀察;他本人在事故管理公司 Rootly 做的正是這類工具,這個預測出自第一線,分量不輕。
換句話說,公司看到的報表會很漂亮:事故變少、修得變快。真正的帳要等到那一次 AI 舉手投降時才會結算。
航空業怎麼面對「自動化接手大部分工作」這件事?
航空業的答案是強制演練。自動駕駛負責大部分飛行,機師仍然要為引擎失效、儀表異常、中止起飛、失速這些自動化處理不了的狀況負責,而且必須在幾秒內反應正確。
這些狀況有多罕見?原文引用的數字是:現代渦輪引擎每 10 萬引擎飛行小時的空中停車次數不到 1 次(來源)。罕見到一位民航機師整個職涯可能只在模擬機裡遇過。
但發生時代價極高。復興航空 235 號班機事故中,右引擎螺旋槳在起飛後不久自動順槳,飛機設計上可以靠左引擎繼續飛行,機組卻誤判了問題。從第一個警告到墜毀只有 117 秒。台灣讀者對這起事故不會陌生。
所以美國 FAA 規定,機長每六個月必須完成一次複訓或能力檢定,內容包含起飛時引擎失效這類情境。Kalache 的立場是:軟體事故多半不危及生命,但這不是放棄磨練技藝的理由。
看 AI 解釋它怎麼修,能不能取代親手排查?
不能。讓 AI 說明它查了哪些訊號、憑什麼證據下診斷,對學習有幫助,但解釋與觀察都無法取代練習。原文的比喻很準:看 Serena Williams 打球能學到一點東西,但你只能靠上場才學會網球,事故應變也一樣。
他的解法是把製造問題的技術拿來補洞。Rootly 與 Uptime Labs 合作做了事故模擬器:工程師坐上事故指揮官的位子,面對一場模擬的電商網站當機,一邊用監控工具查問題,一邊在 Slack 裡應付由大型語言模型扮演的執行長與客服。練的是事故現場真正需要的能力:在資訊不完整時做判斷、清楚溝通、協調人、把整場應變跑起來。
Kalache 過去花了超過五年建立一所以「做中學」為核心的軟體工程學校,沒有老師,學生靠做專案學習。原文提到 Dropbox 曾回饋他,錄取的畢業生在排錯上仍然經驗不足;這段內容在來源摘錄裡沒有寫完,我們不替他補結論。
這對台灣中小企業意味著什麼?
意味著同一套風險正在你的公司裡發生,只是主角換成 AI 客服與自動化維運。人力報表一季比一季好看,公司裡卻愈來愈沒有人說得出流程哪裡會斷;出大事那天,沒人看得懂發生什麼事,AI 也給不出答案。
以下是我們常見的組合案例,非單一客戶的真實紀錄:一位老闆導入 AI 客服,九成常規詢問與客訴不再經過人手,客服人力從三人減到一人。半年後,這位留下來的員工已經說不出客戶最常卡在哪一步、哪個流程最容易出錯,因為他不再親手處理。某天金流系統出狀況,AI 客服只會重複道歉,而公司裡沒有任何人能在三十分鐘內判斷問題出在哪一層。
我們自己就把大量重複執行交給 AI 跑,老闆退到把關位置。差別在於,把關的人必須看得懂被把關的東西。護城河在關鍵時刻公司自己扛得住,省下的人力算不進護城河。
三種做法的差異,用表格看最清楚:
| 比較項 | 全部交給 AI,人不介入 | 維持純人工處理 | AI 處理例行,人保留練習 |
|---|---|---|---|
| 眼前人力成本 | 最低 | 最高 | 中等,比純人工省很多 |
| 例行事故處理速度 | 最快 | 慢 | 快,與全自動幾乎相同 |
| 半年後團隊對系統的理解 | 明顯流失 | 維持 | 維持,甚至因演練而提升 |
| 遇到 AI 解不了的重大事故 | 沒人能接手,停擺時間最長 | 有人能處理 | 有人能處理,且有 AI 輔助 |
| 需要老闆投入的紀律 | 幾乎不需要 | 不需要 | 需要,每週與每季固定演練 |
| 適合誰 | 沒有人適合,短期看起來划算 | 系統極小、事故極少的公司 | 絕大多數中小企業 |
第一種做法在報表上最好看,在現實裡最危險。第三種是唯一同時滿足「省人力」與「出事扛得住」的選項,代價是老闆要親自把演練排進制度,而且不能因為半年沒出事就取消。
公司該怎麼做才能既省人力又不失去掌握力?
把航空業的做法縮小到中小企業能執行的規模,三件事就夠:
- 每週一件,人手重走。 AI 處理過的事故或客訴,每週由人抽一件,不看 AI 的答案,自己從頭排查一次,再對照 AI 的處理紀錄。差異就是你的團隊正在流失的知識。
- 每季一次,不靠 AI 演練。 關掉 AI 工具,模擬一場系統當機或重大客訴,指定一個人當指揮,限時處理。不需要買模擬器,一份劇本、一小時、一個計時器就能開始。
- 關鍵系統留一份人看得懂的文件。 AI 每次修改系統或流程,文件要同步更新,而且要由人讀過簽字。AI 產出的修復紀錄如果沒有人讀,等於沒有紀錄。
這三件事都不花錢,花的是紀律。Bainbridge 四十多年前就說了,自動化之後操作者需要更多訓練;多數公司做的剛好相反,把訓練預算跟人力一起省掉。
AI 事故應變與 AI 客服都該用,而且該用得徹底。同時把「有人能在 AI 失靈時接手」當成硬性條件,寫進制度、排進行事曆,本季就排第一次演練,別寄望團隊自己會記得。做到這一點的公司,AI 是槓桿;做不到的公司,AI 是把能力空洞化藏起來的遮布,直到出事那天一次揭開。
如果你想知道自己公司的 AI 自動化到底有沒有留住這道底線,AIRUN 的對抗式創業體檢會用同一把尺替你檢查,詳情在 /aeo。
常見問題
公司用 AI 自動處理系統事故,會不會讓團隊失去解決問題的能力?
會,而且是漸進、不易察覺的流失。日常事故是工程師練習理解系統的主要場合,AI 接手之後這些練習機會就沒了。等到 AI 解不了的複雜事故發生,接手的人手感比以前更生,處理時間反而拉長。解法在保留練習,並非放棄 AI。
AI 事故應變工具(AI SRE)是什麼?
指能自動讀取系統警報、提出假設、查詢監控數據、比對最近的部署紀錄,甚至直接動手修復的 AI 工具。業界常稱它們為「AI SRE」,SRE 是網站可靠性工程師的縮寫。它們最擅長處理半夜的例行事故,例如容量不足,讓工程師不必被叫醒。
什麼是「自動化的諷刺」(Ironies of Automation)?
人因研究者 Lisanne Bainbridge 在 1983 年提出的悖論:自動化拿走操作者練習例行工作的機會,卻把最新、最異常的狀況留給人處理。結論是自動化之後,操作者需要的技能與訓練量反而要比以前更多,而非更少。
中小企業的 AI 客服,跟工程師的 AI 事故應變有什麼關係?
邏輯完全相同。AI 客服接走九成常規客訴後,員工不再親手面對客戶問題,久了就不知道客戶真正卡在哪、流程哪裡會斷。當出現 AI 答不了的重大客訴或系統故障,公司內部沒人看得懂發生什麼事,也沒人有能力接手。
那要不要乾脆不用 AI 處理事故?
不必。原文作者自己就在做 AI 事故應變工具,他的立場是用 AI 處理例行事故,同時用模擬演練保住人的能力。航空業就是這樣做的:自動駕駛負責大部分飛行,機師每六個月回模擬機練罕見故障。省人力與保能力可以並存,前提是老闆要把演練排進制度。
最少要做到哪幾件事,才能避免團隊對系統失去掌握?
三件事:第一,AI 處理過的事故,每週由人抽一件親手重走一遍;第二,每季至少一次不靠 AI 的事故演練,由人擔任指揮;第三,關鍵系統與流程保留一份人看得懂的說明文件,並且隨 AI 的修改同步更新。三件事都不花錢,花的是紀律。
AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)