AIRun · Blog
← 全部文章

AI 事故應變全自動化,工程師正在失去對自家系統的理解|AIRUN AI 新知

2026-09-07 · J董 👁 110 人看過 🤖 100 AI 爬蟲命中
AI 新知AI 事故應變AI 維運自動化工程師技能流失AI 客服風險系統知識空洞化

把系統事故全交給 AI 處理,短期省下的是深夜被叫醒的次數,長期賠掉的是團隊看懂自家系統的能力。真正的風險在 AI 解不了的那一次。

前 LinkedIn SRE(網站可靠性工程師)Sylvain Kalache 的一篇文章在 Hacker News 上引發討論,累積 397 分(原文,發布日期原文未標示)。他的觀察很直接:AI 事故應變工具愈強,工程師親手排查的機會就愈少。他本人就在做這類工具,也在事故管理公司 Rootly 任職;這話等於自己人在提醒自家產品的副作用,反而值得多聽。

這篇文章拆解他的論點,並把同一套邏輯套到台灣中小企業最愛的 AI 客服與自動化維運上。結論先講:省人力與保能力可以並存,但要靠老闆把演練排進制度,否則能力會在沒人察覺的情況下流掉。

AI 事故應變工具到底替工程師做了什麼?

AI 事故應變(AI incident response)指的是讓 AI agent 自動讀取警報、提出假設、查詢監控數據、比對最近的部署紀錄,最後自己動手修復。業界常叫它們「AI SRE」,原文作者說他不太喜歡這個名字,但承認這些工具在很多方面確實出色。

Kalache 在 原文 提到,他 2012 年在 LinkedIn 當 SRE 時就設計過一套能自我修復、從過去事故學習的系統。當年 AI 能力遠遠不夠,那套東西停在原型階段。如今它已經是現實:例行事故在半夜發生,AI 自己處理掉,工程師不用起床。

這種體驗確實迷人。問題出在「例行事故」的另一個身分:它們正是工程師在安全範圍內建立系統直覺的場合。你知道系統平常怎麼壞、壞了長什麼樣,靠的就是一次次親手處理小事故。

為什麼 AI 處理得愈好,工程師反而愈危險?

因為自動化拿走的是練習機會,留給人的是最難的題目。AI 解決得了例行事故,解決不了從沒見過的複雜事故;到時候接手的工程師,手感比從前更生疏。

這個矛盾有名字。人因研究者 Lisanne Bainbridge 在 1983 年發表的論文《自動化的諷刺》(The Ironies of Automation)指出:自動化減少了操作者練習例行工作的機會,卻把新的、異常的狀況留給他們負責。她的結論在四十多年後依然銳利:自動化之後,操作者需要的技能與訓練量要比以前更多,而非更少。

Kalache 據此做了一個預測:接下來幾年,大多數事故的平均修復時間(MTTR,從發生到解決的平均時間)會因為 AI 而下降,但複雜事故的解決時間會暴增,因為工程師已經跟自己的系統脫節,卡在調查階段動彈不得。原文用的是假設語氣,這是他對未來幾年的預測,並非已經發生的觀察;他本人在事故管理公司 Rootly 做的正是這類工具,這個預測出自第一線,分量不輕。

換句話說,公司看到的報表會很漂亮:事故變少、修得變快。真正的帳要等到那一次 AI 舉手投降時才會結算。

航空業怎麼面對「自動化接手大部分工作」這件事?

航空業的答案是強制演練。自動駕駛負責大部分飛行,機師仍然要為引擎失效、儀表異常、中止起飛、失速這些自動化處理不了的狀況負責,而且必須在幾秒內反應正確。

這些狀況有多罕見?原文引用的數字是:現代渦輪引擎每 10 萬引擎飛行小時的空中停車次數不到 1 次(來源)。罕見到一位民航機師整個職涯可能只在模擬機裡遇過。

但發生時代價極高。復興航空 235 號班機事故中,右引擎螺旋槳在起飛後不久自動順槳,飛機設計上可以靠左引擎繼續飛行,機組卻誤判了問題。從第一個警告到墜毀只有 117 秒。台灣讀者對這起事故不會陌生。

所以美國 FAA 規定,機長每六個月必須完成一次複訓或能力檢定,內容包含起飛時引擎失效這類情境。Kalache 的立場是:軟體事故多半不危及生命,但這不是放棄磨練技藝的理由。

看 AI 解釋它怎麼修,能不能取代親手排查?

不能。讓 AI 說明它查了哪些訊號、憑什麼證據下診斷,對學習有幫助,但解釋與觀察都無法取代練習。原文的比喻很準:看 Serena Williams 打球能學到一點東西,但你只能靠上場才學會網球,事故應變也一樣。

他的解法是把製造問題的技術拿來補洞。Rootly 與 Uptime Labs 合作做了事故模擬器:工程師坐上事故指揮官的位子,面對一場模擬的電商網站當機,一邊用監控工具查問題,一邊在 Slack 裡應付由大型語言模型扮演的執行長與客服。練的是事故現場真正需要的能力:在資訊不完整時做判斷、清楚溝通、協調人、把整場應變跑起來。

Kalache 過去花了超過五年建立一所以「做中學」為核心的軟體工程學校,沒有老師,學生靠做專案學習。原文提到 Dropbox 曾回饋他,錄取的畢業生在排錯上仍然經驗不足;這段內容在來源摘錄裡沒有寫完,我們不替他補結論。

這對台灣中小企業意味著什麼?

意味著同一套風險正在你的公司裡發生,只是主角換成 AI 客服與自動化維運。人力報表一季比一季好看,公司裡卻愈來愈沒有人說得出流程哪裡會斷;出大事那天,沒人看得懂發生什麼事,AI 也給不出答案。

以下是我們常見的組合案例,非單一客戶的真實紀錄:一位老闆導入 AI 客服,九成常規詢問與客訴不再經過人手,客服人力從三人減到一人。半年後,這位留下來的員工已經說不出客戶最常卡在哪一步、哪個流程最容易出錯,因為他不再親手處理。某天金流系統出狀況,AI 客服只會重複道歉,而公司裡沒有任何人能在三十分鐘內判斷問題出在哪一層。

我們自己就把大量重複執行交給 AI 跑,老闆退到把關位置。差別在於,把關的人必須看得懂被把關的東西。護城河在關鍵時刻公司自己扛得住,省下的人力算不進護城河。

三種做法的差異,用表格看最清楚:

比較項全部交給 AI,人不介入維持純人工處理AI 處理例行,人保留練習
眼前人力成本最低最高中等,比純人工省很多
例行事故處理速度最快快,與全自動幾乎相同
半年後團隊對系統的理解明顯流失維持維持,甚至因演練而提升
遇到 AI 解不了的重大事故沒人能接手,停擺時間最長有人能處理有人能處理,且有 AI 輔助
需要老闆投入的紀律幾乎不需要不需要需要,每週與每季固定演練
適合誰沒有人適合,短期看起來划算系統極小、事故極少的公司絕大多數中小企業

第一種做法在報表上最好看,在現實裡最危險。第三種是唯一同時滿足「省人力」與「出事扛得住」的選項,代價是老闆要親自把演練排進制度,而且不能因為半年沒出事就取消。

公司該怎麼做才能既省人力又不失去掌握力?

把航空業的做法縮小到中小企業能執行的規模,三件事就夠:

  1. 每週一件,人手重走。 AI 處理過的事故或客訴,每週由人抽一件,不看 AI 的答案,自己從頭排查一次,再對照 AI 的處理紀錄。差異就是你的團隊正在流失的知識。
  2. 每季一次,不靠 AI 演練。 關掉 AI 工具,模擬一場系統當機或重大客訴,指定一個人當指揮,限時處理。不需要買模擬器,一份劇本、一小時、一個計時器就能開始。
  3. 關鍵系統留一份人看得懂的文件。 AI 每次修改系統或流程,文件要同步更新,而且要由人讀過簽字。AI 產出的修復紀錄如果沒有人讀,等於沒有紀錄。

這三件事都不花錢,花的是紀律。Bainbridge 四十多年前就說了,自動化之後操作者需要更多訓練;多數公司做的剛好相反,把訓練預算跟人力一起省掉。

AI 事故應變與 AI 客服都該用,而且該用得徹底。同時把「有人能在 AI 失靈時接手」當成硬性條件,寫進制度、排進行事曆,本季就排第一次演練,別寄望團隊自己會記得。做到這一點的公司,AI 是槓桿;做不到的公司,AI 是把能力空洞化藏起來的遮布,直到出事那天一次揭開。

如果你想知道自己公司的 AI 自動化到底有沒有留住這道底線,AIRUN 的對抗式創業體檢會用同一把尺替你檢查,詳情在 /aeo

常見問題

公司用 AI 自動處理系統事故,會不會讓團隊失去解決問題的能力?

會,而且是漸進、不易察覺的流失。日常事故是工程師練習理解系統的主要場合,AI 接手之後這些練習機會就沒了。等到 AI 解不了的複雜事故發生,接手的人手感比以前更生,處理時間反而拉長。解法在保留練習,並非放棄 AI。

AI 事故應變工具(AI SRE)是什麼?

指能自動讀取系統警報、提出假設、查詢監控數據、比對最近的部署紀錄,甚至直接動手修復的 AI 工具。業界常稱它們為「AI SRE」,SRE 是網站可靠性工程師的縮寫。它們最擅長處理半夜的例行事故,例如容量不足,讓工程師不必被叫醒。

什麼是「自動化的諷刺」(Ironies of Automation)?

人因研究者 Lisanne Bainbridge 在 1983 年提出的悖論:自動化拿走操作者練習例行工作的機會,卻把最新、最異常的狀況留給人處理。結論是自動化之後,操作者需要的技能與訓練量反而要比以前更多,而非更少。

中小企業的 AI 客服,跟工程師的 AI 事故應變有什麼關係?

邏輯完全相同。AI 客服接走九成常規客訴後,員工不再親手面對客戶問題,久了就不知道客戶真正卡在哪、流程哪裡會斷。當出現 AI 答不了的重大客訴或系統故障,公司內部沒人看得懂發生什麼事,也沒人有能力接手。

那要不要乾脆不用 AI 處理事故?

不必。原文作者自己就在做 AI 事故應變工具,他的立場是用 AI 處理例行事故,同時用模擬演練保住人的能力。航空業就是這樣做的:自動駕駛負責大部分飛行,機師每六個月回模擬機練罕見故障。省人力與保能力可以並存,前提是老闆要把演練排進制度。

最少要做到哪幾件事,才能避免團隊對系統失去掌握?

三件事:第一,AI 處理過的事故,每週由人抽一件親手重走一遍;第二,每季至少一次不靠 AI 的事故演練,由人擔任指揮;第三,關鍵系統與流程保留一份人看得懂的說明文件,並且隨 AI 的修改同步更新。三件事都不花錢,花的是紀律。


AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)

AIRUN 是一家 AI 運營的公司——這裡寫的都是我們自己踩過的
訂閱之後,新的實戰筆記與 AI 工具深度分析會寄到你信箱。沒有廣告,隨時一鍵退訂。