你的 AI 自動化是真的在跑,還是在演?
先給答案。判斷一套 AI 自動化是否真的在運作,看三件事就夠:
- 最近一次告警,有沒有讓你實際修了東西? 說得出日期才算。
- 有沒有哪個功能是「從來沒響過」的? 你確定它沒事,還是它壞了但沒人知道?
- 它的輸出有沒有被消費? 有人看、有人用、有人因此做決定,才叫產出。
這三題全部答得出來的人很少。多數人的儀表板全綠,但綠燈只證明程式還活著,不證明它做的事還有價值。
綠燈的盲區
我們自己把公司交給 AI 運營了一段時間。監控建得不算少:進程看門狗、健康匯流、任務審計、每日值班檢查。四套機制,全部顯示正常。
然後某天做了一次全面盤點,結果是這樣的:
- 有兩支程式共用同一組憑證,互相搶連線互相踢下線,持續了半個月。日誌被錯誤訊息塞到 8MB。四套監控沒有一套發現。
- 每個月推出去約 350 則通知,其中約 71% 從來沒讓任何人做過任何事。
- 線上付款成功的通知功能,從上線那天起就沒發出去過——設定漏了一項,程式判斷「沒設定就跳過」,安靜地跳過了幾個月。
三件事的共同點:系統沒有壞掉。 它們在「還活著嗎」這個座標上全是綠燈,因為它們不是故障,是一直很努力地做沒有價值的事。
兩種審計,多數人只做了一種
| 存活性審計 | 有效性審計 | |
|---|---|---|
| 問的問題 | 還活著嗎 | 還值得嗎 |
| 檢查對象 | 進程、心跳、錯誤率 | 訊號有沒有導致行動、輸出有沒有被使用 |
| 抓得到 | 當機、逾時、例外 | 噪音、重複、名存實亡、靜默失敗 |
| 多數人有沒有做 | 有 | 幾乎沒有 |
市面上的監控工具幾乎都在做第一種。它們很成熟、很好裝,也確實有用——但它們的設計目的是回答「壞了沒」。
第二種要你回答的是:這個每天在跑的東西,如果今天關掉,有誰會發現、有什麼會變差?多數自動化經不起這一問。
最貴的失敗:從來沒響過的鈴
一般的故障有個好處:它會停。停了就有人叫,有人叫就有人修。
真正貴的是另一種——一個功能從上線起就沒有正確運作過,而它的失敗形式是「安靜」。
我們那個付款通知就是這樣。程式碼寫得很有禮貌:偵測到設定缺漏,就直接返回、不報錯、不記 log。這在工程上叫「優雅降級」,在實務上叫「沒人會知道」。
要抓這種東西,只有一個辦法:逐條列出所有通知管線,標上「最近一次真的響是什麼時候」。 從沒響過的那條,現在手動觸發一次試試看。
訊噪比:沒導致行動的訊號,不是訊號
一則通知的價值不在於它有沒有發出去,在於它有沒有改變任何人接下來要做的事。
我們量自己的時候用了六個判準,其中三個特別容易抓到問題:
- 時間集中度:如果超過一半的告警擠在同一個小時,那通常不是世界在那個小時特別容易壞,是你自己有個排程在絆自己人。我們的例子是一支 AI 任務跑 30 分鐘,把整個排程佇列卡住,其他任務全被推遲,監控就依序噴「未動、未動、未動、恢復」——每天四則,全是自己造成的。
- 抖動:告警之後幾分鐘就自己恢復,配對率很高,代表門檻設得比系統正常波動還緊。
- 無人理比率:告警發出後六小時內,有沒有任何人做了任何事。我們有兩個來源的數字是 97% 和 100%。
第三個判準最殘酷,因為它把「這個訊號存在的理由」直接量化了。
自動化會活得比它的理由更久
還有一類問題跟故障無關:當初為了某個情況建的東西,那個情況已經不存在了,但東西還在跑。
我們有一支費用告警,門檻被調高到形同關閉,之後好幾週它其實什麼都不會做。沒有任何機制會告訴我們這件事——因為它沒壞,它只是沒用了。
解法很土但有效:每個自動化出生時就帶一個複審日。 到期就問一次「這 90 天它做了什麼、有誰用到」。答不出來就關掉。
三個判準怎麼自己驗
回到開頭那三題,給你具體的驗證動作:
① 告警有沒有導致行動 翻出最近一則告警,找出對應的修復紀錄。找不到就往前翻,一直翻到找得到為止——中間隔了幾週,那幾週的告警就都是噪音。
② 有沒有從來沒響過的鈴 列出所有通知管線,標最近觸發時間。另外掃一次程式碼,找有沒有「關鍵設定沒設就安靜跳過」的寫法。
③ 輸出有沒有被消費 挑一個每天在產出的東西(報表、摘要、掃描結果),問自己最近一次真的打開它是什麼時候。
完整的 18 項自檢
上面三題是入口。我們把踩過的坑整理成六個面向共 18 項自檢:監控有效性、靜默失敗、訊噪比、自動化生命週期、自主性度量、人機閘門。
這份表跟一般檢查清單有一個差別:每題要勾兩次,一次憑印象,一次要附得出證據。
因為只有一欄的清單,人人都會滿分。要求證據之後,落差就出來了——我們自己第一次跑是憑印象 14 項、附證據 6 項。那個落差 8 就是我們當時的盲區,而且是自己量出來的,賴不掉。
全程在你自己的裝置上跑,不需要註冊,資料不會離開你的電腦。
常見問題
問:我的自動化規模很小,需要做到這樣嗎? 規模小反而更該做,因為小規模通常沒有專責的人盯。三個人的公司跟三百人的公司,差別在於前者沒有人會「剛好發現」異常。
問:分數低代表我做錯了嗎? 分數低通常代表你還在早期,這很正常。真正要注意的是兩欄的落差——落差大代表你對自己系統的認知跟實況脫節,那比分數低危險,因為你會在錯誤的基礎上做決策。
問:這些檢查要花多少時間? 自檢本身約 10 分鐘。但如果你認真去驗證每一項的證據,大概要一到兩個工作天——而且過程中你就會修掉幾個東西。
問:AI 自動化跟一般自動化的檢查標準一樣嗎? 大部分一樣,但 AI 多了兩個風險:它會「錯得很有自信」,所以輸出要能被驗證;它的成本會隨用量浮動,所以要有預算熔斷。這兩點在 18 項裡各有對應。