AIRun · Blog
← 全部文章

你的 AI 自動化是真的在跑,還是在演?

2026-07-31 · J董 👁 107 人看過 🤖 103 AI 爬蟲命中
AI導入自動化AI治理可觀測性中小企業

先給答案。判斷一套 AI 自動化是否真的在運作,看三件事就夠:

  1. 最近一次告警,有沒有讓你實際修了東西? 說得出日期才算。
  2. 有沒有哪個功能是「從來沒響過」的? 你確定它沒事,還是它壞了但沒人知道?
  3. 它的輸出有沒有被消費? 有人看、有人用、有人因此做決定,才叫產出。

這三題全部答得出來的人很少。多數人的儀表板全綠,但綠燈只證明程式還活著,不證明它做的事還有價值。

綠燈的盲區

我們自己把公司交給 AI 運營了一段時間。監控建得不算少:進程看門狗、健康匯流、任務審計、每日值班檢查。四套機制,全部顯示正常。

然後某天做了一次全面盤點,結果是這樣的:

  • 有兩支程式共用同一組憑證,互相搶連線互相踢下線,持續了半個月。日誌被錯誤訊息塞到 8MB。四套監控沒有一套發現。
  • 每個月推出去約 350 則通知,其中約 71% 從來沒讓任何人做過任何事
  • 線上付款成功的通知功能,從上線那天起就沒發出去過——設定漏了一項,程式判斷「沒設定就跳過」,安靜地跳過了幾個月。

三件事的共同點:系統沒有壞掉。 它們在「還活著嗎」這個座標上全是綠燈,因為它們不是故障,是一直很努力地做沒有價值的事。

兩種審計,多數人只做了一種

存活性審計有效性審計
問的問題還活著嗎還值得嗎
檢查對象進程、心跳、錯誤率訊號有沒有導致行動、輸出有沒有被使用
抓得到當機、逾時、例外噪音、重複、名存實亡、靜默失敗
多數人有沒有做幾乎沒有

市面上的監控工具幾乎都在做第一種。它們很成熟、很好裝,也確實有用——但它們的設計目的是回答「壞了沒」。

第二種要你回答的是:這個每天在跑的東西,如果今天關掉,有誰會發現、有什麼會變差?多數自動化經不起這一問。

最貴的失敗:從來沒響過的鈴

一般的故障有個好處:它會停。停了就有人叫,有人叫就有人修。

真正貴的是另一種——一個功能從上線起就沒有正確運作過,而它的失敗形式是「安靜」。

我們那個付款通知就是這樣。程式碼寫得很有禮貌:偵測到設定缺漏,就直接返回、不報錯、不記 log。這在工程上叫「優雅降級」,在實務上叫「沒人會知道」。

要抓這種東西,只有一個辦法:逐條列出所有通知管線,標上「最近一次真的響是什麼時候」。 從沒響過的那條,現在手動觸發一次試試看。

訊噪比:沒導致行動的訊號,不是訊號

一則通知的價值不在於它有沒有發出去,在於它有沒有改變任何人接下來要做的事。

我們量自己的時候用了六個判準,其中三個特別容易抓到問題:

  • 時間集中度:如果超過一半的告警擠在同一個小時,那通常不是世界在那個小時特別容易壞,是你自己有個排程在絆自己人。我們的例子是一支 AI 任務跑 30 分鐘,把整個排程佇列卡住,其他任務全被推遲,監控就依序噴「未動、未動、未動、恢復」——每天四則,全是自己造成的。
  • 抖動:告警之後幾分鐘就自己恢復,配對率很高,代表門檻設得比系統正常波動還緊。
  • 無人理比率:告警發出後六小時內,有沒有任何人做了任何事。我們有兩個來源的數字是 97% 和 100%。

第三個判準最殘酷,因為它把「這個訊號存在的理由」直接量化了。

自動化會活得比它的理由更久

還有一類問題跟故障無關:當初為了某個情況建的東西,那個情況已經不存在了,但東西還在跑。

我們有一支費用告警,門檻被調高到形同關閉,之後好幾週它其實什麼都不會做。沒有任何機制會告訴我們這件事——因為它沒壞,它只是沒用了。

解法很土但有效:每個自動化出生時就帶一個複審日。 到期就問一次「這 90 天它做了什麼、有誰用到」。答不出來就關掉。

三個判準怎麼自己驗

回到開頭那三題,給你具體的驗證動作:

① 告警有沒有導致行動 翻出最近一則告警,找出對應的修復紀錄。找不到就往前翻,一直翻到找得到為止——中間隔了幾週,那幾週的告警就都是噪音。

② 有沒有從來沒響過的鈴 列出所有通知管線,標最近觸發時間。另外掃一次程式碼,找有沒有「關鍵設定沒設就安靜跳過」的寫法。

③ 輸出有沒有被消費 挑一個每天在產出的東西(報表、摘要、掃描結果),問自己最近一次真的打開它是什麼時候。

完整的 18 項自檢

上面三題是入口。我們把踩過的坑整理成六個面向共 18 項自檢:監控有效性、靜默失敗、訊噪比、自動化生命週期、自主性度量、人機閘門。

這份表跟一般檢查清單有一個差別:每題要勾兩次,一次憑印象,一次要附得出證據。

因為只有一欄的清單,人人都會滿分。要求證據之後,落差就出來了——我們自己第一次跑是憑印象 14 項、附證據 6 項。那個落差 8 就是我們當時的盲區,而且是自己量出來的,賴不掉。

開始自檢(18 項,約 10 分鐘)→

全程在你自己的裝置上跑,不需要註冊,資料不會離開你的電腦。

常見問題

問:我的自動化規模很小,需要做到這樣嗎? 規模小反而更該做,因為小規模通常沒有專責的人盯。三個人的公司跟三百人的公司,差別在於前者沒有人會「剛好發現」異常。

問:分數低代表我做錯了嗎? 分數低通常代表你還在早期,這很正常。真正要注意的是兩欄的落差——落差大代表你對自己系統的認知跟實況脫節,那比分數低危險,因為你會在錯誤的基礎上做決策。

問:這些檢查要花多少時間? 自檢本身約 10 分鐘。但如果你認真去驗證每一項的證據,大概要一到兩個工作天——而且過程中你就會修掉幾個東西。

問:AI 自動化跟一般自動化的檢查標準一樣嗎? 大部分一樣,但 AI 多了兩個風險:它會「錯得很有自信」,所以輸出要能被驗證;它的成本會隨用量浮動,所以要有預算熔斷。這兩點在 18 項裡各有對應。