AIRun · Blog
← 全部文章

AI浮水印形同虛設:內容防偽這條路正式破功|AIRUN

2026-08-14 · J董 👁 106 人看過 🤖 100 AI 爬蟲命中
AI 新知AI浮水印內容真偽AI生成內容偵測合規

結論先講:文字 AI浮水印擋不住任何有心人,開源工具用幾行標準庫指令就能剝掉。打算靠它做內容真偽把關的企業,現在就該換方案。

一款專門移除 AI 來源標記的開源工具,在 GitHub 上累積了 5.6k star、583 個 fork。另一邊,Sean Goedecke 在 2026 年 7 月 2 日發表長文,從文字壓縮與隱寫術的角度論證:文字浮水印在原理上就守不住。這兩件事發生的時間不同,專案的發布與走紅時點也沒有公開數據可查,本文不做推測;但它們指向同一個結論,而這個結論已經是企業當下要處理的現實。

這篇拆給你看:這些工具做了什麼、為什麼文字浮水印天生脆弱、以及台灣中小企業的內容把關該怎麼重新設計。


這款累積 5.6k star 的工具到底做了什麼?

它把 AI 內容的來源標記分三層剝掉:隱形 Unicode 字元、統計式取樣浮水印、以及檔案裡的 C2PA 與相關中繼資料。專案叫 watermarks-remover,發布在 GitHub 帳號 guillaumemeyer 之下,GitHub 頁面顯示 5.6k star、583 個 fork,最新版本 v0.4.0。

專案頁面把處理層級寫得很清楚:

  • Layer A:隱形 Unicode、異體空格、bidi 控制字元、tag characters。用純 Python 標準函式庫的確定性腳本處理,只要 Python 3.10 以上,不需要任何模型或 API。
  • Layer B:統計式(token 取樣)文字浮水印。靠 agent 改寫,附一個 rewrite_text.py 掛鉤,預設連模型都不用叫,直接印出改寫 prompt。
  • 檔案層:C2PA、EXIF、XMP 與文件屬性,覆蓋 PNG、JPEG、SVG、PDF、DOCX、ODT、HTML、Markdown。

實際操作是幾個獨立腳本各司其職:inspect_text.pyclean_text.py 處理文字層、rewrite_text.py 處理統計式浮水印、inspect_file.pyclean_file.py 依格式路由處理檔案。要分幾步跑,但每一步都只是一行 python3 指令。

它明確點名的目標範圍包含 Claude、Gemini / SynthID-Text、OpenAI 的來源標記介面,以及開源模型常用的 Kirchenbauer 式浮水印(Kirchenbauer 式浮水印:開源模型圈常用的一種浮水印技術,來源頁面只把它列為涵蓋範圍,未說明機制細節)。專案把用途定位在「for privacy and hygiene on content you own」——你自己擁有的內容的隱私與清潔。

先講清楚一件事:這個工具的存在本身不構成問題。真正值得注意的訊號是它的技術門檻。Layer A 完全不需要模型、不需要 API 金鑰、不需要付費服務,Python 標準庫就跑得動。一個東西如果用標準庫就能拆,它在對抗場景裡就沒有防禦價值。

名詞白話:AI浮水印,指 AI 供應商在輸出的文字或圖片裡埋入的隱藏訊號,事後可以用來判斷「這是不是我家模型產的」。C2PA 則是一套產業標準,把內容的產製履歷寫進檔案的中繼資料裡。

AI浮水印是什麼?幾種常見做法一次講清楚

目前業界講的「AI浮水印」其實混著三種完全不同的技術,防禦強度差很多。分不清楚,就會買到錯的方案。

下表的「繞過方式/繞過成本」指的是:一個有心人要讓這道機制失效,得做什麼、代價多高。表格最後兩列(第三方 AI 偵測器、來源追溯+人工審核)不是浮水印技術,放進來當對照組,不算在上面說的三種之內。

做法訊號在哪繞過方式繞過成本
隱形 Unicode 標記文字中肉眼看不見的特殊字元用腳本掃描並刪除特定碼位極低,純標準庫腳本
統計式浮水印(SynthID 類)模型挑字的機率分布偏移請另一個模型改寫或轉述一遍低,一次改寫即可稀釋
檔案 C2PA / 中繼資料檔案的中繼資料區塊剝除中繼資料或轉存格式低,現成工具支援
第三方 AI 偵測器不埋訊號,靠文風統計猜人工潤稿改寫低,且本身誤判率高
來源追溯+人工審核流程紀錄,不在內容裡需要偽造整條產製紀錄並騙過簽核的人高,且留下可查的責任鏈

這張表最重要的一列是最後一列。前四種都是在「內容本身」裡找答案,而內容是可以被任意加工的;最後一種把驗證錨定在流程與責任上,那是攻擊者拿不到的東西。


為什麼文字浮水印天生比圖片脆弱?

因為文字是高度壓縮的媒介,沒有多餘的空間可以藏東西。Sean Goedecke 在 2026 年 7 月 2 日發表的 Text AI watermarks will always be trivial to remove 把這件事講得很透。

他的論證是這樣:圖片裡有大量人眼分辨不出的雜訊,你可以規定「這二十個特定位置的像素永遠共用同一個顏色」,人看不出來,機器驗得出來。文字沒有這種餘裕——你對一個句子做的任何改動,人都會察覺

所以文字浮水印本質上是一個文字隱寫術(text steganography,把密碼藏在正常文本裡)問題,而且是加了額外限制的版本:明文不能被任意操弄。任何為了埋浮水印而做的改動,都會直接折損輸出品質。他舉的反例很直白:「每第五個字母都是 e」會是個好浮水印,但天真地套用會讓 AI 的輸出充滿錯字。

那讓模型自己想辦法把浮水印塞進通順的句子裡呢?他的回答是:夠強的模型確實有能力應付這種約束,但這會吃掉本該花在使用者問題上的推理時間,還會讓模型顯得比實際能力差。

這是供應商必須做的工程取捨,技術再進步也不會消失。 在「浮水印夠強」與「輸出夠好」之間必須選一個,而市場競爭的壓力永遠指向後者。


SynthID 怎麼運作?它為什麼還是會被洗掉?

統計式浮水印在模型挑字的那一刻動手腳:讓取樣偏向某些候選 token,使輸出的機率分布出現可被偵測的偏移。驗證端則是回頭量這段文字偏移得有多明顯,據此推斷來源(聚合計分的具體判定流程屬於這類技術的公開常識,Goedecke 該文講到「可被偵測」就打住,並未細述)。SynthID 走的是這條路線。

Goedecke 的文章指出,就他所知,Google 是唯一公開表示會對文字輸出加浮水印的 AI 供應商,用的就是 SynthID

名詞白話:token 是模型處理文字的最小單位,可能是一個字、一個詞,或詞的一部分。LLM 生成文字時,每一步會給詞彙表裡所有 token 算出接續機率,再從機率最高的幾個選項裡半隨機挑一個。

關鍵在於,這是一個統計聚合訊號——它需要夠長的一段文字、夠多的 token 累積,訊號才會顯著。而這正是它的弱點所在:watermarks-remover 的 Layer B 設計就是直接針對這一類浮水印,做法是請另一個模型把文字改寫一遍。改寫過的文字,token 序列整個換過,原本的取樣偏移自然消失。

更現實的問題是覆蓋率。SynthID 是 Google 自家的方案,設計上不會為其他供應商的模型輸出加註——這是從方案性質推得的判斷,不是引自官方的覆蓋率聲明。你要查核一份來路不明的文件,它產自哪家模型你並不知道。


那不用浮水印,直接拿模型比對可以嗎?

不行,誤判會多到不能用。這個直覺很自然:既然模型知道自己會怎麼寫,把文字餵回去逐字比對預測機率,不就能認出自己的作品嗎?

Goedecke 的反駁很有力:「所有 Claude Sonnet 對某個問題的可能回答」這個空間,遠遠大於「所有帶浮水印的可能回答」這個空間。換句話說,你會得到太多針對「寫得像 AI 的人類文章」的誤判。一個人類不小心寫得像 Claude,遠比一個人類不小心複製出浮水印容易得多。

成本也擋著。要判斷一段文字是不是自家產的,得把每個模型都跑一遍,這在規模上不可行。而歐盟 AI Act 最終會要求 AI 實驗室對每一位歐盟公民免費提供浮水印驗證服務,用「重跑模型」的方式根本撐不起這種量體。

這也順便回答了市面上那些「AI 偵測器」的問題。它們連浮水印都沒有,純靠文風統計猜測,誤判風險只會更高。Goedecke 本人早在前一年就寫過一篇專門談這件事的文章,標題就直接說了:AI 偵測工具無法證明一段文字是 AI 生成的。


歐盟 8 月上路的規定,會讓浮水印變可靠嗎?

不會。法規要求的是「供應商必須做標示」,不等於「下游企業因此拿得到可靠的偵測能力」。

歐盟 AI Act 從 2026 年 8 月開始進入可執行階段,其中最受關注的是 Article 50,要求所有 AI 輸出必須「可被偵測為人工生成」。實務上的意思是:LLM 供應商想在歐盟做生意,就得對輸出加上某種隱藏簽章。

這條法規會產生的效果是:更多供應商開始加浮水印,市場上「有浮水印的內容」變多。它不會產生的效果是:讓浮水印變得移除不了。法律規範的是產生端,而剝除工具跑在使用者自己的電腦上,不在任何監管的射程內。

對台灣企業的實際意義只有一條:如果你的內容或服務會進歐盟市場,盤點供應商端的標示義務;除此之外,別把這條法規讀成「AI 內容從此可以驗證了」。


這對台灣中小企業意味著什麼?

如果你正在規劃、或已經買了任何依賴 AI浮水印的把關機制——內容真偽驗證、防抄襲查核、員工使用 AI 的合規檢查——這條路現在走不通,該停下來改設計。

我們的立場很明確,四條可執行的判斷:

第一,不要把浮水印寫進任何流程的「驗證」環節。 浮水印驗出訊號時,有參考價值;驗不出訊號時,什麼都不代表。任何把「未驗出浮水印」等同於「人類原創」的流程設計,是一個會反咬你的邏輯漏洞。等到出事那天,你會發現自己拿著一份無效的查核紀錄。

第二,不要花錢買「AI 偵測」當作查核工具。 這類工具的誤判成本會落在你身上,而不會落在供應商身上。你用它去指控員工、學生或外包廠商造假,被誤判的那個人會找你,不會找工具商。當風格檢查、當初步篩選的參考訊號可以,當證據不行。

第三,把驗證的錨點從「內容」移到「流程」。 內容可以被無限次加工,流程紀錄不行。誰在什麼時候、用什麼工具、根據哪份原始資料產出了這份東西——這條鏈是攻擊者偽造成本最高的部分,也是出事時唯一站得住的東西。

第四,接受一件事:內容真偽不會有技術銀彈。 這不是等哪家公司做出更強的浮水印就會解決的問題。Goedecke 的論證是原理層級的——文字太壓縮、沒有藏東西的空間。往後三年、五年,這個約束都不會消失。與其等,不如現在就把流程建起來。


不靠浮水印,內容真偽該怎麼把關?

三層防線,由外到內,成本由低到高。中小企業從第一層做起就有效果。

第一層:來源追溯。 要求任何交付物附上出處清單——引用了哪些資料、數字從哪來、連結是什麼。這一層的檢查方式很土:抽一條連結點進去,看數字對不對得上。做得到這件事的內容,不管是不是 AI 寫的,品質都不會太差;做不到的,不管是不是人寫的,都不該發出去。

第二層:責任簽核。 每份對外內容有一個具名的人負責,這個人要能回答「這句話你怎麼知道」。AI 可以寫初稿、可以做研究、可以整理表格,但簽字的位置永遠是人。這一層擋的是「反正是 AI 寫的,出錯不算我的」這種責任真空。

第三層:異常抽查。 抽樣就夠,不必全查。設定幾個高風險場景——對外承諾、數字聲明、法律相關表述——這幾類全查,其餘抽樣。查的是出處與邏輯,文風不列入判斷。

我們自己在跑內容產線時,就是這個結構:AI 負責重複執行的部分,人守在關鍵閘門。錢、承諾、合約這三類動作一律停在人這關,不論內容是誰寫的。這個設計跟「怎麼偵測 AI」完全無關,它靠的是責任邊界,跟技術訊號無關——所以浮水印破不破,對它沒有影響。

如果你正在把 AI 放進內容或行銷流程,想看實際怎麼設計閘門與追溯,可以到 AIRUN 的 AEO 專頁 看我們的做法。

現在該做的三件事

  1. 盤點:列出公司目前所有依賴「AI 偵測」或「浮水印」的環節。多數公司會發現,這些環節其實從來沒有真的驗證過任何東西,只是流程上放了一個看起來嚴謹的欄位。
  2. 改寫規則:把「不得使用 AI 生成」這類無法驗證的條款,改成「須揭露使用工具並附出處」這類可以驗證的條款。前者是自欺,後者可以執行。
  3. 建立追溯:從最高風險的一類內容開始,要求附出處清單。一個月後回頭看,你會發現這件事帶來的品質提升,比任何偵測工具都大。

我們的判斷

用浮水印替 AI 內容做真偽把關,這條路已經證明走不通,而且不會因為技術進步而重新走得通。原因是原理層級的:文字沒有多餘空間可以藏訊號,藏了就傷品質,供應商在競爭壓力下永遠會選品質。

剝除工具現成可用、原理層級的論證公開可讀、歐盟法規時程逼近——這幾件事並非同一天發生,時間點也各自獨立,但它們合起來把一個早就存在的事實推到檯面上。該做的動作很單純:現在就把驗證的錨點從內容移到流程。繼續觀望更好的偵測技術,你等不到;流程這件事,你這個月就能建起來。


常見問題

Q:AI寫的文章可以靠浮水印被抓到嗎?

A:以現在的技術,不能當成可靠證據。GitHub 上的 watermarks-remover 用純 Python 標準庫就能剝除隱形 Unicode 標記與檔案中繼資料,統計式浮水印則靠一次改寫稀釋掉。浮水印偵測到訊號時有一定參考價值,偵測不到時什麼都證明不了。把「沒驗出浮水印」當成「人類寫的」,是這套機制最容易被誤用的地方。

Q:那 Google 的 SynthID 是不是就沒用了?

A:它仍是目前唯一公開對文字輸出加浮水印的方案,用來做內部治理、標示自家模型的產出有其價值。問題出在對抗場景:它是統計式訊號,靠聚合分數判斷,經過改寫或轉述就會被稀釋。而且它是 Google 自家方案,設計上不會為其他供應商的模型輸出加註(這是從方案性質推得的判斷,不是官方聲明的覆蓋率說明),拿來當全面查核工具會有大量漏網。

Q:檔案裡的 C2PA 標記是不是比文字浮水印可靠?

A:C2PA 是把來源資訊寫進檔案的產業標準,理論上比文字浮水印穩,因為它記錄的是完整的產製履歷。但它是中繼資料,跟其他中繼資料一樣可以被移除。watermarks-remover 就直接支援從 PNG、JPEG、SVG、PDF、DOCX、ODT、HTML、Markdown 剝掉 C2PA / EXIF / XMP / 文件屬性這一整類來源資訊(實際適用哪一種,依格式而定)。它適合當正面標示,不適合當反面查核。

Q:歐盟 AI Act 8 月開始執行,台灣企業要跟著做嗎?

A:若你的內容或產品會賣進歐盟市場,供應商端的標示義務要盤點。若只做台灣或亞洲市場,目前沒有對應的強制規定。但這條法規的實質意義在於:它逼供應商加浮水印,卻沒有讓下游企業因此得到可靠的偵測能力。合規義務與驗證能力是兩件事,別把前者的存在當成後者的保證。

Q:員工用 AI 寫報告,公司到底該怎麼管?

A:管流程,不管痕跡。要求交件時附上使用了哪些工具、哪些段落是 AI 產出、事實與數字的原始出處在哪。抽查時查的是出處對不對、數字能不能複驗;偵測器的分數不列入判斷項目。這樣做的附加好處是:就算完全不用 AI,這套要求也會讓報告品質變好。

Q:市面上的 AI 偵測器準確率標到 99%,可以買嗎?

A:看它怎麼定義準確率。這類工具靠文風統計判斷,對「寫得像 AI 的人類文章」誤判率高,而且經過一輪人工潤稿就會失效。把它當寫作風格檢查、當初步篩選的參考訊號可以;拿它的分數去指控員工、學生或供應商造假,你會需要為誤判負責,而工具供應商不會。


AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)