跳到主要內容

Claude 文字浮水印計畫公開:校稿也可能留痕,但不是作者證明(2026)

最後更新: ·
Claude 文字浮水印:放大鏡檢視文件中不可察覺標記的編輯插畫

2026 年 8 月 10 日,Anthropic 在 Claude Help Center 更新了〈How Claude marks AI-generated content〉,具體說明 Claude 文字浮水印與檔案標記方案:支援的新模型會把不可察覺的嵌入式浮水印編入文字,支援的 PNG、JPG、SVG 等檔案則會加入 C2PA 簽章 metadata。最重要的限制也寫在同一頁:這不等於「所有 Claude 輸出現在都已加上浮水印」,更不等於檢出標記就能證明 Claude 是作者。

真正值得在意的,不是 Claude 多了一項模型能力,而是學校、出版社與企業即將面對一種新的來源訊號:它可能在誠實使用者只做校稿時留下痕跡,也可能在有意規避者改寫、翻譯後變得難以檢出。問題因此從「能不能標記 AI 文字」,轉成「誰有資格解讀這個訊號,以及它能不能被拿來裁決一個人」。

Claude 文字浮水印官方說明頁,顯示支援模型的文字會嵌入不可察覺標記
Anthropic 的 Claude 內容標記說明頁(2026 年 8 月 10 日更新)。圖/Anthropic Claude Help Center

Claude 文字浮水印先釐清:這不是全面上線宣告

官方用詞始終是「支援的 Claude 模型」。2026 年 8 月 2 日起在歐盟推出的新模型,會在推出時支援內容標記;在此之前推出的模型,Anthropic 表示仍在逐步加入支援。Anthropic 也列在歐盟AI 生成內容透明度實務守則 Section 1 簽署者名單,因此這份說明更準確的定位,是落實透明度承諾的計畫,而不是全模型部署完成公告。頁面沒有列出具名模型、版本清單或完成日期,因此我們目前不能從公開資訊推論常用的每一個 Claude 模型都已經帶有標記。

只要模型支援,文字浮水印會涵蓋 Claude Platform(API)、Claude、Claude Code、Claude Cowork、Claude Tag,也會套用於透過 AWS、Google Cloud 或 Microsoft Foundry 存取的支援模型,且不限歐盟;但簽章 provenance metadata 未必在每個雲端平台可用,其他平台、功能與檔案類型也可能有例外。這個 8 月 2 日分界與歐盟 AI Act 第 50 條的適用時程有關,不是替所有歷史輸出補標記的全球開關。

“When a supported Claude model generates text, it weaves an imperceptible watermark directly into the text itself.”

中文:「當支援的 Claude 模型生成文字時,它會把無法察覺的浮水印直接編入文字本身。」

Anthropic,Claude Help Center

這段話只確認標記存在於文字本身、會隨複製貼上而移動。它沒有透露標記演算法,也沒有說明最短可檢字數、偵測門檻、不同語言的準確率、誤判率或漏判率。Anthropic 只說偵測與技術細節將另行公布;官方頁目前沒有提供可讓一般讀者自行驗證 Claude 文字的方法。

文字浮水印與 C2PA,其實是兩種不同的來源訊號

標記方式跟著什麼走檢出時能說什麼檢不出時不能說什麼
文字嵌入式浮水印文字內容本身,複製貼上後可能保留內容可能曾由支援的 Claude 模型處理不能排除舊模型、短文、重度編輯、改寫、翻譯或混合內容
C2PA 簽章 metadata支援檔案的來源與處理紀錄檔案可能曾由 Claude 處理,並可驗證簽章與簽章後的變更不能因 metadata 消失就推論不是 AI,也不能證明內容為真

C2PA 比文字標記更像一份可驗證的數位履歷。依照C2PA 2.4 官方說明,簽章能把來源與編輯紀錄綁定到資產,也能讓簽章後的變更被發現;它驗證的是簽章與其中的 provenance 紀錄,而非影像敘事的真實性,紀錄也可能不完整。重新輸出、格式轉換或截圖還可能移除 metadata。

所以,兩種標記都更接近「可能經過某個系統」的線索,而不是「這是誰創作」的身分證。這也延續了我們在AI 創作主體感談過的核心:工具參與多少,與作品的想法、判斷和責任屬於誰,是兩個不同問題。

為什麼「只用 Claude 校稿」會成為爭議中心?

Anthropic 自己就列出校稿、翻譯、摘要與檔案轉換:即使原始文字、觀點或資料來自使用者,支援模型重新輸出的版本仍可能帶有標記。即使偵測正確辨識到 Claude 的處理痕跡,也不能推論原稿由 Claude 創作;制度若把「曾由 Claude 處理」錯讀成「由 Claude 創作」,就會產生錯誤裁決。

“may persist through some editing”

中文:「經過某些編輯後仍可能保留。」

Anthropic,Claude Help Center

官方沒有定義「某些編輯」究竟多輕,也沒有保證每次校稿都能可靠檢出。相反地,頁面同時承認很短的段落、重度編輯、改寫、翻譯或混入其他文字,都可能讓標記無法辨識。這會形成不對稱:守規則的人只請 AI 修正文法,可能保留訊號;想規避的人卻可能透過重度編輯、改寫或翻譯削弱它。

因此,學校若用一次正向結果直接判定作弊,出版社若用它否定作者權,企業若用它當成懲處依據,都超出了官方說明能支持的範圍。Anthropic 對判讀結果的措辭也很克制:

“not fully conclusive”

中文:「不能作為完整定論。」

Anthropic,Claude Help Center

Claude 文字浮水印是不是「統計式」?目前不能替 Anthropic 補答案

學術研究確實存在統計式文字浮水印。以 Kirchenbauer 等人的大型語言模型浮水印研究為例,常見思路是在生成階段偏向一組由密鑰決定的 token,再用長文本中的統計偏差判斷訊號。但 Anthropic 的頁面沒有說 Claude 採用這條路,也沒有提到 Unicode、零寬字元或任何具體 token 選擇方法。

這個差異很重要:把通用研究機制寫成 Claude 已公開的技術,會讓讀者誤以為我們知道它如何運作,也會把其他論文的可靠度數字錯套到 Claude。較新的WATERPARK 多方案測試跨語言攻擊研究分別顯示,在其測試設定下,改寫或翻譯會削弱部分既有方法;但它們同樣不能證明尚未公開的 Claude 方案會有完全相同的表現。

Anthropic 表示標記不會改變內容的意義、品質或可讀性,但這份官方說明沒有附上 Claude 專屬的 A/B 測試或語言別 benchmark。現階段最誠實的結論是:文字標記可能經過部分編輯仍留存,也可能因篇幅過短或經過轉寫而失效;其實際可靠度必須等偵測規格與實測資料,而不是靠模型文風猜測。

1,000 多票的焦慮,不是技術證據,卻揭露了制度風險

截至 2026 年 8 月 12 日擷取,r/Claude 主討論約 1,100 票、509 則留言;Hacker News 討論約 360 分、330 則留言。平台分數會浮動,Reddit 也會模糊化票數;這些數字只能表示議題有共鳴,不能證明任何技術主張。

留言中常見的擔心包括校稿被當成代寫、正向結果被學校或雇主當成定罪,以及公開偵測工具反過來成為規避者反覆測試的回饋機制。也有人把近期 Claude 文風變化歸因於浮水印,但官方沒有公開模型支援清單或品質 benchmark,這種因果連結目前只是猜測。

AlphaLab 判讀:來源訊號有價值,但不能升格成作者身分證

我們贊成 Anthropic 朝跨產品、跨雲端部署標記。若第三方能獨立驗證,生成端主動留下的訊號會比依賴「像不像 AI 文風」的分類器更可查核,也更符合歐盟生成式 AI 透明度規則想解決的來源辨識問題。

但在偵測方法、門檻與適用模型公開,且採用它的組織建立申訴流程之前,任何組織都不該把它當成單一裁決工具。正向結果只能啟動查核:確認模型版本、使用情境、原稿與修訂紀錄;負向結果也不能替內容開出「純人類」證明。真正可靠的治理,必須把技術訊號、過程證據和人的說明放在一起。

現在該怎麼調整工作流程?

  • 作者與學生:保留原稿、版本紀錄與修改歷程;若規範允許校稿,就清楚記錄 AI 做了什麼,而不是試圖猜怎麼移除標記。
  • 學校與編輯部:把「AI 協助」與「AI 代寫」分成不同政策;任何檢出結果都應有人工複核與申訴程序。
  • 企業:在文件流程記錄模型、版本、平台與用途。支援狀態仍在轉換,僅靠最後一份文字無法還原完整過程。
  • 產品開發者:等待 Anthropic 公布偵測機制與技術文件,再決定是否整合;先設計無法檢測、標記缺失或 metadata 被移除時的處理方式。

如果你想理解模型輸出為什麼能被生成端改變統計分布,可以先補上AI 模型如何學習與生成的基礎;但在 Claude 技術文件公開前,請把所有具體演算法說法留在「可能」而不是「已證實」。

接著閱讀

左右滑動查看更多推薦

今天先做一件事:保留第一版原稿

在偵測工具正式公開前,最實用的自保不是尋找「洗水印」方法,而是讓創作過程可說明。從下一份重要文件開始,保留第一版、主要修改紀錄與 AI 協助範圍。當一個來源訊號被誤讀成作者身分時,這些過程證據才是最有力的上下文。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。