OpenAI 即將在歐盟開始對 ChatGPT 與 Codex 文字加入隱形浮水印
目錄
你可能想知道的事
這種隱形浮水印會在全球套用還是只在特定地區?
浮水印對編輯、翻譯與短段落的穩健性如何?
主要內容
OpenAI 宣布將開始在為歐盟使用者產生的 ChatGPT 與 Codex 文字中加入隱形浮水印。此舉旨在符合於 8 月 2 日生效的歐盟 AI 法案之透明度要求,該法案要求 AI 公司以其他系統可識別的方式標示 AI 產生的內容。OpenAI 在部落格文章中表示,浮水印功能將在接下來數週內向所有計劃中符合資格的 ChatGPT 與 Codex 使用者推出,但在啟動時僅會在歐盟套用。
該浮水印並非嵌入輸出中的可見徽章或標記。相反地,它透過微妙地影響模型的用詞選擇,使產生的文字帶有可檢測的模式。此模式設計為一般讀者難以察覺,但使用適當金鑰的檢測器可以識別。因為浮水印是編碼在詞語選擇中,當文字被複製貼上時,浮水印會隨文字一起傳遞。OpenAI 強調浮水印不會識別產生文字的使用者,且公司報告在啟用浮水印時模型效能沒有顯著變化。
在部署公告的同時,OpenAI 發布了一篇描述此浮水印方法的技術報告,名為 textGrain。該報告與賓夕法尼亞大學和耶魯大學的研究人員共同撰寫,說明一種使用祕密金鑰重新排序或排序下一詞預測的方法,藉此將模型輸出推向某種模式。單一的微小推動通常不易察覺;但累積數百次此類推動會形成可被檢測器利用的統計訊號,當檢測器擁有金鑰時,可用來區分 AI 生成內容與人類撰寫內容。
OpenAI 的內部評估顯示浮水印在許多情況下可被偵測,但並非萬無一失。在公司引用的一項測試中,將 10% 的詞替換為同義詞會將檢測率從約 92% 降低至 66%。公司亦指出短段落、數學答案與翻譯文字較難被檢測器可靠識別。基於這些限制,OpenAI 起初僅向經核准的研究人員與專家組織提供檢測器存取,以便他們評估可靠性並探討該工具的適當、負責任使用方式。
OpenAI 警告表示,浮水印缺失不應被視為人類作者的證明。浮水印缺失可能是因為段落過短、經過大量編輯,或內容源自其他公司的模型所致。OpenAI 表示,浮水印可以指示某段文字由 OpenAI 的系統產生或處理過,但無法量化人類判斷、編輯或創意貢獻了多少。換言之,檢測到的浮水印表示 OpenAI 系統可能參與;而浮水印未被檢測到,則無法確定性地證明該文字為人類創作。
此公告緊接在 Anthropic 的類似作法之後。兩個月前,Anthropic 表示將對其 Claude 模型生成的文字加入浮水印,並打算在全球範圍套用該浮水印。Anthropic 的決定引起部分 Claude 使用者反對,他們主張自己的指示、上下文與決策才是主要因素,Claude 只是執行使用者輸入的一個工具。《華爾街日報》於 2024 年報導,OpenAI 先前曾開發文字浮水印但延後發布,部分原因是擔心使用者可能轉向未加入浮水印的競爭者。
OpenAI 也指出,啟動時不會將文字浮水印設為全球預設。全球任何地區使用 OpenAI API 的開發者,可立即為特定模型啟用浮水印,但該功能預設為關閉。因此公司的做法是在區域上針對(歐盟使用者)全面推出,同時允許其他地區的開發者選擇性加入。
數家主要 AI 公司已與歐盟不斷演進的政策環境互動:Anthropic、Google、Meta、Microsoft 與 OpenAI 等組織都承諾遵循歐盟關於 AI 生成內容的實務守則。這些努力反映產業對於需以可互操作方式識別由 AI 創建或大量處理內容之要求的整體回應。
OpenAI 方法中的技術折衷突顯浮水印策略的核心張力。一方面,直接在生成文字中嵌入可檢測的模式,能確保標記隨內容一起傳遞,不依賴可能被移除或遺失的 metadata。另一方面,因為模式存在於文字本身,編輯、改寫、翻譯或其他轉換都可能使其退化或移除。OpenAI 的測試顯示,在 10% 的同義詞替換下,檢測率從 92% 降至 66%,凸顯即便是適度的編輯也會大幅影響可檢測性。
OpenAI 決定初期僅限核准的研究人員與專家組織取得檢測器存取,可能是為了協助公司評估真實世界的可靠性、揭露邊緣案例並完善負責任使用的指引。此舉也反映出對於釋出可能被濫用以主張作者權或過度解讀檢測結果之能力的擔憂。公司明確警示應審慎解讀檢測結果,因為浮水印缺失並非人類出處的決定性證據。
綜合來看,OpenAI 在歐盟使用者中推出的浮水印,代表一個由合規驅動、謹慎採取的步驟,朝向 AI 生成內容更高的透明度前進。公司在平衡法規要求、浮水印技術的限制、使用者可能的反應,以及在擴大存取前需進行的審慎、以研究為主的評估。
重點摘要表
| 面向 | 說明 |
|---|---|
| 規範驅動因素 | 歐盟 AI 法案透明度規定自 8 月 2 日生效 |
| 啟動時範圍 | 向歐盟符合資格的所有計劃中的 ChatGPT 與 Codex 使用者推出;API 開發者全球可選擇加入 |
| 浮水印方法 | 名為 textGrain 的隱形浮水印,透過推動用詞選擇來創造可檢測的模式 |
| 效能影響 | OpenAI 報告在啟用浮水印時模型效能無顯著變化 |
| 檢測限制 | 短段落、數學答案與翻譯文字較難檢測;編輯可降低檢測率(10% 同義詞替換將檢測率從 92% 降至 66%) |
| 檢測器存取 | 起初僅提供經核准的研究人員與專家組織 |
| 公司脈絡 | Anthropic 先前宣布對 Claude 進行全球浮水印;其他主要公司承諾遵循歐盟實務守則 |
後續…
展望未來,OpenAI 針對歐盟的浮水印部署可能會促使持續的技術改良與政策討論。研究人員與專家組織將最初協助評估可靠性、識別如改寫或翻譯等失效模式,並就如何負責任地解讀檢測結果提出建議。產業將持續權衡可見或隱形標記技術、metadata 方法與使用者期待。如果浮水印被證實可靠且可管理,採用範圍可能會擴展到歐盟以外——儘管 OpenAI 在啟動時並未將其設為全球預設。與此同時,編輯測試與具挑戰性的內容類型所顯示的限制,將在監管者、實作方與使用者在評估浮水印對作者身分與人類介入角色所代表含義時,持續扮演重要考量。
最後編輯時間:2026/10/6
