返回資訊
AI趨勢入門

OpenAI 歐盟文字加 textGrain 隱形浮水印:ChatGPT 與 Codex 未來數週上路,換 25% 同義詞檢測掉到 17%

2026年10月6日
易賺Ai團隊
21 分鐘閱讀
#ChatGPT#OpenAI#浮水印#EU AI Act#textGrain
OpenAI 歐盟文字加 textGrain 隱形浮水印:ChatGPT 與 Codex 未來數週上路,換 25% 同義詞檢測掉到 17%

把一段約 400 個詞元的英文回覆,抽換四分之一的字改成同義詞,OpenAI 自己的檢測器就把「有AI 水印」的判斷,從約 92% 掉到 17%。數字寫在公司為歐盟文字來源規則交出的正式評測裡,不是外部紅隊的攻擊報告。

官方同步宣布三件事。全球 API 客戶即日起可為部分模型開啟文字浮水印,預設關閉。未來數週,歐盟境內合格的 ChatGPT 與 Codex 文字輸出會自動加上隱形訊號。檢測器即日起接受申請,但第一階段只給核准的研究與專業機構;一般使用者、學校老師、新聞室與企業合規組,現在還拿不到公開按鈕去驗一段貼上來的文字。

這套技術名叫 textGrain。它不插入隱形字元、不塞奇怪標點、複製貼上也不會多出肉眼看得到的記號。它改的是模型選下一個詞時的隨機性:同一句話可以有好幾種講法時,秘密金鑰讓模型偏愛其中一組,整段文字累積出統計圖案。檢測器拿同一把金鑰去看,這段話是不是比偶然更常踩在那組圖案上。官方幫助中心寫得更白:浮水印是用詞本身的一部分,不是藏在空白裡的機關。

歐盟《人工智慧法》要求生成式 AI 提供者,讓產出的文字能以機器可讀方式被識別。透明度義務裡與標記、檢測、部分深度偽造標示相關的條款,已從 8 月 2 日起適用。獨立專家起草、由歐盟 AI 辦公室協助的《AI 生成內容透明度行為準則》在 6 月 10 日定稿;歐盟執委會稱截至 7 月底約有 190 家機構簽署。OpenAI 說自己也簽了。行為準則是自願工具,第 50 條的標記義務不是。

官方先把能做、不能做的邊界寫死

公司部落格把這次定位成「分階段回應」,理由寫在技術限制,不是公關姿態。文字浮水印與檢測仍被它稱為早期技術,效益與負責任用途的社會共識也還沒定。它因此把能下的結論縮得很窄。

浮水印可以提示:OpenAI 的系統很可能生成或處理過這段文字的一部分。它不能量出人貢獻了多少、不能證明誰擁有這段文字、不能指出是哪個帳號下的提示詞、也不能判斷內容真不真。檢測不到浮水印,更不能拿來當「這是人寫的」證明。文字可能太短、被改過、被翻譯過、來自尚未支援的模型、浮水印上路前就產出,或根本是別家公司的系統寫的。

這份清單不是附註,是部署策略的核心。官方把檢測器鎖在核准單位,理由就是誤報與漏報都還在。圖像與音訊走另一條路:openai.com/verify 與 Content Provenance API 仍然對外開放,用來查 SynthID 浮水印或與 OpenAI 相關的可信 C2PA 清單。文字這層,公司選擇先不把「驗得到/驗不到」交給大眾解讀。

幫助中心補了操作細節。歐盟 ChatGPT 產出的文字會帶 textGrain,以符合法規。API 客戶可在專案或組織設定裡打開「允許文字浮水印」,再勾選模型。打開之後,浮水印在生成時就寫進去,客戶不必每則回覆另外蓋章。組織預設走「資料控制 → 文字來源」;專案可覆寫。開啟浮水印,不會順便拿到檢測器權限。雲端轉售通路上的 OpenAI 模型,公司說正在與合作夥伴對齊,未來數週才會陸續覆蓋,現況依輸出類型與通路而異。

可見標籤也不被浮水印取代。機器可讀訊號是一層,畫面上的「AI 生成」橫幅或法律要求的揭露是另一層。OpenAI 明確說自己不能替客戶判斷特定使用情境要不要再加揭露。

數字比口號硬:長度、題材、語言、改寫

官方評測把目標誤報率訂在 1%。在心理學這類用詞空間較大的內容上,約 200 個詞元的段落檢出約 80%,約 400 個詞元升到約 95%。數學這類能換的講法少,檢出明顯較低。行為準則因此不要求短於 200 詞元(英文大約 150 字)的輸出,也不要求程式碼片段必須加水印。幫助中心把原因講成:短文統計量不夠;程式碼下一個符號的合理選擇比散文少,浮水印更難站住。

改寫是另一條裂縫。官方用 ELI5 資料集的英文回覆做實驗:400 詞元段落裡,抽換 10% 的字成同義詞,檢出從約 92% 掉到 66%;抽換 25%,掉到 17%。翻譯、大幅度改寫、重述同樣會讓訊號變弱。幫助中心還寫:就算措辭幾乎沒動,短文或用詞空間很小的文字,也不保證檢得出來。

歐盟 24 種官方語言也不是同一條曲線。幫助中心描述的測試是:先用 500 條涵蓋多樣主題的英文合成提示,再翻譯成另外 23 種語言。在 1% 誤報率下,西班牙語檢出最高,達 69.0%;羅馬尼亞語最低,42.2%。公司說浮水印強度可以調,並已對檢出低於 60% 的語言加力。這表示「歐盟全面標記」在工程上仍是一組依語言校準的旋鈕,不是一開就各語等強。

品質影響被寫成「看不見」。官方用評估 GPT-6 Astra 的同一組基準,對照加水印前後的分數,稱差異落在平常評測噪音裡。ChatGPT 產品側先前測試,也稱倒讚率與其他產品指標沒有因浮水印而變。速度影響被寫成可忽略。

基準未加水印(Astra,max)加水印(Astra,max)
Artificial Analysis Intelligence Index49.57 分49.76 分
AutomationBench34.09%34.86%
DeepSWE v1.172.80%71.68%
Terminal-Bench 4.053.90%56.06%
Terminal-Bench Science 0.156.90%60.00%
BrowseComp87.92%87.35%
HealthBench Professional64.27%64.60%
GPQA Diamond94.44%93.94%

Astra 仍是公司口中「最新前沿」的那顆,即便原定的 GPT-6.1 Astra 已因對齊測試未過而被撤掉。該次對齊測試的細節站內另文寫過。這張表量的是現役 Astra 在加水印前後的分數差,不是在宣布新模型。DeepSWE 微降、Terminal-Bench 微升,官方把整組解釋成沒有意義上的品質損失。獨立第三方還沒用同一套浮水印設定重跑公開榜;目前能核對的,就是這張公司表。

條件(官方,目標誤報 1%)檢出大致落在
心理學類,約 200 詞元約 80%
心理學類,約 400 詞元約 95%
數學類,同樣長度帶明顯低於心理學
400 詞元,抽換 10% 同義詞約 92% → 66%
400 詞元,抽換 25% 同義詞約 92% → 17%
西班牙語(24 語測試)69.0%
羅馬尼亞語(加強度前)42.2%
短於 200 詞元/程式碼片段行為準則不強制;實務上不可靠

Bloomberg 把政策收成三句:歐盟合格 ChatGPT 與 Codex 輸出將加隱形浮水印、textGrain 在選詞隨機性裡加統計訊號、API 客戶全球可選。IT 之家轉述同一套部署範圍,並強調發布時不會把文字浮水印設成全球預設。開發者論壇的官方轉貼則把「檢測不到 ≠ 人寫的」寫進摘要,避免客戶把開關當成法庭證據。

技術報告把「強度」寫成資訊代價

隨部落格釋出的技術報告標題是 textGrain: Entropy-Calibrated Watermarking for Language Model Text,日期與公告同一天,作者掛賓夕法尼亞大學、耶魯大學與 OpenAI。方法把詞元生成耦合金鑰隨機性,透過以 Gumbel 變數為成本的最佳傳輸問題,再用 KL 正則化懲罰偏離獨立。報告寫:KL 散度恰好等於平均少掉的條件熵,於是「浮水印強度」有直接的資訊論意義——你用一筆採樣熵預算,去換一段可被檢測的訊號。

為了算得動,傳輸步驟做在詞彙區塊上,降低最佳化維度,同時維持區塊內相對機率。檢測端只需要生成文本與秘密金鑰,不必知道生成時用了多大的熵預算,也不必拿回生成模型本身。報告把這個性質寫成部署條件:金鑰持有者可以驗,模型權重持有者不必每次把整顆大型語言模型牽進檢測流程。

公司說評測裡 textGrain 達到或超過它測過的其他方法,包括用於文字的 SynthID;它同時寫明,理想條件下的好成績不保證日常使用可靠。Google DeepMind 的 SynthID 仍用在 OpenAI 的圖像與音訊輸出上,並搭配 C2PA 內容憑證;文字這層改走自家方法。官方稱 textGrain 讓它更能自己調「檢得出來」和「同一提示詞還能產出多樣回覆」之間的平衡。公司計畫把 textGrain 開源,並說報告未來數週還會補細節。開原始碼倉庫與授權條款目前沒有日期,也還沒有公開儲存庫位址。

幫助中心把取樣過程講成人話。每一步模型先給每個候選詞元一個可能性。浮水印系統據此做出好幾組調整後的可能性,各偏向不同選擇,平均起來仍對上原本的分布。金鑰決定用哪一組,模型再從那一組做一次新的隨機選擇。之後檢測器用同一把金鑰與對應設定,看文本是不是比偶然更常走那條秘密路徑。事實性很強、必須照抄使用者原文、或幾乎沒有別種講法的答案,可調整的空間變小,浮水印就可能檢不到。

Pangram 這類第三方工具走的是另一條路:生成之後,用分類器從用詞習慣猜「像不像 AI」。歐盟法規要的是生成時嵌進去的訊號。OpenAI 把這個差別寫進幫助中心,等於預先擋下「你們為什麼不用市面上的 AI 檢測器就好」。那些檢測器不滿足「機器可讀標記必須嵌在生成文本裡」這條。反過來說,嵌進去的標記一旦被同義詞洗掉,法規要的機器可讀性也一起淡掉。

教室、新聞室、API 產品現在實際拿得到什麼

對歐盟 ChatGPT 與 Codex 使用者,未來數週的變化發生在你看不見的地方。所有方案的合格文字都可能被加水印,免費層與付費層沒有被寫成例外。你不會在畫面上多一個浮水印開關,也不會在複製後看到怪符號。你若把長回覆貼進文件、郵件、作業,統計圖案原則上跟著措辭走;你若請另一個模型改寫、或自己大段換詞,圖案就可能淡到檢測器不敢判。

對 API 客戶,選擇權在機構。合規團隊可以把浮水印當成「我們盡力標記了」的開關;產品團隊可能拒絕打開,因為終端使用者若把輸出當自己的稿,隱形標記等於在客戶的下游文件裡留下來源指紋,而客戶自己又看不到、驗不了。官方把選擇交給客戶,也把「沒開就不標記」的缺口留在全球 API 預設值裡。歐盟使用者在 ChatGPT 網頁上被標記,同一家公司若改打 API、或改用尚未覆蓋的雲通路,標記可能消失。官方把這段寫進部署範圍,等於預先承認消費者產品與 API/雲通路不會同步蓋章。

對想驗稿的人,現況更窄。核准單位申請通過後,工具只回報「有沒有偵測到 OpenAI 浮水印」,不回帳號、不回提示詞、不回對話。公司點名已在合作的研究者,包括康奈爾大學助理教授 John Thickstun、ETH Zurich 教授兼 INSAIT 科學主任 Martin Vechev,以及斯洛伐克 Kempelen 智能技術研究所(KInIT)。一般教師把學生作業貼進驗證頁,現在會發現文字通道還沒對公眾開放;圖像與音訊才走 openai.com/verify。

教育場景特別容易踩到官方自己承認的盲區。作業常短於 200 詞元。程式作業幾乎整份都是程式碼。學生只要把段落用另一個模型改寫,或手動換一批同義詞,檢出就可能從「差不多確定」掉到「幾乎看不見」。學校若把「檢測不到」當成抄襲不成立,剛好踩進官方禁止的推論。新聞室若把「檢測到」當成造假坐實,也踩進另一側:浮水印不驗證準確性,也不量人機各寫了多少。

企業採購能問的問題因此很具體。供應商有沒有在歐盟消費者產品打開標記?API 預設關著,合約有沒有要求開啟、以及開在哪些模型?雲通路何時對齊?檢測器申請有沒有被拒的備案?短函、客服制式回覆、程式產生器這些低熵輸出,本來就不該被寫進「可驗證來源」的 SLA。OpenAI 沒有公布 API 浮水印的額外單價;它把這件事寫成設定,不是新的計費項目。

和 Claude 那次全球浮水印不是同一張時間表

站內寫過 Anthropic 那次部署:為 Claude 輸出加隱形浮水印與 C2PA,並讓歐盟透明度規則外溢到全球。那次是全球產品行為,不是只開歐盟。OpenAI 這次明確說:發布時不以全球預設上路,先用歐盟當真實世界試驗場,再決定要不要擴大。圖像層兩邊都碰過 C2PA;文字層 OpenAI 現在才把消費者產品的預設標記縮在歐盟。

差距不只地理。Anthropic 當時把浮水印當成產品透明度的一部分往外推;OpenAI 把檢測器當成研究工具往內收。一個讓更多下游系統有機會驗,一個擔心驗完的結果被過度解釋。兩種選擇都承認同一件工程事實:文字太容易被改。差別在於,改寫風險該由「先不要讓大眾按檢測鈕」來管,還是由「先讓訊號存在、再教育解讀」來管。

第三方 AI 檢測器不會因為 textGrain 上路就退休。它們繼續猜「像不像模型寫的」,不負責證明「是不是這家公司嵌了金鑰」。OpenAI 的檢測器只認自家訊號,不認別家模型。一段 Claude 或 Gemini 寫的字,用 OpenAI 檢測器驗,本來就應該是空的。歐盟若要的是「生成式文字可被機器識別」,各家各把金鑰、各把檢測器,互通標準仍是空的。C2PA 在圖像檔案上提供過一種跨廠商中介格式;文字還沒有同等地位的通用容器。

社群與開發者討論裡反覆出現的擔憂,官方數字已經預先供槍。想洗掉標記的人,不必懂最佳傳輸,只要會用同義詞或再跑一輪改寫。想栽贓的人,理論上需要金鑰才能「種」出可被同一檢測器認的圖案;金鑰不公開,這條路比較難。真正大的誤用在解讀端:漏報被當成人類原創,誤報被當成學術不端。公司把檢測器關在核准名單裡,就是在賭:與其讓錯誤解讀先擴散,不如讓法規要求的標記先存在、解釋權先留在少數實驗室。

下一步能核對的,不是又一篇原則聲明。歐盟 ChatGPT 與 Codex 實際開始標記時,短回覆與程式碼會不會被悄悄排除,要看產品行為,不能只看部落格。API 設定頁列出的模型名單何時擴到所有舊模型,幫助中心只說「未來數週」。開原始碼什麼時候進公共倉庫,現在沒有日期。檢測器何時對公眾或對企業合規組開放,官方條件寫成:等它相信結果能被負責任地解讀。

在那之前,歐盟使用者的文字會帶著一枚你看不見、多數人也驗不了的統計印。想用它擋作業代寫、想用它當新聞室的真偽開關、或想用它當採購合約裡的來源保證,官方已經把這三件事寫成做不到。能做的只有:在合格、夠長、沒被大改的散文上,讓握有金鑰的核准單位多一個「這段很可能經過 OpenAI 系統」的訊號。這訊號夠不夠應付第 50 條,要等執法與首次誤用案例來量,不由產品發表會決定。