文章上線

Pew 研究發現:三分之一的 ChatGPT 之後網頁顯示 AI 作者痕跡

Pew 研究發現:三分之一的 ChatGPT 之後網頁顯示 AI 作者痕跡

目錄

你可能想知道的

ChatGPT 與類似模型的出現是否顯著改變了英語網頁內容的構成?檢測工具能多可靠地分辨人類撰寫的文字與 AI 協助或 AI 生成的文字?

主要議題

皮尤研究中心(Pew Research Center)的一項新分析檢視了大量英語網頁樣本,發現相當一部分顯示與 AI 作者身分一致的模式,特別是在 2022 年 11 月 ChatGPT 公開發布之後發表的內容。研究人員使用大約 490,000 pages,這些頁面取自 Common Crawl 檔案,涵蓋 2021 年 1 月到 2026 年 7 月。他們將擷取的文字輸入一個名為 Open Pangram 的 AI 偵測模型,以估計 AI 可能在撰寫內容中扮演了角色的情況。

主要發現很直接:在這個多年樣本中,約有 10% of pages 顯示顯著的 AI 作者跡象。當資料集僅限於 ChatGPT 於 2022 年 11 月推出之後發表的頁面時,估計比例大幅上升到約 35%。這表示在大型語言模型進入主流後,網路發文中使用 AI 的情況明顯加速。

被偵測出 AI 作者痕跡的分布在不同網域類型間並不均衡。商業「.com」站點顯示 AI 作者指標的比率遠高於學術(「.edu」)或政府(「.gov」)網域。皮尤指出,「.com」網域顯示 AI 參與的比例大約是「.edu」和「.gov」站點的 ten times,而後者各自接近 1% 水準,且約為「.org」網域觀察到比率的兩倍(樣本中約為 4.6%)。

網域差異部分反映出誰在發佈內容以及如何發佈。許多學術與政府頁面經過編輯審核、機構核准與較慢的發佈流程,這降低了快速大量使用 AI 生成內容的誘因與機會。相比之下,商業網路空間涵蓋從新聞室內容到以搜尋流量為導向的聯盟與行銷頁面,這些內容可快速大量產出並發佈——在這種情況下,AI 協助或完全自動化更具吸引力。

皮尤在偵測 AI 時並不依賴單一「徵兆」,而是觀察大量文字樣本的統計模式。儘管如此,研究人員辨識出數個自 2023 年以來變得更常見的風格與詞彙標記。例如,破折號(em dash)在較近期的文字中出現的頻率約為 twice as often;牛津逗號(Oxford comma)增加了約 63%;以及某些當代 AI 產出偏好的詞彙(如 "delve"、"interplay" 和 "testament")出現頻率已超過兩倍。另一種稱為「負向平行構式」(negative parallelism)的模式——像是「it's not just X, it's Y」這類片語——自 2023 年以來幾乎 tripled,雖然整體仍屬罕見。

這些語言上的變化與其他監測努力及詞典學觀察一致:追蹤者與分析師在先前研究中也指出類似跡象,詞典出版者亦注意到反映較大趨勢的語言使用變化。即便如此,皮尤強調重要的注意事項。偵測模型可能會將單一頁面誤分類為相反結果:可能錯誤地把人類撰寫的文字標為 AI 生成,或未能識別受 AI 影響的材料。此外,「顯著的 AI 作者跡象」的標註並不意味該頁面完全由機器生成——許多頁面可能混合了人類與 AI 的貢獻,例如 AI 協助起草後由人編輯。

皮尤分析中使用的偵測器 Open Pangram 由 Pangram Labs 開發,並曾出現在其他研究中。例如,使用類似偵測工具的研究人員曾報告在部分美國報紙文章(包括主要媒體的評論文章)中發現 AI 生成內容。在不同資料集中偵測信號的存在表示 AI 對書面內容的影響是可測量的,即便個別分類有時不確定。

展望未來,隨著技術演進,AI 偵測本身也可能改變。大型 AI 開發者正探索模型層級的文字指紋技術——在生成時嵌入的加密或統計標記——這將使 AI 生產的文字更容易被識別,同時力求降低誤判率。如果廣泛採用,這類做法將改變偵測格局,能更可靠地歸因機器生成的文字。

從規模與時間軸來看,皮尤的數據顯示商業站點的 AI 作者標記呈陡升趨勢:在 2021 年 1 月「.com」頁面的比率約為 1%,到 2026 年 1 月上升至約 9.35%。此一上升說明 AI 工具如何快速被整合到重視產量、搜尋可見性或快速內容周轉的工作流程中。

總結來說,皮尤的大規模網路掃描發現 AI 對英語網頁內容的影響普遍且呈上升趨勢,尤其中在 ChatGPT 首次亮相後發表的素材。雖然偵測有其侷限,且 AI 協助與完全 AI 生成的界線可能模糊,但所識別的模式指出線上內容生產方式發生重大轉變,並凸顯持續監測、謹慎的編輯政策,以及可改善透明度與歸因的技術解決方案的必要性。

重點見解表

面向說明
樣本規模~490,000 篇來自 Common Crawl 的英語頁面(2021/01–2026/07)
整體 AI 訊號約 10% 的頁面顯示顯著的 AI 作者跡象
ChatGPT 之後的頁面自 2022 年 11 月以來發表的頁面中約有 35% 顯示 AI 訊號
網域差異.com 網域顯示更高的 AI 比率(約為 .edu/.gov 的 10 倍;約為 .org 的 2 倍)
偵測方法Open Pangram(對大量文字批次進行統計模式偵測)
值得注意的語言標記破折號增加、牛津逗號增加、某些偏好詞彙,以及「負向平行構式」
限制可能誤分類;「跡象」並不代表完全由 AI 生成

後續⋯

AI 在網路內容中的日益擴張帶來了關於透明度、品質與歸因的實務與倫理問題。隨著偵測工具與模型層指紋技術演進,出版者、平台、研究人員與讀者等利害關係人將需要在自動化利益與驗證防護之間取得平衡。持續的大規模監測、更明確的標示實務,以及偵測準確度的進步,將形塑網路如何適應一個人類與機器作者越來越交織的未來。

理解這些動態對搜尋品質、學術誠信、媒體信任與內容治理都很重要。皮尤的數據提供了一個基準:AI 對網路的影響是可測量的、正在加速,且集中在重視發佈速度與規模的領域。這樣的組合既代表機會也帶來風險,並呼籲制定能在保護資訊品質的同時促進 AI 負責任使用的政策與工具。

最後編輯時間:2026/8/22

Claude AI

AI 智能編輯