以受版權保護的書籍訓練 AI:法律不確定性、關鍵案例與未來展望
目錄
你可能想知道的事項
在未經作者明確同意的情況下,AI 開發者是否可以合法地在大量受版權保護的書籍上訓練模型?
近期的法院判決和現行版權法如何影響 AI 訓練和作者權利的未來?
主要議題
大型語言模型和其他當代 AI 系統是在包含書籍、文章、學術論文以及各式線上內容的龐大語料庫上訓練的。許多作者發現自己的作品在未經同意的情況下被納入這類訓練集。乍看之下,這似乎明顯侵害了作者權利,但法律現實較為複雜且不斷發展。
版權法主要關注複製行為以及保護創作作品的經濟市場。以現行許多司法管轄區(例如美國,自 1976 年的版權法案以來在此方面大致未變)所書寫的法律來看,並未預料到會有消耗並抽象化大量文本模式的機器學習模型。因此,法官與律師正將現有原則套用於新穎的技術行為,產生多種解釋,而非單一既定規則。
在這些爭議中,一個關鍵的法律概念是「合理使用」,該原則允許在評論、批評、教育或轉化等目的下有限度地使用受版權保護的材料而無需許可。法院會透過多個因素來評估合理使用,包括使用的目的與性質(是否具轉化性?)、受保護作品的性質、所使用部分的數量與實質性,以及對原作潛在市場的影響。
近期訴訟開始顯示法院如何看待 AI 訓練與版權之間的關係。在一宗備受矚目的案件中,聯邦法官命令一間 AI 公司就從非法影子圖書館取得書籍支付重大金額和解金。矛盾的是,同一位法官又表示,訓練 AI 模型的核心過程——攝取大量文本以學習模式,然後產生新穎輸出——類似於人類讀者研讀文學,僅就此並不構成版權法禁止的那種類型之複製。簡言之,法院區分了 資料的取得方式(非法下載)與訓練過程本身的法律性質。
關注這些案件的法律從業人員指出,這類裁決可被解讀為對 AI 開發者相對有利。與受版權保護材料之非法取得相關的罰款或和解,與得出一項結論稱「以合法取得的受版權作品進行訓練本身即為不法」之法律結論,是不同的。對於預估未來收入龐大的大型 AI 公司來說,可觀的罰金或許重要但未必致命——而若直接禁止使用受版權作品進行訓練,影響將更加深遠。
另一方面,法院也在某些情況下反對當受版權內容被用來建立直接競爭產品時的作法。在至少一宗案件中,法院認為某方為開發競爭性的 AI 平台而複製專有資料庫,並不符合合理使用,因為新產品並未具有足夠的轉化性,且在市場上與原始來源競爭。該判決凸顯司法推理中出現的一個脈絡:若 AI 應用取代或削弱了原作品的市場,法院可能會不予認定合理使用。
另一個相關議題是 AI 生成內容的版權狀態。法院已裁定,完全由機器生成且無人類著作的作品,可能不具備版權保護資格。此一裁決提出實務與哲學上的問題:我們如何判定作品中哪一部分由 AI 而非人類創作?法律應如何對待人機協作產出的作品?歷來協助語法與格式(如拼字檢查或風格建議)的工具被視為不會創造所有權的輔助工具,但更複雜的生成式工具則模糊了這條界線。
由於許多爭議仍在審理中,且不同司法區與事實情境之裁決各異,目前仍無單一權威性答案。早期判決與和解具有影響力,將會塑造業界行為,但其影響具暫時性,直到上級法院或立法機關提供更明確的規範。在此期間,創作者與 AI 公司正密切關注發展並相應調整實務。
總結來說:以受版權保護的書籍訓練 AI 的合法性取決於多項因素——內容如何被取得、使用是否具轉化性、與原作市場之關係,以及每一案件的具體事實。法院正將既有的版權檢驗套用於前所未有的技術行為,產生可能相互矛盾的裁決。
重點洞見表
| 面向 | 說明 |
|---|---|
| 重點事實 1 | AI 模型在龐大的文本集合上訓練,這些集合通常包含來自各種來源的受版權書籍。 |
| 重點事實 2 | 法院根據傳統的版權原則(複製、合理使用、市場損害)來評估訓練作法,根據事實產生不同結果。 |
後續…
展望未來,隨著社會尋求在創新與創作者權利之間取得平衡,有多條路徑值得關注。立法機關可更新版權法條以明確處理機器學習並界定可允許的訓練作法,從而減少對開發者與作者的法律不確定性。或者,更多上訴法院的判決可能會匯聚成更明確的判例法,將訓練框定為一般可允許、有條件可允許或視取得與下游用途而不可允許。
在技術面,改進來源追蹤、建立訓練數據的透明授權市場,以及讓作者能選擇加入或退出的工具,有助於調和雙方利益。政策創新例如集合授權方案或收益分配模式,可能使創作者與 AI 建構者之間的激勵更加一致。此外,針對水印或其他檢測 AI 影響於生成內容的方法之研究,能釐清著作權問題並形塑法律標準。
對於作者、技術人員與政策制定者而言,下一階段的討論應聚焦於尊重創作勞動且允許有益技術進步的實際機制。強調合作性解決方案——透明的資料來源、明確的授權框架與平衡的法條更新——可能提供最持久的前進道路,隨著法院與立法者趕上快速的技術變遷。