最新消息

美國著作權局報告- 訓練生成式AI對著作權的影響

一、美國著作權局於2025年5月間發布「著作權與人工智慧(Copyright and Artificial Intelligence)」系列第三篇報告-探討訓練生成式AI對著作權的影響(Generative AI Training)1。生成式AI系統的開發依賴大量數據,其中包括受著作權法保護的作品,引發是否需要對相關著作權持有者同意或者補償的爭議,本報告透過檢視開發的各階段,初步判斷是否構成著作權侵權及其建議,可做為臺灣IP業界的參考,摘錄要點如後。 

二、訓練生成式AI對著作權的影響

(一) 生成式AI的開發過程包括以下階段,廣泛複製受著作權保護的作品,而涉及美國著作權法中「重製」等權利2。除非有合理使用(fair use)或授權協議等抗辯事由,否則即會被視為侵權:

1. 數據收集和預處理

開發者在收集和整理(預處理)訓練數據集時,涉及下載、轉換和修改大量受著作權法保護的作品,無論數據來源是否為公開網站,這些行為都可能構成對著作權的重製、編輯、改作等多重侵害(特別是涉及商業用途之情形)。

2. 訓練過程

此階段將預處理之數據輸入AI模型,通過機器學習演算法重複調整模型參數(權重),以學習數據中的模式。訓練過程涉及多次處理和複製數據,而產生侵權風險:

(1) 訓練過程通常需要將數據「下載」到內部資料庫,而涉及複製行為。

(2) 模型的「權重(weights)」可能在某些情況下被視為包含受著作權保護作品的「表達元素(expressive elements)」:所謂「權重」,是模型進行機器學習後編碼的數值參數,用來決定模型如何處理輸入數據並產生輸出。這些權重主要是透過自動化過程產生,因此一般來說會被認為缺乏人類作者的創意選擇,不被視為受著作權保護的客體,單純複製AI模型的權重,通常也不構成著作侵權。但倘若權重中包含可辨識且受保護的原始作品內容(例如,AI模型設計或訓練過程故意讓模型權重「記住」或「嵌入」大量受保護內容,並能夠還原出這些內容),則權重仍例外可能被認為是原始作品的「副本」,從而侵犯原始數據的重製權或改作權。

3. 輸出結果

訓練完成的模型實際配置應用時,生成文本、圖像或其他內容,此階段的風險與前一階段類似,即倘若模型生成與受著作權保護作品實質近似的輸出,則可能侵害著作權人專有的重製權等權利。

4. RAG(檢索增強生成)

(1) RAG(Retrieval-Augmented Generation) 是目前生成式AI發展中的一重要架構,RAG結合了「檢索系統」與「生成式AI模型」。在生成資訊時,模型會先從外部資料庫(如知識庫文件、網頁)檢索最新相關內容,再根據這些檢索到的資料與模型生成的輸出結合、生成資訊,以提升答案的準確性與時效性。

(2) RAG可能產生以下爭議:

  • 資料來源的合法性:RAG技術涉及引用外部資料庫內容,這些內容若受著作權保護,引用與再生成過程可能涉及「重製」、「公開傳輸」、「改作」等著作侵權行為。
     
  • 若AI直接引用檢索的內容,侵權風險較高;若經過再加工、摘要、重組,則涉及個案判斷是否構成合理使用。

(二) 本報告建議AI開發者在訓練模型時應考慮取得授權或可否提出合理使用抗辯,但後者的適用需透過個案分析,且在商業用途或盜版數據之案例,合理使用抗辯可能較難成立。

三、合理使用分析

「合理使用」是美國著作權法第107條規定的一項抗辯,旨在平衡著作權持有者與公眾的利益,允許在某些情況下未經授權而使用受著作權法保護的作品。本報告分別檢視以下四項法定要素,但強調法院在個案具有衡量權:

(一) 使用目的與性質- 考量使用是否以商業為目的或是非營利等用途

商業性質可能不利於合理使用抗辯,但倘若構成「變革性/轉化性(transformative)」使用,則可能獲得較有利的認定。訓練AI模型可能構成「變革性/轉化性使用」是判斷本項的核心因素

1. 報告援引美國最高法院在Warhol 3 的觀點,認為判斷是否為變革式使用,不僅要看「複製行為本身」,更要看「複製的最終目的」。換言之,複製作品用來建立訓練資料集是否具變革性,取決於該資料集最終被用之目的。

2. 訓練大型生成式AI模型通常具備變革性

報告認為,使用龐大且多元的資料集訓練生成式AI基礎模型,通常是變革性的。因為此過程是將大量作品轉化為數據模型,該模型能在多種全新情境下產生多樣化輸出,與直接複製原始作品本質不同。例如,語言模型能用來翻譯、糾正語法、回答問題,這些功能與訓練時使用的個別文學作品之目的明顯不同。

3. 變革性是程度問題,依模型功能與設置方式而異

(1) 高度變革性:例如用於研究或封閉系統中執行非替代性任務的模型訓練,為高度變革性。

(2) 低度變革性:若模型被用來生成與訓練資料集中的著作權作品「實質相似」的內容,如基礎影像模型被進一步訓練生成特定動畫角色的圖像,則除非是針對原作進行評論或者諷刺,否則較難被視為變革性使用。

(3) 輸出限制與設置防護措施可影響變革性之判斷

若開發者在訓練或設置模型時,設置或限制模型避免生成受著作權保護作品的片段或表達,則該系統較不會取代原作品,其使用更可能被認定具變革性。

4. 多數使用介於兩者之間

(1) 有些模型訓練目的與原作相似,生成與原作高度相似的內容且用於替代市場,則變革性較低,屬「中度變革性」,合理使用抗辯較弱(例如音樂模型生成新音樂,滿足娛樂市場需求)。

(2) 相對地,若模型用於去除音訊失真等技術性目的,則變革性較高。

5. RAG使用需另行考量

RAG技術會根據用戶的提示檢索外部資料庫之個別作品並用於生成結果,若生成內容是原作品的摘要或濃縮,雖然對於新聞媒體等產業是重要訊息,但一般而言變革性較低。

6. 報告反駁兩項常見錯誤論點

(1) AI訓練並非當然是「非表達性行為」:報告指出,語言模型吸收了語言的表達本質、影像模型利用美學圖像進行訓練,若此些模型用於生成「表達性內容」(註:美國著作權保護之前提即是「表達性」的作品),訓練本身並非當然可被視為非表達性使用而不受著作權保護。

(2) 不應類比人類學習而自動認定合理使用:報告認為此種類比不成立,因為合理使用抗辯本質上並不討論人類的學習行為,且AI訓練涉及完美及高速的複製與分析,遠超越人類有限的記憶與理解能力。

(二) 著作權作品的性質

創意性越高的作品(如小說、音樂或電影)相較於事實性或功能性作品更難被認定為合理使用。

(三) 所利用之質量及其在整個著作所占之比例

1. 報告指出,AI訓練通常涉及整個作品的複製,而不利於傳統合理使用分析。

2. 但報告也承認,在某些高度變革性用途下,完整複製可能被法院允許,例如Google Books搜尋案4 中,完整複製作品以實現有價值的「搜尋功能」被視為合理使用。 

3. 基於上述,AI訓練利用整個原作品的合理性尚不明確,但如果完整複製是為了達成模型最佳性能的「功能性必須(functional necessity)」手段,且開發者採取技術手段限制模型輸出受保護作品的片段,降低對原作市場的替代性,則此類複製的合理性更強。

(四) 利用結果對於著作潛在市場和現在價值的影響

報告強調三種市場損害:銷售損失、授權機會損失以及市場稀釋。

四、緩和侵權風險建議- 輔佐建置市場自願授權機制

(一) 針對現行美國著作權法對於AI訓練是否構成侵權尚無明確定論,且法院對於「合理使用」與否認定不一之情形,開發商已有先尋求授權以降低合規風險之概念。然而,AI訓練的授權可行性根據作品類型、產業授權慣例及AI系統設計及用途而有所別。法定或者強制授權之作法較僵化且不利於技術、市場及法律發展仍在初期階段的開創性產業。

(二) 過去幾年間,有部分AI系統僅使用公共領域作品,亦有部分開發商為訓練AI而尋求著作權作品授權的市場,實務發展顯示自願授權在高價值作品(如音樂、圖庫照片)或著作權人數量有限的領域具可行性,本報告因此傾向透過「自願授權」而非法定或強制授權解決訓練AI產生的著作侵權爭議。

(三) 本報告並特別討論在音樂產業等已行之有年的「電子集中授權(Extended Collective Licensing,ECL)」制度,由符合法規範建置的集體管理組織(如音樂產業的BMI、ASCAP等)代表著作權人,統一對特定用途進行授權,即使部分著作權人不明或者未加入該組織,其作品也可被納入授權範圍,並仍保留其「選擇退出」ECL的權利,可作為AI訓練資料集授權的參考,尤其在大規模、跨領域作品利用時,能減少授權成本,提高效率。但本報告也承認,對於全面AI訓練需求,自願授權的大規模應用仍面臨挑戰,特別是在交易成本高或著作權所有人難以尋找的情況下。

五、結論

(一) 美國著作權局強調著作權法的立法目的是為保護創作,進而推動創新,雖然生成式AI訓練階段利用作品的規模前所未有,但現行法律(特別是合理使用規範)仍足以應對這場技術革命,暫無立即修法之必要性。

(二) 生成式AI開發過程中多個階段利用著作權作品,是否構成侵權的關鍵在於這些行為是否可被合理使用(fair use)原則所豁免。而合理使用與否需考量多項法定因素及具體情況,包括使用的作品類型、來源、目的及對市場的影響。綜言之,用於內部分析或研究等促進國際競爭力的用途,其輸出結果不太可能取代原作品,較可能被視為合理使用。而商業利用大量著作權作品致產生與原作品競爭的表達性內容,尤其是透過非法取得資料,則超出合理使用範圍。

(三) 對於非合理使用的情況,實務解決方案很重要。目前部分產業已有透過個別或集體授權協議支持AI訓練,雖然仍不普遍。由於自願授權之情形仍快速發展且大部分利益相關者不支持立法強制授權,本報告認為現階段政府尚無介入之必要,應鼓勵授權市場發展,並考慮採用如電子集中授權(ECL)之折衷式方案。

(四) 對臺灣IP產業而言:

1. 生成式AI的研發及應用企業都面臨侵權風險:

(1) 臺灣的著作權法與美國法律同樣納入「合理使用條款」,因此前述關於「合理使用」之衡量要點,可能會影響未來司法審判發展。至於臺灣出口到美國的模型等產品將受該國法令管制,更不待言。

(2) 本報告特別提出AI模型的「權重」倘若保留或記憶受著作權保護的大量表達性內容,特別是在輸出內容與受著作權保護的作品有實質近似性時,仍可能被法院認定為重製或改作侵權,此論點擴大了AI模型開發者和使用者的法律風險。

(3) 根據「2025 臺灣產業AI 化調查結果」,目前臺灣已有多家企業積極投入生成式AI技術的研發與應用,其中多數企業仍依賴外部供應商或現成AI服務(約45.3%),但也有部分企業選擇自行開發AI模型(約12.5%)或調整開源模型(約15.1%),而七成企業仍處於AI 化前期。對於研發模型以及應用前期的企業而言,不僅都面臨著作侵權風險,且在判斷合理使用時,經常落入介於高度與低度變革性之間的中度變革性情形,因此臺灣的生成式AI開發商尤應優先考慮授權協議途徑,否則在使用著作權材料(特別是來自美國的創作者)時即具有較高面臨侵權訴訟的風險。至於應用端的企業,除學術研究較可能因合理使用免除授權需求以外,宜留意透過「軟體服務協議條款」適度緩和風險。

2. 另一方面,臺灣的音樂、影視文創及遊戲產業等潛在的著作權人持有方,則可參酌本報告的見解加強智慧財產權之保護。臺灣本即已有著作權集體管理組織,在音樂、文學創作領域制定產業導向的授權條款,前述報告特別援引的ECL電子集中授權,或亦可為臺灣據既有基礎發展本土化AI授權模式之參考。
 

◎ 相關報導

    美國著作權局發布「著作權與AI」系列報告(一)及(二)
 

 


1 此為預先發布版本,但美國著作權局表示定稿將不會有太大差異。

2 美國著作權法第106條規定,著作權人享有六項專有權利,包括:重製權(reproduction right)、公開散布權(public distribution right)、公開演出權(public performance right)、公開展示權(public display right)、改作權(preparation of derivative works)、透過數位音頻傳輸之公開演出權(digital audio transmission right)。

3 Andy Warhol Foundation for the Visual Arts, Inc. v. Goldsmith, No. 21-869

4 Authors Guild v. Google Inc., No. 15-849.  

回列表