最新消息

生成式AI涉及的電腦程式著作侵權爭議

一、生成式AI涉及的訴訟爭議如雨後春筍般發展;除了上週介紹AI生成圖片涉及的著作權爭議之外,在美國加州聯邦北區地方法院尚有另乙件對線上軟體原始碼代管服務平台GitHub公司以及微軟公司(Microsoft Corporation)提起的集體訴訟,主張用以「訓練」生成式AI的底層電腦程式也涉嫌侵害著作權(DOE 1 et al v. GitHub, Inc. et al; Case Number: 4:2022cv06823)。

二、案件背景

(一) 在20世紀80年至90年代,隨著商業軟體的崛起,軟體開發呈現封閉和專有的狀態,導致高成本、缺乏相互操作性、安全漏洞和技術壟斷等問題。因此一些軟體開發人員開始產生「開放原始碼(open-source)」的想法,他們認為軟體應是一種自由、共享的資源,任何人都可以公開查看、修改和分享,以降低成本和開發速度,並實現更佳的互操作性和安全性。

(二) GitHub是一家成立於2008年、由一群「開放原始碼」的支持者所創立的公司,透過其同名網站github.com提供開放原始碼的共享及代管服務,讓軟體開發者可在平台上建立自己的開放原始碼項目,並將其託管在GitHub平台,讓其他開發者和使用者可自由地查看、修改和分享這些代碼。據維基百科記載,迄至2022年6月,GitHub已有超過5,700萬註冊使用者和至少2,800萬開放原始碼庫,事實上已成為世界上最大的代碼代管網站和「開放原始碼社群(open-source community)」;截至2023年1月26日,已有超過1億名軟體開發人員使用GitHub平台上的開放原始碼軟體(又被稱為開源軟體)。

(三) 在GitHub上的開放原始碼共有13個主要的存儲庫(repository),其中2個存儲庫,即「The Creative Commons Zero v1.0 Universal」和「Unlicense」,已將其軟體捐贈給公共領域和/或以其他方式放棄著作權及其相關權利;其餘11個「開放原始碼」存儲庫則各有其不同的授權利用條件,但至少都包含三個利用該等存儲庫開放原始碼的共同授權條款:(1)標示原作者,(2)著作權聲明,(3)適用的建議授權條款(例如:非商業化用途等)

(四) 本案原告為GitHub平台的兩位匿名用戶,自稱都曾根據平台的建議發布含有不同授權條件(例如:MIT授權證、GNU通用公共授權證3.0版等)的「開放原始碼」供公眾利用,代表自己以及其他曾經發布「開法原始碼」的不特定公眾,針對由OpenAI公司開發的Codex,和GitHub公司(於2018年10月被微軟以75億美元的價格收購)開發的Copilot產品提起本件訴訟。

(五) 微軟於2019年7月以200億美元的估值向OpenAI公司投資了10億美元,並於2020年成為OpenAI 推出的 GPT-3 語言模型專屬被授權人,據以推出ChatGPT。本件爭議的Codex和Copilot都是基於GPT-3技術進行訓練和優化的模型。「Codex」是一個程式碼生成器,可透過編寫自然語言指令,生成程式碼塊,例如整個函數、類和模塊等,而「Copilot」則是基於Codex開發的一個AI輔助程式碼編寫工具、由Codex作為其動力引擎加以運行,它可以透過學習軟體開發人員的編寫程式風格和習慣,提供程式碼自動完成和建議工具。原告在其起訴狀內主張,Codex和Copilot的訓練數據都來自於GitHub上的開放原始碼存儲庫,並各舉一例說明:兩模型生成的代碼各自與GitHub線上書籍Mastering JS中的程式碼教學範例相同,甚至產生相同的錯誤,由於Codex和Copilot無法如同人類一樣實際學習、「理解」語義和上下文,只能檢測其訓練數據在統計學上具有重要意義的模式據以生成程式碼,原告特以兩個一般人類不會犯的教學範例填空或者編碼錯誤以主張兩模型的訓練數據集經常有逐字複製GitHub公用開放原始碼加以培訓模組的情形。有趣的是,原告在本案雖然舉出兩個案例證明培訓AI模組的材料來自GitHub上「開放原始碼」存儲庫,卻未直接提出著作侵權請求,僅於起訴狀中表示:被告等利用「開放原始碼」訓練AI模組據以生成電腦程式代碼營利,卻未依公共存儲庫授權條件標示原程式碼著作權歸屬、為著作權聲明或者標示授權利用條件,違反契約,且違反美國數位千禧年著作權法(Digital Millennium Copyright Act;下簡稱DMCA)第1202(C)節關於禁止刪除或者更改「著作權利管理資訊(Copyright Management Information;下簡稱CMI)」的規範,據以請求核發禁制令及違反前述規定之法定損害賠償(初步估計為9千萬美元至9億美元之間)。原告在其起訴狀中特別指出:雖然GitHub等曾向其用戶公告,對Codex的培訓符合全球著作權法規範,對可公開接觸的材料進行機器學習模型的計算、分析和培訓,旨在透過機器學習和理解受著作權法保護的作品來造福社會、確保公共利益,因此不需要該等培訓材料作者的同意等語;顯然有意對其利用著作的行為提出「合理使用」抗辯;但原告認為違反DMCA 前述刪除或者更改「著作權利管理資訊」的規範,即沒有「合理使用」抗辯的主張餘地

三、微軟和OpenAI的抗辯

(一) 微軟和OpenAI分別於2023年一月間提出駁回原告起訴申請,強硬主張本案兩名原告不僅匿名,且雖然聲稱被告等「以前所未有的規模盜版軟體」並請求90億美元的鉅額罰款,卻有意迴避本案關於「涉案電腦程式受著作權法保護的範圍」以及「合理使用原則」有無適用的空間:不僅未具體敘明原告所享有受著作權保護的任何電腦程式內容,也並未具體舉證Copilot生成的編碼建議與原告受著作權法保護電腦程式著作的對應關係、以及Copilot是以何種方式儲存、散布或者以任何方式利用涉有著作侵權的材料;僅以 Copilot可能生成的片段建議代碼與在GitHut上的代碼有1%的比例可能相同、而未指明權利歸屬,即請求鉅額法定損害賠償,忽略了禁止刪除或者更改「CMI」的目的是為了阻止盜版,DMCA第1202(B)節因此對應規範違反者應有透過刪除或者更改「CMI」以「誘導、促成、促進或隱瞞」著作侵權行為,原告就被告是否有前述著作侵權行為既未盡其舉證責任、也並未具體說明被告等有何主動「刪除或者更改」CMI的行為、只承認Copilot沒有接受過主動識別和重製CMI的訓練,被告認為原告之訴即使僅就DMCA部分也缺乏法律理論及足夠的事實加以支持。

(二) 合理使用抗辯

微軟及OpenAI進一步根據外界的預期提出合理使用抗辯,指出:在不當刪除或者更改CMI的案件中,原告須證明因為CMI被刪除可推斷未來很有可能產生不公平的重製等著作侵權行為,本件被告等並未有任何實質可預見未來將會侵害著作權之行為,且在「甲骨文訴GoogleJava侵權案(Google LLC v. Oracle Am., Inc.)」,最高法院認為Google在其Android操作系統中使用Java程式語言的API時雖重製了大約 11,500 行代碼,但Google的使用方式是基於技術需求和互操作性之考慮所為,且對Java API進行了重新改造,使其更適合Android操作系統的需求,對Java API的市場價值亦未造成不利影響。因此, Google對Java API的使用屬於合理使用行為。另根據「作家協會訴Google圖書(Authors Guild v. Google, Inc.)」案例,Google掃描探勘數百萬冊書籍以建構線上圖書資料庫,並未讓使用者取得書籍全文、僅供關鍵字搜尋並且提供圖書部分文字摘要,讓人們更容易找到相關書籍,也經法院判決確定屬於具有高度轉化性的合理使用行為。

(三) 本案法院將於5月4日就前述兩造主張進行聽審,法院態度如何也成為全球矚目焦點。

四、本案與上週報導的「AI生成圖片涉及的著作侵權爭議」牽涉之著作侵權態樣及技術手段雖有不同,核心議題都是「大數據文本資料的挖掘和探勘」可「合理使用」的界線?此一議題並非新生課題,台灣網際網路初起之際,即曾經發生「法源法律網線上資料庫」業者認為同業建置的「月旦法學資料庫」涉及大規模重製、利用前者資料庫內容,而主張同業涉及「移除權利管理電子資訊罪」等提起著作權侵害刑事告訴之案例,最終台灣法院仍先確認該案被利用的資訊是否構成著作侵權,始進一步依著作權核心的「重製」等議題加以判決(智慧商業法院99年度刑智上更(一)字第33號刑事確定判決參照)。中、美著作權法實體規範雖略有不同,惟前述AI訓練模型電腦程式著作權爭議案之被告將爭議再聚焦於本案是否涉有著作侵權以及合理使用的議題,確是符合業界期待法院具體解決問題的走向。AI的發展預期仍將持續,此段期間的判決將有助於釐清商業化利用、著作權人之保護和公共文化科技發展間的界線。


◎ 相關報導

AI生成圖片涉及的著作侵權爭議

回列表