Anthropic 15 億賠償案:盜版書籍訓練 AI 模型的代價

根據美國加州北區聯邦法院的最新判決,人工智慧公司 Anthropic 被控使用盜版書籍訓練其大型語言模型 Claude,最終同意支付 15 億美元的和解金。這起訴訟揭露了 Anthropic 從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載數百萬本未經授權書籍,…

根據美國加州北區聯邦法院的最新判決,人工智慧公司 Anthropic 被控使用盜版書籍訓練其大型語言模型 Claude,最終同意支付 15 億美元的和解金。這起訴訟揭露了 Anthropic 從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載數百萬本未經授權書籍,並建立了一個永久保存的中央圖書館。

盜版書籍的數量與來源

根據訴訟文件,Anthropic 從 2021 年開始,先是从創世紀圖書館(Library Genesis)下載了 196,640 本未經授權的書籍,隨后又从 LibGen 下載了至少 500 萬本,2022 年再取得至少 200 萬本內容,累計超過 700 萬本來自盜版網站的書籍。這些書籍被用於訓練 Claude 模型,且 Anthropic 內部清楚這些資料可能帶來法律風險,但仍選擇保留並使用。

合法與盜版的界限

據法院判決,Anthropic 在建立 AI 訓練資料時,曾試圖取得合法內容,甚至提出建立「世界上所有書籍」資料庫的構想,但因授權結果不如預期,轉而採取購買大量紙本書的方式。Anthropic 投入數百萬美元購買紙本書,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔,銷毀原書。法院認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,仍可構成合理使用。然而,來自盜版網站的 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍。

從產業面來看,這起訴訟不僅揭示了 AI 公司在追求技術進步時可能觸犯的法律紅線,也提醒了其他公司在資料獲取過程中必須更加審慎。盜版書籍的使用不僅侵犯著作權,還可能對公司的聲譽造成嚴重影響。

數據背後的啟示

這起訴訟凸顯了全球 AI 發展中對內容著作權保護的重視。隨著 AI 技術的快速發展,如何在創新與法律之間找到平衡,成為行業內的一個重要課題。 Anthropic 的案例為其他 AI 公司敲響了警鐘,提示他們在資料獲取和使用過程中必須遵守相關法律法規,以避免不必要的法律糾紛。

行動呼籲

對於讀者來說,這起訴訟不僅是一則新聞,更是一次反思的機會。在享受 AI 技術帶來的便利時,我們也應關注其背後的法律和道德問題。如果您是內容創作者或科技公司的工作人員,建議您深入了解相關法律法規,確保自己的行為符合法律要求。

本文改寫整理自公開新聞來源,原始報導由自由時報發布。

常見問題 FAQ

Anthropic 为什么要使用盗版书籍训练 AI 模型?

Anthropic 使用盗版书籍是因为未能获得足够的合法授权内容,希望通过大量数据提高 AI 模型的性能。

这起诉讼的结果是什么?

Anthropic 同意支付 15 億美元的和解金,并停止使用盗版书籍。

法院是如何判断 Anthropic 的行为是否合理使用的?

法院认为,如果公司合法购买纸本书并进行一对一数字化用于 AI 训练,即使纸质书被销毁,仍可构成合理使用。但使用盗版网站下载的书籍并建立永久保存的中央图书馆,则超出了合理使用范围。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。