根據美國加州北區聯邦法院的最新判決,人工智慧公司 Anthropic 被控使用盜版書籍訓練其大型語言模型 Claude,最終同意支付 15 億美元的和解金。這起訴訟揭露了 Anthropic 從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載數百萬本未經授權書籍,並建立了一個永久保存的中央圖書館。
盜版書籍的數量與來源
根據訴訟文件,Anthropic 從 2021 年開始,先是从創世紀圖書館(Library Genesis)下載了 196,640 本未經授權的書籍,隨后又从 LibGen 下載了至少 500 萬本,2022 年再取得至少 200 萬本內容,累計超過 700 萬本來自盜版網站的書籍。這些書籍被用於訓練 Claude 模型,且 Anthropic 內部清楚這些資料可能帶來法律風險,但仍選擇保留並使用。
合法與盜版的界限
據法院判決,Anthropic 在建立 AI 訓練資料時,曾試圖取得合法內容,甚至提出建立「世界上所有書籍」資料庫的構想,但因授權結果不如預期,轉而採取購買大量紙本書的方式。Anthropic 投入數百萬美元購買紙本書,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔,銷毀原書。法院認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,仍可構成合理使用。然而,來自盜版網站的 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍。
從產業面來看,這起訴訟不僅揭示了 AI 公司在追求技術進步時可能觸犯的法律紅線,也提醒了其他公司在資料獲取過程中必須更加審慎。盜版書籍的使用不僅侵犯著作權,還可能對公司的聲譽造成嚴重影響。
數據背後的啟示
這起訴訟凸顯了全球 AI 發展中對內容著作權保護的重視。隨著 AI 技術的快速發展,如何在創新與法律之間找到平衡,成為行業內的一個重要課題。 Anthropic 的案例為其他 AI 公司敲響了警鐘,提示他們在資料獲取和使用過程中必須遵守相關法律法規,以避免不必要的法律糾紛。
行動呼籲
對於讀者來說,這起訴訟不僅是一則新聞,更是一次反思的機會。在享受 AI 技術帶來的便利時,我們也應關注其背後的法律和道德問題。如果您是內容創作者或科技公司的工作人員,建議您深入了解相關法律法規,確保自己的行為符合法律要求。
本文改寫整理自公開新聞來源,原始報導由自由時報發布。
常見問題 FAQ
Anthropic 为什么要使用盗版书籍训练 AI 模型?
Anthropic 使用盗版书籍是因为未能获得足够的合法授权内容,希望通过大量数据提高 AI 模型的性能。
这起诉讼的结果是什么?
Anthropic 同意支付 15 億美元的和解金,并停止使用盗版书籍。
法院是如何判断 Anthropic 的行为是否合理使用的?
法院认为,如果公司合法购买纸本书并进行一对一数字化用于 AI 训练,即使纸质书被销毁,仍可构成合理使用。但使用盗版网站下载的书籍并建立永久保存的中央图书馆,则超出了合理使用范围。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。