一枚硬幣大小的蘋果 AirTag 追蹤器,揭開了現代科技文明最弔詭的暗面。根據外媒 404 Media 的深度調查,包含亞馬遜在內的多家科技巨頭,正透過隱密的供應鏈大規模收購實體珍稀書籍,將它們送入內華達州一座代號「LAS8」的秘密倉庫,進行一場不為人知的「毀書儀式」——切斷書脊、高速掃描、榨取文字,然後當成廢紙丟棄。這些人類文明的實體結晶,最終淪為訓練大語言模型的「數據飼料」。
AirTag 的跨州追蹤:通往拉斯維加斯東北部的神秘「LAS8」
這起調查的起點,源自 404 Media 與一位珍稀書籍賣家的合作。調查人員在一批多達 1,000 本珍貴藏書的交易中,將一枚 AirTag 巧妙藏在其中一本書的夾層,展開為期數週的物流追蹤。訊號顯示,這批文獻從加州出發,途經密爾瓦基、科羅拉多州的大章克申,最終定位在拉斯維加斯東北部、亞馬遜對外宣稱負責「按需印刷(Print-on-Demand)」服務的「LAS8」大型物流倉庫。
但在倉庫內部一個名為「VGT3」的管制區域,進行的卻是完全相反的破壞性作業。根據調查團隊掌握的現場描述,工作人員以專業切紙設備切斷書脊(Debinding),將書籍解體為零散紙頁,再送入工業級高速進紙掃描儀,短時間內將文字轉為純文字數據。這套流程的效率極高,但目的並非數位化典藏,更非為了提供大眾查閱——這些被轉化的文字,直接灌入大語言模型的底層資料集,一旦價值榨乾,實體殘骸便直接銷毀。
編輯觀點: 從產業面來看,這起事件與其說是亞馬遜的「祕密罪行」,不如說它揭開了 AI 競賽中一塊長期被忽略的巨大陰影。我們總在討論 AI 的偏見、幻覺與倫理問題,卻很少正視訓練資料的「實體來源」正在被消耗。法律上,這種行為目前被歸類在「合理使用」(Fair Use)的灰色地帶,因為企業沒有將掃描內容公開販售。但問題在於,當法律僅以「是否公開營利」作為判準,實體書籍作為文化載體的稀缺性與不可替代性,就被徹底邊緣化了。這些絕版書的消失,是無法用數位備份來彌補的——因為它們作為「物件」的歷史意義與版本價值,已經在切紙機下灰飛煙滅。
為何非得「毀書取字」?AI 資料荒下的模型崩潰危機
科技巨頭會採取這種極端手段,核心原因在於當前 AI 產業正面臨嚴重的「資料荒」。當網路上充斥大量由 AI 生成的合成內容,開發商發現,若持續以這些「數位近親繁殖」的資料來訓練模型,會引發所謂的 「模型崩潰(Model Collapse)」效應——模型的輸出會日益同質化、平庸化,甚至喪失邏輯推理能力。同時,合成資料也會放大 AI 的「幻覺(Hallucination)」問題,讓錯誤資訊在遞迴訓練中被強化為虛假的事實基準。
為了突破這層瓶頸,開發商需要海量真實、未經 AI 污染的原創內容。尚未被數位化的古老實體書籍,因此成了 AI 軍備競賽中最頂級的「未污染黃金礦脈」。說穿了,這不是對知識的致敬,而是對原創性的掠奪——只是這種掠奪被包裹在「技術進步」的合法外衣下。事實上,採用類似策略的不只亞馬遜,包含知名 AI 獨角獸 Anthropic 在內的多家大型研發機構,也早已加入搶購實體書籍的行列。
合法但難以認同:合理使用條款下的文化滅絕風險
法律上,美國法院目前的判例傾向認定此類操作屬於「合理使用」範疇,前提是企業沒有將數位化副本公開發行或轉售牟利,僅作為訓練演算法的內部參數分析。但這條法律防線,顯然無法平息文化界的巨大焦慮。文史學者與藏書家警告,實體書籍的存量是有限的,特別是那些存世量本就稀少的絕版書與地方文獻,極可能在這場「先拆書、後銷毀」的 AI 競賽中,徹底在物理世界絕跡。
這背後有一個被忽略的現實:數位備份不等於實體保存。一本 17 世紀的手稿,其紙質、裝幀、藏書印、眉批註記,都是獨一無二的歷史切片。當它們被切斷書脊、送入碎紙機,我們失去的不只是文字內容,還有那些無法被 OCR 辨識的物質性線索。這不是數位典藏能彌補的損失,這是文明層級的檔案浩劫。
當知識的載體被當成燃料,我們該如何看待「進步」?
亞馬遜的「LAS8」倉庫不是單一個案,而是 AI 時代資源掠奪邏輯的極致展現。在這套邏輯中,書籍不是用來閱讀的,而是用來「開採」的。它的內容被視為一種可提取的原料,提取完畢後,載體就失去了存在的必要。這種思維與其說是技術創新,不如說是一種對文化資產的「榨取式經濟」。
但我們不能只把矛頭指向亞馬遜或 Anthropic。真正值得反思的是,作為消費者的我們,是否也在無形中接受了這種價值觀?當我們習慣於 AI 隨叫隨到的便利,習慣於忽略那些「資料來源」的背後故事,我們其實正在默許一場無聲的文化拆除工程。話說回來,如果連人類最精緻的智慧結晶都只能以「被肢解」的方式進入 AI 的訓練集,那我們追求的人工智慧,究竟是在複製人類的知識,還是在摧毀人類的記憶?
下一步,你可以這樣做: 關注公開的書籍捐贈與二手書流向,支持在地獨立書店與文史典藏單位的數位化保存計畫,並在能力範圍內,拒絕支持那些對實體文化資產缺乏透明度的科技服務。知識不該只是演算法的燃料,它值得被當作一種需要被捍衛的存在。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
亞馬遜銷毀珍稀書籍的行為是否違法?
目前美國司法判例傾向認定此類操作屬於「合理使用(Fair Use)」範疇,因為企業未將掃描內容公開販售,僅作為內部演算法訓練資料,因此不構成侵權。
什麼是 AI 模型的「模型崩潰(Model Collapse)」?
模型崩潰是指當 AI 反覆使用由其他 AI 生成的合成資料進行訓練時,輸出內容會逐漸喪失多樣性與邏輯推理能力,變得同質化且平庸的技術現象。
被數位化的珍稀書籍內容會公開給大眾查閱嗎?
不會。這些書籍被掃描後僅作為訓練大語言模型的底層數據,不會上架公開借閱,也不會製作為 PDF 或電子書版本,實體書籍隨後即被銷毀。
除了亞馬遜,還有哪些公司採用類似做法?
根據調查,包含知名 AI 獨角獸 Anthropic 在內的多家大型商業 AI 研發機構,也已加入搶購實體書籍並進行內部訓練的行列。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。