📌 本文重點
- 稀有書正被當成可消耗的 AI 訓練燃料
- AI 公司毀書掃描,公共與學術系統幾乎無法介入
- 法規與監管忽略了「為訓練 AI 而毀書」的文化風險
- 開發者與使用者可以用技術與選擇阻止文化被黑箱吞噬
AI 公司掃描稀有書、毀掉實體館藏,不只是「技術細節」,而是正在改寫誰有權決定人類知識如何被保存與毀棄。在算力和數據被視為新基礎建設的年代,如果文化保存不被視為同等重要的基礎建設,下一代回頭看 2020s,很可能只會看到一片被模型吃掉、卻無從考證的知識黑洞。
一、稀有書正在變成「可計價燃料」,而不是公共記憶
這一連串調查指向同一個不舒服的事實:AI 公司已經在物理層面「拆書」取數據。
- 404 Media 用 AirTag 追蹤一批稀有書,最後發現終點是亞馬遜(Amazon)AI 訓練設施。
- The Decoder 更直接揭露:Amazon 大量購買印刷書,掃描後在過程中銷毀實體本。
- TechCrunch 報導指出,稀有書對 LLM 特別有價值,因為模型已經把網路文本吃得差不多了。
💡 關鍵: 稀有書一旦被視為可耗盡的訓練燃料,企業就有系統性毀書的經濟動機,而公共記憶卻沒有被計入成本。
這些片段串起來,就是一條新的產業邏輯:
- 大模型已吃完「開放網路」:Common Crawl、維基百科、開放論文庫已經是所有主流模型的標配,差異性變低。
- 下一步的競爭優勢,來自「稀缺數據」:未上網的冷門專著、地方志、技術手冊、灰色文獻,成為模型差異化的秘密武器。
- 在算力與時間壓力下,「拆書掃描」比「精緻保存」更符合企業 KPI:
- 一次性買斷、拆書、工業化掃描 → 資料直接進 ML pipeline。
- 書的狀態、保存品質,不影響模型的 loss,只影響文化的損失。
當稀有書被視為可計價的訓練燃料,它在企業眼中是「可消耗資源」,而不是「不可替代的公共記憶」。這就是我們必須警惕的:AI 產業現在有動機,也有資本,去「吞掉」圖書館裡最稀有的那一層知識。
二、圖書館與學者的失語:資料掠奪如何變成「默許常態」
更令人不安的不是 Amazon 做了什麼,而是公共與學術系統幾乎沒有發聲權。
1. 図書館被繞過,文化保護被視為「流程阻力」
現行館藏制度假設的是:
- 書在館內,透過借閱、影印、有限度數位化,慢慢流通;
- 稀有本的任何處置,需要館方、捐贈人、甚至文化部門同意。
但現在的路徑變成:
- 稀有書先透過二手市場、清倉、甚至館藏汰舊流入商業渠道;
- AI 公司以「合法購買」之名取得實體,再在封閉設施內決定命運;
- 圖書館、研究者、原持有者,完全不知道這批文獻之後被如何處置。
以 Anna’s Archive 的呼籲為例,作者不得不以「在 AI 公司毀掉之前,先盡快掃描保存」作為行動口號,這本身就暴露了權力結構:
現在是民間志工在搶時間,跟算力巨頭「賽跑」,看誰先把書變成位元。
2. 學術界的尷尬:想用好數據,又害怕失去實體
對研究者而言,稀有文獻數位化本來是好事:
- 跨國、跨學門共享:不必飛去某個小鎮圖書館查一冊地方志。
- 可機器分析:文本可被 NLP、歷史語料庫、數位人文工具重複利用。
問題是,現階段的數位化是由企業主導、模型優化導向,不是「公共數位典藏導向」:
- 掃描的優先順序由「對模型有利」決定,而非「對學術與文化有利」。
- 檔案格式、清洗策略、甚至是否保留原始影像,都只對內優化 ML pipeline。
- 學術界最後拿到的,可能只是被模型不可逆地「消化過」的摘要與輸出,而不是原始文獻。
文化記憶的核心問題在於可考性:當實體書被銷毀,而掃描檔被鎖在 Amazon 的私有 S3 上,我們失去的不只是紙,而是未來任何人驗證某段知識來源與脈絡的能力。這種損失是不可逆、也無法靠「模型回答問題」補回。
三、法規完全沒準備好:我們從未想過「為訓練 AI 而毀書」
法律上,這個場景幾乎是空白地帶:
- 著作權法只管「複製與利用」,不管「實體銷毀」:
- 只要企業合法購買書籍,自行拆解、掃描、銷毀,通常不觸及著作權的紅線;
-
用來訓練模型,只要輸出不明顯「逐字抄襲」,目前多數法域仍屬灰色。
-
文化資產保護法門檻過高:
- 真正被列為「文物」、「古蹟」的只是一小撮,絕大多數 20 世紀專業書、地方志、技術手冊都不在保護清單上;
-
但對歷史學、科技史、社會學而言,常常是這些「非文物級」的材料最關鍵。
-
監管仍停留在「AI 內容風險」,沒看到「AI 訓練前的文化風險」:
- 大家在談深偽、AI 詐騙、模型偏見,卻極少把「文化保存」納入 AI 監管架構;
- 現狀等於默許企業在文化資產層面自由行動,只要後續不做違法用途即可。
我認為,這是一個需要制度性翻轉的時刻:
稀有文獻的數位化與開放治理,應被視為 AI 時代的公共基礎建設,而不是交給單一平台暗中操作。
具體可以怎麼做?至少有三個方向:
- 公共數位館藏基金:由政府、研究機構與民間資金共同出資,優先購買與數位化危險中的稀有書,並以開放授權釋出掃描檔與文本。
- 「毀書前通報」制度:對一定年代與稀有度以上的出版品,如果要大量銷毀或拆解,須向公共文化機構通報,給公部門或圖書館優先收購或數位保存權。
- 模型訓練透明義務:
- 對超大規模模型,要求申報受保護文獻類型的使用比例與取得方式;
- 對使用稀有文獻訓練的部分,強制要求在合理時間後將原始掃描檔(非 processed corpus)
交付公共典藏機構保存。
💡 關鍵: 一旦把稀有文獻的數位化視為公共基礎建設,就能用制度迫使 AI 企業將掃描成果回流公共典藏,而不是永久鎖在私有雲端。
這些設計不是在「卡 AI」,而是在承認:既然算力與數據已被視為基礎建設,就不能讓文化保存變成基礎建設的外部性。
四、給開發者與使用者的行動建議:不要當文化毀滅的共犯
如果你是開發者或技術決策者,現在可以做的不是「道德焦慮」,而是具體把文化保存寫進技術與商業選擇:
- 問清楚你的訓練數據從哪裡來:遇到「私有稀有 corpus」「獨家紙本掃描」這類賣點,請直接問一句:實體文獻是否被保存?掃描檔是否會公開或交付公共機構?
- 在技術架構中預留「公共回饋」機制:
- 例如把自家掃描 pipeline 的一部分輸出,固定捐贈給開放典藏計畫;
- 或在合約中加入條款:訓練完成後,掃描檔可在不影響商業機密的前提下分級開放。
- 作為使用者,優先支持「不毀書的 AI」:
- 當你選擇模型與雲端服務時,把「文化與數據倫理政策」列為評估指標之一;
- 對於被揭露有系統性拆書、銷毀稀有文獻而拒絕改善的公司,直接用錢投票,減少依賴。
我們已經接受「AI 需要大量數據」這個產業共識,但下一步要補上的,是另一個更重要的共識:
任何模型都不值得用不可替代的文化記憶去換。
如果我們現在不把文化保存視為 AI 時代的基礎建設之一,任由稀有書在黑箱裡被掃描、被銷毀,那麼當下一代試圖理解 2020s 的思想、技術與社會,他們打開的可能只剩下模型輸出的二手敘事,而再也找不到原文獻留下的細節與歧義。那不是進步,那是文明自己按下的刪除鍵。
🚀 你現在可以做的事
- 實際去查詢你所使用的模型或雲端服務的「訓練數據來源與文化保存政策」,並記錄回覆內容
- 支持或捐款給像
Anna’s Archive等開放典藏/掃描保存計畫,幫助民間掃描在毀書前完成保存- 在團隊或公司內部提出「不毀書的 AI」準則,將稀有文獻保存與掃描成果回流公共機構寫入採購與技術選型標準

