IT之家生成式AI

AI 公司被曝大量收購舊書,以獲取“純淨”訓練素材

2026年7月28日 19:22
AI 公司被曝大量收購舊書,以獲取“純淨”訓練素材

重點摘要

AI 公司為獲取高品質、未受 AI 生成內容汙染的訓練數據,透過中間商大規模收購二手圖書,甚至不惜拆毀書籍進行掃描數位化。Anthropic 等公司已投入數百萬美元購買紙本書籍,但此舉引發倫理爭議,因為稀有書籍可能被破壞,且數位化內容僅供 AI 訓練,公眾無法存取。

站內 AI 整理稿

AI 公司近年來對高品質訓練資料的需求持續攀升,但隨著網路上由 AI 生成的低品質內容迅速擴散,傳統的網路爬蟲已難以提供可靠的學習素材。根據調查媒體 404 Media 的最新報導,多家 AI 公司正透過中間商大規模收購二手紙本書籍,目的是取得未被 AI 內容污染的「純淨」人類創作,作為訓練新一代模型的基礎,同時也能避免直接從網路公開資料庫擷取時可能引發的公眾反彈。這波收購行動並非突然出現。事實上,AI 公司利用紙本書籍訓練模型已有前例可循。

以目前捲入多起版權訴訟的 Anthropic 為例,該公司曾投入數百萬美元向二手書商 Better World Books 大量採購紙本書籍,隨後將這些書籍進行數位化掃描,用於訓練其 Claude 系列 AI 模型,並在完成後將實體書銷毀。法院在相關訴訟中雖認定,將正版圖書用於 AI 訓練屬於版權法中的「合理使用」,但 Anthropic 因長期保存一個內含 700 萬本盜版圖書的數據庫,侵犯了作者與出版商的權益,最終被判賠償高達 15 億美元(約合新台幣 450 億元)。類似爭議也發生在 Google 身上。

近期,一個出版商聯盟已對 Google 提起訴訟,指控其未經授權使用數百萬本受版權保護的圖書,用來訓練其 Gemini AI 模型。這些案例凸顯出,AI 公司在取得高品質文字資料時,正面臨越來越嚴格的版權審查與公眾壓力。為了因應 AI 產業對紙本書籍的龐大需求,專門提供全球圖書目錄資訊的線上資料庫 ISBNdb 也開始調整業務方向。ISBNdb 原本是書商、圖書館與發行商查詢超過 1.11 億本圖書資訊的重要平台,如今則推出專門鎖定 AI 企業的大規模圖書採購服務。根據 404 Media 取得的資訊,這類訂單的規模差異極大,從一次採購 1,000 本到一次採購 100 萬本都有。

這股採購熱潮也直接反映在二手書市場的銷售數據上。一位不願具名的職業書商向媒體透露,自今年 4 月以來,圖書銷量出現了前所未有的增長。過去生意較好時,一週只能賣出約 20 本書;但在近幾個月,每週銷量已飆升至數百本,成長幅度約為平時的五倍。同樣的現象也在 Alibris、Biblio 等二手書交易平台上的其他書商身上出現,許多賣家都表示接到大量異常訂單。雖然目前沒有直接證據證明這些採購行為全部來自 ISBNdb 或特定的 AI 公司,但種種跡象顯示其中存在不尋常的模式。例如,這些大規模採購的對象幾乎全部都是帶有國際標準書號(ISBN)的書籍,這組 13 位數字的編碼是全球圖書唯一識別標識。

此外,買家對書籍的主題、類型或作者幾乎沒有任何偏好,無論是小說、教科書還是專業書籍都在採購範圍內。更令人訝異的是,買家似乎完全不在意價格,即使部分圖書明顯高於市場行情,仍會直接下單購買。在 Anthropic 的版權訴訟過程中,曾參與 Google Books 計畫、後來主導 Anthropic 內部名為「巴拿馬計畫(Project Panama)」數位化項目的湯姆·哈維(Tom Harvey)證實,該公司曾聘請多家專業文件掃描公司對紙本書籍進行數位化處理。其中一家合作夥伴是 Datamation Information Services,這家公司提供兩種掃描服務:非破壞性掃描與破壞性掃描。

非破壞性掃描通常使用俯拍掃描儀、平板掃描儀或 V 型掃描設備,在不拆解書本的情況下完成數位化。而破壞性掃描則直接將書籍拆開,把每一頁送入高速工業掃描儀進行處理。由於破壞性掃描效率更高、成本更低,AI 公司普遍選擇這種方式,最終導致數百萬本紙本書籍被拆毀。紙本書籍對 AI 訓練而言確實是一座巨大的知識寶庫,但這種做法也引發了越來越多的倫理爭議。批評者指出,目前並不清楚 AI 公司在進行數位化時,是否會區分普通圖書與珍貴圖書、絕版圖書。如果這些稀有書籍被拆毀,它們可能將永久退出流通,後代將無法再接觸到這些實體版本。

此外,另一個更大的問題在於,這些掃描後的內容最終都會進入 AI 公司的私有數據庫,僅用於訓練模型,而一般公眾無法存取。這意味著,人們或許能夠獲得越來越聰明的 AI,但代價可能是人類大量積累的知識資源,將不再以公開、可取得的形式留給未來世代。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

33 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前