IT之家生成式AI

AI 公司被曝大量收購舊書,以獲取“純淨”訓練素材

2026年7月28日 19:22
AI 公司被曝大量收購舊書,以獲取“純淨”訓練素材

重點摘要

AI 公司為獲取高品質、未受 AI 生成內容汙染的訓練數據,透過中間商大規模收購二手圖書,甚至不惜拆毀書籍進行掃描數位化。Anthropic 等公司已投入數百萬美元購買紙本書籍,但此舉引發倫理爭議,因為稀有書籍可能被破壞,且數位化內容僅供 AI 訓練,公眾無法存取。

站內 AI 整理稿

AI 公司近年來對高品質訓練資料的需求持續攀升,但隨著網路上由 AI 生成的低品質內容迅速擴散,傳統的網路爬蟲已難以提供可靠的學習素材。根據調查媒體 404 Media 的最新報導,多家 AI 公司正透過中間商大規模收購二手紙本書籍,目的是取得未被 AI 內容污染的「純淨」人類創作,作為訓練新一代模型的基礎,同時也能避免直接從網路公開資料庫擷取時可能引發的公眾反彈。 這波收購行動並非突然出現。事實上,AI 公司利用紙本書籍訓練模型已有前例可循。以目前捲入多起版權訴訟的 Anthropic 為例,該公司曾投入數百萬美元向二手書商 Better World Books 大量採購紙本書籍,隨後將這些書籍進行數位化掃描,用於訓練其 Claude 系列 AI 模型,並在完成後將實體書銷毀。法院在相關訴訟中雖認定,將正版圖書用於 AI 訓練屬於版權法中的「合理使用」,但 Anthropic 因長期保存一個內含 700 萬本盜版圖書的數據庫,侵犯了作者與出版商的權益,最終被判賠償高達 15 億美元(約合新台幣 450 億元)。 類似爭議也發生在 Google 身上。近期,一個出版商聯盟已對 Google 提起訴訟,指控其未經授權使用數百萬本受版權保護的圖書,用來訓練其 Gemini AI 模型。這些案例凸顯出,AI 公司在取得高品質文字資料時,正面臨越來越嚴格的版權審查與公眾壓力。 為了因應 AI 產業對紙本書籍的龐大需求,專門提供全球圖書目錄資訊的線上資料庫 ISBNdb 也開始調整業務方向。ISBNdb 原本是書商、圖書館與發行商查詢超過 1.11 億本圖書資訊的重要平台,如今則推出專門鎖定 AI 企業的大規模圖書採購服務。根據 404 Media 取得的資訊,這類訂單的規模差異極大,從一次採購 1,000 本到一次採購 100 萬本都有。 這股採購熱潮也直接反映在二手書市場的銷售數據上。一位不願具名的職業書商向媒體透露,自今年 4 月以來,圖書銷量出現了前所未有的增長。過去生意較好時,一週只能賣出約 20 本書;但在近幾個月,每週銷量已飆升至數百本,成長幅度約為平時的五倍。同樣的現象也在 Alibris、Biblio 等二手書交易平台上的其他書商身上出現,許多賣家都表示接到大量異常訂單。 雖然目前沒有直接證據證明這些採購行為全部來自 ISBNdb 或特定的 AI 公司,但種種跡象顯示其中存在不尋常的模式。例如,這些大規模採購的對象幾乎全部都是帶有國際標準書號(ISBN)的書籍,這組 13 位數字的編碼是全球圖書唯一識別標識。此外,買家對書籍的主題、類型或作者幾乎沒有任何偏好,無論是小說、教科書還是專業書籍都在採購範圍內。更令人訝異的是,買家似乎完全不在意價格,即使部分圖書明顯高於市場行情,仍會直接下單購買。 在 Anthropic 的版權訴訟過程中,曾參與 Google Books 計畫、後來主導 Anthropic 內部名為「巴拿馬計畫(Project Panama)」數位化項目的湯姆·哈維(Tom Harvey)證實,該公司曾聘請多家專業文件掃描公司對紙本書籍進行數位化處理。其中一家合作夥伴是 Datamation Information Services,這家公司提供兩種掃描服務:非破壞性掃描與破壞性掃描。非破壞性掃描通常使用俯拍掃描儀、平板掃描儀或 V 型掃描設備,在不拆解書本的情況下完成數位化。而破壞性掃描則直接將書籍拆開,把每一頁送入高速工業掃描儀進行處理。由於破壞性掃描效率更高、成本更低,AI 公司普遍選擇這種方式,最終導致數百萬本紙本書籍被拆毀。 紙本書籍對 AI 訓練而言確實是一座巨大的知識寶庫,但這種做法也引發了越來越多的倫理爭議。批評者指出,目前並不清楚 AI 公司在進行數位化時,是否會區分普通圖書與珍貴圖書、絕版圖書。如果這些稀有書籍被拆毀,它們可能將永久退出流通,後代將無法再接觸到這些實體版本。此外,另一個更大的問題在於,這些掃描後的內容最終都會進入 AI 公司的私有數據庫,僅用於訓練模型,而一般公眾無法存取。這意味著,人們或許能夠獲得越來越聰明的 AI,但代價可能是人類大量積累的知識資源,將不再以公開、可取得的形式留給未來世代。

Related

相關文章

他讓GPT-5.6 Sol連跑33小時攻關費馬大定理,被系統強制終止

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
智東西生成式AI

不止Kimi K3,北京AI正在補上Action拼圖

北京AI企業月之暗面的Kimi K3與千尋智能的Spirit v1.6分別在數字智能與物理智能領域取得全球領先突破,前者在編程榜超越閉源模型,後者於具身智能榜單登頂。兩家公司均選擇底層技術自研路線,並透過開源策略展現自信,共同勾勒出北京AI從數字空間走向物理世界的完整創新版圖。

剛剛
IT之家生成式AI

拒絕模仿在世作家文筆,OpenAI 悄悄為 ChatGPT 增加限制

首頁 > 智能時代>人工智能 拒絕模仿在世作家文筆,OpenAI 悄悄為 ChatGPT 增加限制 2026/7/28 19:11:25 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 7 月 28 日消息,據科技媒體 Android Authority 今天報道,OpenAI 最近悄悄更新 ChatGPT。當用戶要求按某位在世作家文筆仿寫作品時,AI 會直接拒絕。

剛剛

湯臣倍健,悄悄投了AI半壁江山

# 湯臣倍健,悄悄投了AI半壁江山 一家保健品公司,成了梁文鋒和楊植麟的共同點。 2026年最魔幻的商業敘事之一,是保健品龍頭湯臣倍健成了中國AI大模型賽道最活躍的跨界玩家。從DeepSeek到月之暗面,從階躍星辰到兩家硬科技芯片公司,這家賣蛋白粉的企業在短短數月內合計投入約4.5億元,精準押中了多家頭部AI公司。 ## 一場意外的估值曝光 DeepSeek成立以來從未公開披露具體融資估值,市場傳聞從2000億到5000億滿天飛。結果捅破這層窗戶紙的,是兩家A股公司——賣箱包的開潤股份,以及賣保健品的湯臣倍健。

剛剛

硅谷開始在大模型上“消費降級”了

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦浙江最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作硅谷開始在大模型上“消費降級”了硅基星芒·2026年07月28日 17:35從炫耀性消費到算計性生存 2026年7月24日,《華爾街日報》一篇報道的標題平淡無奇,內容卻是一道分水嶺:美國企業界正在集體停止在大模型調用上燒錢。 過去兩年,企業以“Token最大化”為榮。內部排行榜上,誰的API調用費用最高,誰就是數字化轉型的急先鋒。如今這套敘事被徹底翻轉,省錢成了新信仰,節儉成了新美德。 Cursor這家即將被馬斯克以600億美元收購的公司,為這場運動發明瞭一個精準的詞:tokenomics,Token經濟學。它的前投資銀行家、現任現場首席技術官Mike Saeks用一個比喻道破了這場轉向的核心:“用最強大的模型處理日常任務,就像開著蘭博基尼去雜貨店買牛奶,那車是為了賽道而生的。” 種種跡象證明,這不是一句俏皮話,它是對過去兩年AI泡沫敘事的清算的開始。 從炫耀性消費到算計性生存 這場轉向的速度之快,連最敏銳的觀察者都措手不及。 幾個月前,企業還在攀比誰的AI賬單更嚇人。Token最大化是一個充滿硅谷氣質的詞:把浪費包裝成進取,把燒錢曲解為信仰。那時的邏輯是,用得越多意味著AI化越徹底,花得越狠意味著技術領先越明顯。

剛剛