珍本被切脊送進訓練集

2026年8月18日 00:00
站內 AI 整理稿

亞馬遜近日被揭露一項引發爭議的作法:透過購買市面上稀缺的實體珍本書籍,直接將書脊切除後進行高速掃描,再將這些數位化內容納入人工智慧模型的訓練資料集。這些珍本因數量稀少、難以在線上取得,對大型語言模型的訓練極具價值,卻也因此面臨實體遭到物理破壞的命運。消息傳出後,出版界、文化保存團體與學術圈紛紛表達強烈不滿,擔憂此舉不僅踩踏版權紅線,更可能讓許多珍貴紙本著作在數位化過程中永久消失。科技巨頭為擴充AI訓練素材而毀損實體書,這在網路書店起家的亞馬遜身上尤其諷刺。亞馬遜最初以線上書店模式顛覆傳統出版零售,如今卻反過來將紙本書視為消耗性原料,只為了提煉其中的文字資料。

據了解,亞馬遜鎖定的是那些絕版、稀有或僅存少數實體版本的書籍,因為這些文本在網路上幾乎不存在數位版本,對訓練出更懂人類知識的AI模型來說是不可替代的「養分」。然而為了快速且高品質地數位化,亞馬遜的作業流程直接切掉書脊,使整本書變成可逐頁送入自動進紙掃描機的散頁,掃描完成後原本的裝訂結構便完全瓦解,實體書也難以恢復原狀。出版業者對這種「破壞性掃描」大感震驚。許多珍本書屬於私人收藏、大學圖書館特藏或小型出版社的最後庫存,亞馬遜透過市場或直接向賣家購買取得,但賣家往往不知道這些書最終會被拆解。業界人士指出,這不僅是技術問題,更涉及對書籍作為文化載體的尊重。

一本書的物理存在——包含紙張質感、印刷版本、裝幀設計——本身就是文化遺產的一部分,數位掃描雖能保留內容,卻無法複製實體書的歷史脈絡。當實體版本被摧毀,後人將永遠失去親手翻閱原版的機會,這對學術研究與文化傳承都是無可挽回的損失。版權爭議同樣是焦點。即使亞馬遜購買了實體書,是否就擁有將內容大規模用於商業AI訓練的權利?目前各國著作權法對於「合理使用」的界定仍多圍繞教育、研究或新聞報導,鮮少觸及以營利為目的且可能取代原創市場的AI訓練行為。部分稀有書籍的作者或版權繼承人可能根本不知道自己的作品已被掃描並餵入模型,而亞馬遜也未公開其訓練資料庫的具體書目。

法律專家警告,這種做法可能引發集體訴訟,尤其是當掃描內容涉及仍在版權保護期內的著作時。文化資產保存機構也表達高度憂慮。圖書館與檔案館在進行數位化時,通常採用不損壞原件的書本掃描機或專業翻拍設備,即便速度較慢,但能確保書籍的實體完整性。亞馬遜卻選擇了效率最高、破壞性最大的方式,凸顯科技公司在追求模型效能時,往往將文化保存視為次要考量。不少學者呼籲,應當建立科技公司使用珍稀文本的倫理規範,例如要求優先向圖書館或數位典藏機構取得授權,或是在掃描後將實體書捐贈給保存單位,而非直接丟棄。這一事件也讓外界重新審視科技巨頭在AI領域「資料饑渴」的現狀。

大型語言模型需要海量、多樣、高品質的文本才能表現良好,而實體書中蘊含的長篇論述、專業知識與文學作品,正是網路爬蟲難以取得的珍貴資源。為了填補訓練資料的缺口,亞馬遜並非唯一採取激進作法的公司。過去已有其他企業被揭露從圖書館大量借書掃描、甚至透過盜版網站下載文本。然而「買書切書」的作法格外觸動公眾神經,因為它同時觸及了消費倫理、智慧財產權與文化遺產保護等敏感議題。面對排山倒海的批評,亞馬遜目前尚未正式回應此項作法的具體細節。業界觀察人士指出,這起風波可能促使美國國會或歐盟加快對AI訓練資料來源的立法規範,要求企業揭露訓練資料的取得方式,並對稀有文化資產設定保護門檻。

與此同時,出版界與圖書館界也開始串連,呼籲書商與收藏家拒絕出售珍本給疑似用於破壞性掃描的買家,並推動建立「可數位化但不可毀損」的共識契約。科技進步與文化保存之間的矛盾並非新鮮事,但亞馬遜「切脊掃描」事件將這個衝突推向新的極點。當數位化成為無可避免的趨勢,社會必須在效率與倫理之間找到平衡:如何在確保AI發展不落後的前提下,同時守護人類文明最珍貴的紙本遺產?這不僅是亞馬遜的問題,更是整個科技時代必須共同面對的課題。

Related

相關文章

輸入主題吐出短視頻

一個名為「輸入主題吐出短視頻」的開源專案,近期在開發者社群中引發高度關注。該項目直接將大型語言模型與影片剪輯流程串接成一條龍服務,使用者只要輸入一個主題,系統就能自動完成從素材生成到最終成片的全部過程,無需手動操作剪輯軟體。 根據最新數據,該專案在 GitHub 上已累積獲得 105,989 顆星,且光是今天一天就又增加了 1,189 顆星,顯示出驚人的成長速度與社群熱度。這類自動化影片生成工具,大幅降低了短影片的製作門檻,讓沒有專業剪輯能力的創作者也能快速產出內容。

6 天前
Hugging Face Blog自然語言處理

利用Sentence Transformers的多向量(晚互動)嵌入模型

返回文章列表 利用Sentence Transformers的多向量(晚互動)嵌入模型 發佈於2026年8月18日 在GitHub上更新 讚4 Tom Aarsen tomaarsen 跟隨 Antoine Chaffin NohTow 跟隨 lightonai Raphael Sourty raphaelsty 跟隨 lightonai Sentence Transformers是一個Python函式庫,用於使用和訓練嵌入與重排序模型,應用於檢索增強生成、語義搜尋等場景。在v6.0更新中,該函式庫新增第四種模型類型:MultiVectorEncoder,可用於ColBERT風格的晚互動檢索。任何PyLate檢查點和任何Stanford-NLP ColBERT檢查點都可直接載入,而用於視覺文件檢索的colpali-engine模型也能透過你已經熟悉的同一API使用,該API原本就支援密集、稀疏與重排序模型。

6 天前

剛剛,阿里“快樂蝦米”來了!我用它給《牛來》做了個主題曲

作者 | 楊京麗 編輯 | 李水青 8月17日報道,剛剛,阿里巴巴發佈AI音樂模型HappyShrimp 1.0(快樂蝦米),該模型已在國內及海外同步上線,新用戶可享大額免費積分。HappyShrimp能夠精準理解自然語言,用戶只需描述一種情緒、一個故事或一段記憶,模型便能完成作詞、作曲、編曲和演唱。

6 天前

提示詞隱私告急

一項由印度理工學院孟買分校(IIT Bombay)與Adobe共同研發的最新技術,揭露了生成式AI領域潛在的隱私漏洞:研究團隊成功打造出一種逆向語言模型,能夠從大型語言模型的輸出內容中反向還原使用者輸入的原始提示詞。這項突破性成果意味著,即使使用者將指令提交給AI後,模型經過處理所產生的回應,仍可能被第三方透過分析模式與語意結構精確還原,進而對提示詞的保密性構成直接且嚴峻的威脅。

1 週前

人工智能怎麼能做廣告?

本文探討人工智能如何可能填補市場經濟中消費者主權的技術缺口,使消費者能夠做出更明智的購買決策。作者指出,消費者長期面臨資訊不足、判斷困難等五重障礙,而大語言模型的推薦能力有望系統性地解決這些問題,從而讓消費者主權首次成為技術現實。

1 週前