偷書要賠15億美元,AI巨頭燒幾百萬本書反而合法了

藍字計劃2026.08.24 18:01 · 來自廣東全文4120字00:00 / 11:49只要能訓練出更好的大模型,究竟要銷燬多少本實體書,甚至在實體書之外還會消耗多少前AI時代的“資產”,也許就再也沒人關心了。文 | 藍字計劃,作者|Chester一場現代版的“焚書”,正在美國發生。最近幾年,美國二手書市場出現了一個奇怪現象:不少神秘買家,一次性採購成百上千本書,不挑書、不問價,甚至連冷門舊書都照買不誤。隨著電子閱讀的普及,現在還有多少人看實體書?更別說這種成百上千的掃貨始買書。書商們自然也開始好奇:究竟是誰在買走這批書?最近,美國科技媒體404 Media聯繫到一名二手書商。
對方剛剛通過書籍交易平臺Biblio,接到了一筆大約1000本舊書的訂單,其中還包括不少稀有、絕版和具有收藏價值的書。為了找出背後的買家,404 Media把一枚AirTag塞進其中一本書裡,然後一路追蹤。最終,這本書被送進了亞馬遜位於拉斯維加斯的一家倉庫。據404 Media調查,這些書到了亞馬遜倉庫後,命運卻只有三步:切掉書脊、批量掃描、然後扔進碎紙機。負責這項工作的VGT3團隊,甚至還給自己設計了一個頗為應景的Logo:一隻露著牙齒、手裡抓著書的霸王龍。自己也賣書的亞馬遜卻幹起了銷燬實體書的活已經夠驚奇了,但更驚奇的是同樣這樣乾的,不只有亞馬遜。
在更早之前,Anthropic就被曝光過一個代號為“巴拿馬計劃”的秘密項目。他們的目標,是把全世界的書都“破壞性掃描”一遍。在大約一年時間裡,Anthropic為此花費數千萬美元,買下數百萬本實體書,然後切掉書脊、掃描內容,再把剩下的紙張送去回收。美國的AI大公司,怎麼就和舊書幹上了?互聯網內容,不夠AI用了AI公司瘋狂買二手書,其實是想買下書裡的內容和數據。過去,互聯網是大模型最方便的數據來源。新聞、論壇、百科、博客,抓下來就能拿去訓練,成本低,數量還大。但經過這麼多年的反覆抓取,網上那些容易找到、質量較高的內容,早就被各家AI公司吃得差不多了。
更麻煩的是,互聯網裡開始混入越來越多由AI生成的文章。2024年,《Nature》發表的一項研究就發現,如果下一代模型不斷使用上一代模型生成的內容進行訓練,可能出現所謂的“模型坍縮”:模型會逐漸丟失原始數據中的信息,尤其是那些不常見、但真實存在的內容。最後,它生成的東西越來越單一,甚至開始胡言亂語。因此,真正由人類生產的數據,也開始變得越來越珍貴。而那些出版於幾十年前的舊書,不僅完全不存在使用AI生成的內容,其中還有大量冷門專業書和小眾著作,至今沒有被完整數字化。
此外,相比互聯網上隨手抓來的帖子和營銷文章,正式出版的書籍至少經過了一套完整的寫作與編輯流程,經過了作者、編輯、出版社等多層審核,內容質量有保證多了。後來公開的Anthropic內部文件就顯示,早在2023年,公司內部就有人提出,書籍可以教AI“怎樣把文章寫好”,免得模型只會模仿那些低質量的網絡表達。於是,過去在二手書市場裡無人問津的冷門舊書,突然成了AI公司眼中的優質數據。對模型來說,只要裡面的文字還沒有被收進訓練數據庫,就值得買回來掃描。但如果事情就停在這裡,還能算上一個“AI需要人類知識結晶”的好故事;但問題就在於,這些被AI公司買回去,掃了之後又被銷燬的書,可不全是爛大街的通販貨。
404 Media追蹤的那批舊書裡,還包括一些稀有、絕版和具有收藏價值的書。然而在掃描設備面前,一本普通舊書和一本稀有藏書,最後可能都是等待被拆開的幾百頁紙,最終等待著他們的,無一例外是被銷燬、粉碎、融掉的命運。那些珍貴的藏書一旦被銷燬,就有可能世間再無此書了。這就構成了不少人對亞馬遜、Anthropic憤慨的理由。書買了就買了,為什麼非得切掉書脊,甚至掃描完就直接銷燬?非拆書不可?Anthropic最早盯上書籍時,走的其實是另一條更省事的路:盜版。2021年,Anthropic聯合創始人Ben Mann曾連續11天,從盜版書庫LibGen下載大量書籍。
一年後,另一個名叫Pirate Library Mirror的盜版書庫上線,甚至公開承認自己“故意違反大多數國家的版權法”。Ben Mann看到後,立刻把鏈接發給了同事,還興奮地附上一句:“來得正是時候!!!”不用聯繫作者,也不用和出版社談授權,點幾下鼠標,就能把幾百萬本電子書搬回公司。不過,這條捷徑後來讓Anthropic付出了不小的代價。2024年,包括作家Andrea Bartz在內的幾名作者,把Anthropic告上了法庭,指控該公司未經授權,下載並使用了他們的作品。這場官司最後甚至催生了一個影響整個AI行業的判決。
2025年6月,美國聯邦法官William Alsup認定,使用書籍訓練大模型,屬於具有高度轉化性的合理使用。簡單來說,在法官看來,AI學習這些書,和學生通過閱讀學習寫作差不多,都是法律允許的學習行為。但書是怎麼來到Anthropic手裡的這件事,就得另說了。法院認為,Anthropic從盜版網站下載數百萬本書,再把它們長期保存在自己的中央數字圖書館裡,這種行為已經涉嫌違反了相關法律。實際上,Anthropic後來確實為此達成了15億美元的和解,涉及接近50萬部作品,平均每部作品大約3000美元。
但很快,Anthropic就發現上帝給你關了一扇門的時候,又留了一扇窗,就是前面提到的花錢買來實體書,再掃描成電子文件的“巴拿馬計劃”,卻得到了法院認可。因為在法官看來,Anthropic合法買下了一本紙質書,掃描之後又把原件銷燬,相當於用一份數字文件替代了一本實體書。“一本變一本”,沒有額外增加副本數量。這也讓整件事出現了一個頗為荒唐的結果:從盜版網站下載電子書,可能要付出15億美元;花錢買下實體書,再把它切碎掃描,反而成了更加合規的辦法。當然,法律並沒有規定AI公司買書之後必須銷燬。只是把書拆掉,對這些AI公司來說是最符合經濟效益的做法罷了。首先是掃描的便利程度。
書脊還在的時候,想要把書放到掃描設備裡還得把書翻開,也不算翻頁;書脊切掉以後,幾百頁紙就可以像普通文件一樣,連續送入高速掃描設備。對於一次處理幾千本、幾萬本,甚至數百萬本書的項目來說,這個差別非常大。其次是成本。掃描完成之後,原來的紙書既佔倉庫空間,又需要運輸、整理和保存。繼續留下它們,還得專門花錢把它們運走,再花錢租個倉庫放著它們。但是像Anthropic的“巴拿馬計劃”,要在六個月內處理50萬至200萬本書,這樣幹要額外付出的成本可太高了。既然都用液壓切割機切掉了書脊,切了之後的書也不太可能還原成書了,還不如把剩下的紙直接銷燬更省事。
|用於“巴拿馬計劃”的倉庫對AI公司來說,這樣做合法、快速,還能省錢。也就是說,對於“買舊書來訓練AI”這件事,事實上就是效率和法律都站在碎紙機一邊。只是,誰來替那些稀有藏書踩下剎車?馬斯克也看不下去了“巴拿馬計劃”在X上引發爭議後,一直看不慣Anthropic的馬斯克,率先貼臉開大了。美國時間7月27日,馬斯克表示,他已經要求xAI團隊,如果在收購的書裡發現稀有書籍,就應該把原件保存在圖書館裡。掃描的時候寧可採用更困難的方式,也不要直接切掉書脊。也就是說,普通書可以追求效率,但遇到稀有書,還是得給它留下一條活路。從技術上看,這並不是做不到。
Google Books過去就長期使用非破壞性的方式掃描圖書。把書固定在專門的設備上,不需要切掉書脊,也能一頁一頁完成拍攝和數字化。只是正如前面所說,在幾十萬本、幾百萬本書的規模下,這種方式肯定更低效,也更費錢。但就算AI公司真的聽了馬斯克的話,一本稀有藏書都沒有拆,事情也沒有完全解決。因為這些書被數字化之後,最終並沒有進入一座所有人都能訪問的公共圖書館。一本舊書擺在書店裡,至少還有機會被普通讀者買走,也可能被大學、圖書館或者收藏機構收入館藏。可當它被AI公司買走、掃描,裡面的文字就會進入企業內部的數據庫,最後變成商業模型的一部分。書裡的內容或許沒有消失,公眾接觸它的渠道卻可能變少了。
尤其是那些沒有電子版、沒有進入公共數字檔案的絕版書。數字化原本應該讓知識更容易保存和傳播。到了AI公司這裡,卻可能讓一份原本公開流通的知識,變成封閉的訓練資產。而前面的法院判決,又讓這件事變得更加微妙。按照“一本變一本”的判斷,Anthropic銷燬紙質書並變成電子書,在美國的法律裡是合法的;如果留下了原件,那就等於同時保留了原件和電子書兩本書,反而是不合法的了。那就意味著,企業留下原書,要承擔更多成本和法律風險;直接把書送進碎紙機,反而更合法。這就相當於法律沒有要求AI公司焚書,卻在無意中給“焚書”提供了獎勵。這恐怕才是整件事最細思極恐的地方。
如今,世界各國對AI訓練應該怎樣使用版權內容,至今沒有統一答案。美國法院這次卻先給出了一次示範:合法買下紙質書,銷燬原件,再把電子版留在公司內部,就有機會被認定為合理使用。至少從結果來看,亞馬遜的“焚書”,就很像一次有樣學樣。如果未來這種做法被更多AI公司採用,“銷燬原件”就會從一種節省成本的辦法,逐漸變成規避版權風險的標準操作。甚至連現在義正辭嚴批評Anthropic的馬斯克,也很難說會不會在未來的某一天發現:既有效率,又有法院背書的“銷燬舊書”,或許才是訓練AI的“正道”。
只要能訓練出更好的大模型,究竟要銷燬多少本實體書,甚至在實體書之外還會消耗多少前AI時代的“資產”,也許就再也沒人關心了。
Related
相關文章

值得買科技上半年營收增速回升,AI佈局成為新變量
值得買科技上半年營收增速回升,AI佈局成為新變量 王小娟 發表於 2026年08月24日 12:36 摘要:利潤同步改善 8月24日,值得買科技發佈2026年半年度報告。 報告期內,公司實現營業收入約6.19億元,同比增長6.43%;利潤總額約1374萬元,同比增長53.45%;扣除股份支付影響後的淨利潤約1573萬元,同比增長9.25%。 從整體經營情況來看,值得買科技上半年收入保持增長,利潤端有所改善,但盈利規模仍處於較低水平。公司近年來持續推進業務調整,在鞏固“什麼值得買”消費內容平臺基礎上,加碼AI技術應用、智能營銷等方向,試圖尋找新的增長空間。 值得買科技的核心業務仍圍繞消費內容、消費數據和營銷服務展開。旗下“什麼值得買”長期依靠消費內容和用戶社區積累流量,通過商品推薦、消費評價等內容幫助用戶進行購買決策。 不過,隨著互聯網流量環境變化以及內容平臺競爭加劇,傳統消費內容業務面臨用戶獲取成本提升、商業化效率變化等壓力。 在這一背景下,AI成為公司近年來重點投入方向。 財報顯示,上半年公司AI相關業務收入約6852萬元,佔整體收入比例約11%。公司圍繞大模型、消費數據庫、智能體以及AIGC內容生產等方向展開佈局,並將AI應用於內容生成、消費搜索、營銷服務等多個環節。 具體來看,在消費內容業務方面,公司持續推動“什麼值得買”的AI化升級,包括利用AI優化搜索、內容生產以及用戶推薦機制。公司披露,截至今年6月底,平臺註冊用戶規模約3270萬,月平均活躍用戶數約3829萬人,用戶規模保持相對穩定。 從用戶增長情況來看,平臺仍處於存量運營階段。 相比過去依靠內容和流量快速擴張的階段,目前消費決策平臺面臨用戶注意力分散、內容獲取方式變化等行業趨勢。AI搜索和智能推薦能否進一步提升用戶活躍度,並轉化為更高商業價值,仍需要時間觀察。 營銷業務方面,AI也成為公司提升服務能力的重要工

說好“多模態不是主線”的梁文鋒,怎麼轉頭就發了個Vision模型?
說好“多模態不是主線”的梁文鋒,怎麼轉頭就發了個Vision模型?字母AI2026.08.24 20:17 · 來自北京全文7138字00:00 / 18:44多模態這事上,梁文鋒還是梁文鋒,但他學會了放低姿態。文 | 字母AI在多模態這個問題上,梁文鋒在那次投資人交流會上曾這麼說過:“多模態佈局,我們一直在做。對產品來講,它很重要;對C端用戶產品來講,它很重要。但是對智能的上限,它是一個組件,它不是主線本身。我們應該會上相關的模型,就是我們V4的後續版本會支持原生的多模態。”梁文鋒也的確做到了。2026年8月21日,DeepSeek上線了DeepSeek V4 Flash Vision Exp,DeepSeek官方稱,這是一個多模態視覺理解模型。和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp沒有技術報告,也沒開源,官方只給了一張性能表和幾個演示案例。可DeepSeek V4 Flash Vision Exp怎麼看都不像是個“組件”。以往來看,DeepSeek OCR、DeepSeek OCR 2這樣的模型才貼合梁文鋒口中“組件”的定位。這些模型的作用,是把圖片以像素形式存在的文字,轉換成電腦可以識別的純文本字符。因此,相較DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一個“主線”模型。難道梁文鋒對多模態的看法改變了?事實可能並非如此。不過有一點可以肯定,那就是梁文鋒學會了放低姿態,用產品和用戶形成更密切的交流。梁文鋒此前曾說,“通往AGI要經過產品這個臺階,但不用花太多精力做C端、B端。”而隨著DSH的爆火,發佈後不到一個星期,DS就發佈更新,提升了多模態能力。過去的梁文鋒對於產品有一種“偏執”,不完美不發佈。DeepSeek V3.2版本和DeepSeek V4預覽版之間,相

奧特曼最新訪談:AI還沒有到iPhone時刻,不缺技術缺交互
奧特曼最新訪談:AI還沒有到iPhone時刻,不缺技術缺交互字母榜2026.08.24 20:17 · 來自河北全文8861字00:00 / 21:34奧特曼大談創業,我們為你總結了23條最有價值的信息。文 | 字母榜2026年8月24日,OpenAI創始人奧特曼做客主持人大衛·森拉(David Senra)的節目,聊了一個多小時。奧特曼在節目中袒露了很多心聲,包括產品、時間管理、創業的迷茫,以及他差點就不從事AI這個行業……信息量極大。奧特曼認為,技術跑得比人快,但人適應技術的速度要比想象中慢很多。並且,AI直到今天,仍然不是“iPhone時刻”,最主要的原因是,當前缺的不是技術而是一種交互範式。原文很長,我們為你摘取了其中最有價值的23條。1. “AI 是(我們)發明過的最不可思議的技術之一,但社會和經濟會適應得更慢。”主持人提到Shopify創始人託比·呂特克(Tobi Lütke)的判斷,2026年會成為“每一家生意都重新洗牌”的年份。奧特曼大讚託比是他眼裡“最激進的CEO”,甚至說他比別的CEO領先六到八個月,但唯獨在時間這個問題上,奧特曼明確反駁了託比。他舉了自己的例子,2023年GPT-4問世時,他以為軟件業會立刻天翻地覆、大量生意被重寫,結果並沒有。原因不是技術不夠好,而是“經濟有巨大的慣性”。人們繼續買同一家公司的東西,繼續用同樣的工具、同樣的方式工作。他把這種慣性稱為“一個好特性”,因為它讓這場大轉型更平滑、更慢,但也意味著“我們所有人都把時間估得太樂觀了”。2. “我20年來一直在用同樣的方式使用電腦……最讓我覺得心理上自相矛盾的就是這一點。”主持人問了一個很刁鑽的問題,說奧特曼你是發明AI的人,那你自己會被舊習慣困住嗎?奧特曼回答說,他現在擁有一個“神奇的東西”(指Codex這),按理說他應該徹底改變使用電腦的方式,不該再手動粘貼複製,更不需要老辦法

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。