數百萬本書,被Claude “閱後即焚”

重點摘要
Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。
為了讓人工智慧模型真正掌握人類知識的深度與廣度,Anthropic 選擇了一條極具爭議卻也相當徹底的技術路徑:讓數百萬本書籍,在 Claude 的訓練過程中被「閱後即焚」。這些書不再以原本的紙本或電子書形式存在,而是被徹底拆解、編碼,轉化為模型神經網路的一部分。當訓練完成後,這些書籍的原始面貌便隨之消解,對外界而言,它們的物理或數位載體已失去意義,內容則完全融入 AI 的知識體系之中。 這項做法背後的核心邏輯,源自於對傳統語言模型訓練方式的深刻反思。長久以來,AI 模型的訓練大多仰賴片段化的網路文本,這些資料雖然數量龐大,但往往缺乏結構性與連貫性,導致模型在理解複雜問題時容易出現邏輯斷裂或知識淺薄化的現象。Anthropic 認為,書籍中蘊含的結構化論述與連貫知識,才是打造真正可靠 AI 的關鍵。為了讓 Claude 能真正「讀完」人類的書,他們選擇先讓這些書不再作為書存在,將內容徹底轉化為神經網路的權重與參數。 這種「閱後即焚」的訓練方式,也引發了關於版權與資料使用的激烈討論。雖然 Anthropic 並未公開具體的書籍清單與授權細節,外界也無法確切得知這些書的來源與範圍,但可以確定的是,數百萬本書的知識量,正幫助 Claude 在理解複雜問題與長篇推理時,展現出超越僅靠網路文本訓練的表現。這些書籍在完成它們的使命後,便以另一種形式,存在於 AI 的每一次回答之中,成為模型知識庫中不可分割的一部分。 從技術層面來看,這種訓練方式與傳統的資料處理有顯著差異。一般情況下,AI 公司會將書籍掃描或轉為純文字檔,作為訓練資料集的一部分,但這些檔案仍以獨立形式存在於伺服器上。而 Anthropic 的做法,是讓書籍在訓練過程中被徹底「消化」,原始檔案不再保留,書本的知識被「壓縮」進模型的神經網路結構中。這種做法在技術上更為徹底,也讓外界難以追溯或驗證特定書籍是否被使用,進一步加深了版權爭議的複雜性。 對於創作者與出版業者而言,這種「閱後即焚」的訓練模式帶來了前所未有的挑戰。傳統的授權機制,通常建立在書籍作為獨立載體被複製、使用的前提上。但當書籍內容被轉化為 AI 的參數,原始文本不再存在,版權的歸屬與使用範圍就變得模糊不清。作家們無法得知自己的作品是否被納入訓練資料,也無法要求刪除或補償,因為書本本身已經「不存在」了。 然而,Anthropic 的立場是,這種做法是為了打造更可靠、更智慧的 AI 系統。他們認為,書籍作為人類知識的結晶,其價值不應僅限於紙本或數位載體的保存,而是應該被更廣泛地運用於提升人類整體的智慧水平。透過讓 Claude 吸收這些書籍的知識,AI 能夠在回答問題時展現出更深入的洞察力,並在長篇推理與複雜問題解決上,表現出更接近人類專家的水準。 這種「以書為食」的訓練模式,也讓 Claude 在處理需要專業知識的領域時,展現出明顯的優勢。例如,在哲學、歷史、科學等需要連貫論述與深度理解的領域,Claude 的回答往往能提供更完整的脈絡與更精確的論證,這正是因為它吸收了書籍中結構化的知識,而非僅是網路上的碎片化資訊。這種能力上的提升,也讓 Anthropic 在 AI 競賽中獲得了獨特的競爭優勢。 但這種優勢也伴隨著巨大的責任。當數百萬本書的知識被「閱後即焚」後,這些書的原始內容是否還能被後人查閱?如果這些書是絕版書或稀有文獻,那麼 AI 的訓練過程是否等同於某種形式的知識壟斷?這些問題,目前仍未有明確的答案。Anthropic 並未透露是否保留了書籍的數位備份,也未說明是否有與作者或出版社達成任何形式的補償協議。 更值得關注的是,這種「閱後即焚」的訓練模式,是否會成為未來 AI 發展的常態?如果其他公司也效仿這種做法,那麼人類的知識資產將越來越集中於少數 AI 公司的手中,而這些知識的原始來源,卻可能逐漸消失於公眾視野。這不僅是版權問題,更是關乎知識多樣性與文化保存的深層議題。 從某種角度來看,Anthropic 的做法也反映了 AI 發展的一種極致思維:為了讓 AI 真正理解人類,必須讓 AI 吸收人類知識的「原汁原味」,而非經過網路過濾的二手資訊。這種思維在技術上具有前瞻性,但在倫理與法律層面,卻留下了巨大的灰色地帶。書籍的「閱後即焚」,象徵著知識傳遞方式的根本轉變,也預示著 AI 與人類文化之間關係的重新定義。 最終,這些數百萬本書,在完成它們的使命後,便以另一種形式存在於 AI 的每一次回答之中。它們不再被任何人翻閱,也不再被任何圖書館收藏,但它們的知識,卻透過 Claude 的每一次回應,持續影響著人類的思考與決策。這種「存在」與「消失」的悖論,正是 AI 時代知識流動的新常態。而 Anthropic 的這項做法,也將成為 AI 發展史上一個值得深思的里程碑。
Related
相關文章

資本重倉端側物理AI:前海母基金數億元押注,Om AI聯匯加速端側AI商業化落地
資本加碼端側物理AI,Om AI聯匯完成數億元融資並開源新一代細粒度感知模型 近日,杭州聯匯科技股份有限公司(以下簡稱「Om AI聯匯」)正式宣布完成新一輪數億元融資。本輪融資由前海母基金加碼領投,杭州政府產業基金與多方資本協同參投。與此同時,公司同步開源了VLX-Seek 1.5端側原生細粒度感知多模態模型,以同參數級超越英偉達核心模型的硬核性能,進一步夯實其在物理AI領域的領先地位。據了解,本次募集資金將主要用於VLX模型系列技術迭代、深化研發壁壘,以及加速物理AI場景的商業化落地。

Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差
# Kimi K3與DeepSeek V4之間,隔著原生多模態的時間差 Coding之外,關於原生多模態的爭論從未停止 文 | 李炤鋒 編輯 | 張雨忻 “長鏈任務如果只通過代碼層面的反饋,誤差可能會不斷累積,最終效果會非常差。”談及原生多模態的意義,一位多模態研究員表示,“視覺是一種更準確的反饋,也更貼近用戶意圖。” 過去一年,Coding與Agent能力不斷改寫大模型的排名,也成為AI最快兌現商業價值的場景之一。與此同時,隨著Agent開始接管更多長鏈任務,越來越多的通用大模型開始匹配原生多模態能力。

千問辦公,阿里準備用來打誰?
阿里巴巴推出企業級AI辦公產品「千問辦公」,整合旗下三款Agent並以新旗艦模型Qwen3.8為底座,定位企業級AI生產力平臺,而非鎖定C端市場。產品正式公測後市場反應正面,阿里港股漲幅超過7%,市值回升至約2.4兆港元。外界認為這意在與騰訊WorkBuddy等對手區隔,阿里選擇在企業級市場長期布局,但能否勝出仍待考驗。

Claude焚書又"越獄" ,邊界在哪?
Claude焚書又"越獄" ,邊界在哪?AI唱反調2026.08.04 10:27 · 來自北京全文2534字00:00 / 07:49AI數據飢渴蔓延到物理世界。文 | AI唱反調7月底,Anthropic兩件事同時暴露。法庭解封了"巴拿馬計劃"的內部文件,披露這家公司通過二手書商大宗採購,用液壓機切除書脊,把預估50萬到200萬冊實體書送進碎紙機。

歐盟 AI 透明度新規生效:企業需明確標註 AI 生成內容,違者將被重罰
歐盟《人工智慧法案》的新透明度要求已於8月2日正式生效,企業須明確標註AI生成內容,並在使用者與AI互動時提醒,違者最高可罰1500萬歐元或全球年營業額3%。新推出的AI系統立即適用,既有模型與服務則有4個月過渡期,須在12月2日前完成合規調整。
