算力之後是語料:AI的新瓶頸正在重塑內容產業的定價權?

2026年8月17日 12:30
算力之後是語料:AI的新瓶頸正在重塑內容產業的定價權?
站內 AI 整理稿

舒書2026.08.17 12:28 · 來自北京全文3866字00:00 / 12:14AI語料、數據枯竭 、版權授權、內容產業、AI基礎設施文 | 舒書2026年8月,A股AI語料板塊集體爆發。讀客文化觸及20cm漲停,中信出版、中國出版等版權內容標的紛紛跟漲,數據服務商海天瑞聲同步走強。資本在追逐一個剛浮出水面的邏輯:AI大模型的燃料正在告急。據Epoch AI等研究機構預測,高質量公開文本數據可能在2020年代中後期至2030年代初面臨明顯緊缺。國家數據局局長劉烈宏在2026世界智能產業博覽會上的發言切中要害:“AI就像數據的精煉廠,競爭力從來不在於爐子多大,而在於礦石的品位有多高。

”算力有摩爾定律,數據沒有。當大模型參數規模從千億衝向萬億,它們吞噬的語料量級也在指數級膨脹。以文本模型為例,GPT-2的訓練數據約數十GB量級,GPT-3約數百GB量級。而大模型正在從純文本向多模態演進。據2026機器人全產業鏈接會披露信息,實現具備實用能力的具身智能,至少需要1000萬小時量級多模態數據,疊加多場景適配、多模態類型、數據良率等因素,產業實際所需規模可能更高。據貴州省大數據局公開數據,當前國內真實物理交互場景合規數據僅50萬小時,缺口超99%。互聯網上那點天然牧場正在被消耗;而常被輿論放大的風險在於:AI生成內容帶來的數據自我汙染,或將加速優質原生文本供給收緊。

一、AI生成內容的迴旋鏢效應當AI生成的內容大量湧入互聯網,再被下一代AI模型抓取訓練時,會發生什麼?一個越來越棘手的問題是模型坍縮——如果用AI生成的二手數據反覆迭代訓練,模型會逐漸偏離真實世界的分佈,失去對罕見事件的理解能力。這就像一個封閉的複印系統:用複印件去複印複印件,每一代都會丟失信息。不過,學術界對模型坍縮的嚴重性仍存在分歧——不加篩選、大規模純AI生成數據循環訓練才會誘發嚴重坍縮。現實中有多種緩解方案:嚴格過濾、數據清洗、去重、混合原生人類數據訓練等策略均可有效抑制退化。AI內容並非天然有毒,關鍵在於如何治理。

為了獲取未被AI生成內容汙染的原生語料,硅谷科技巨頭已經開始挖掘傳統媒體文稿與紙質書籍的價值。據《華盛頓郵報》等媒體報道,Anthropic自2024年啟動代號巴拿馬計劃的圖書數字化項目。內部文件寫道:“巴拿馬計劃是指我們破壞性掃描世界上所有書籍……我們不希望外界知道我們在做這件事。”此前,公司因從LibGen等盜版資源庫下載超700萬本電子書訓練模型,被作者群體起訴。2026年7月20日,加州北區聯邦法院法官Araceli Martínez-Olguín簽署最終批准令,批准Anthropic就版權侵權指控支付15億美元和解金,覆蓋約48.2萬至50萬部作品,摺合每部約3000美元。

這是美國版權史上迄今規模最大的和解協議。該案中,退休法官William Alsup在簡易判決意見中提出:將合法購入的圖書掃描用於內部模型訓練具備轉換性使用特徵,屬於合理使用範疇。但需要強調兩點:其一,該裁定僅為地區法院審前觀點,案件最終以和解收尾、未進入上訴程序,不構成在美國全境具備約束力的判例;其二,該意見針對合法獲取圖書後的訓練行為,不能推導出破壞性銷燬書籍的操作具備商業正當性。同時,整套裁判邏輯根植於美國版權體系,無法平移至中國著作權環境。二、傳統內容商的新角色:AI礦工當原生語料從免費午餐變成稀缺礦產,價值鏈正在發生一次靜默重構。

但需要釐清的是,AI企業採購文本有兩種截然不同的用途:一是用於模型預訓練或SFT微調,二是僅用於上線後的RAG(檢索增強生成)知識庫檢索。兩者的法律授權範圍、商業價格和版權風險天差地別。目前大量AI企業採購版權文本僅做檢索而非訓練,不能簡單預期所有版權內容都能以訓練語料的高價出售。AI公司開始為高質量語料付費。哈珀·柯林斯與微軟達成精選非虛構圖書AI訓練授權協議,僅限部分舊書書目,單本書三年授權總價5000美元,由出版社與作者對半分成,採取作者自願選擇加入模式,並且合同設置文本引用比例上限。泰勒-弗朗西斯達成1000萬美元的學術內容授權協議。

據MarketIntelo預測,至2034年全球訓練數據授權市場規模將達226億美元(統計口徑覆蓋多類型訓練數據集,不侷限文字版權內容)。但需要謹慎對待海外案例的參照意義:部分授權交易帶有版權訴訟和解背景,價格不代表常態化市場化定價。國內同樣在提速。多位接近出版社、圖片版權機構的人士透露,已有AI公司開始向傳統內容機構採購合規數據集。國家數據局明確提出構建以詞元(Token)為基礎的數據集價值體系。但這一切仍在早期。從擁有版權到成為AI礦工之間,隔著數字化、清洗、標註、脫敏、格式轉換等大量工程與成本。

中文語料不僅面臨版權權屬複雜的問題,還存在數據分散、流通機制不成熟、深層標註和垂類加工能力不足等現實約束。更重要的是,不是所有版權庫都能享受價值重估——多數大眾通俗文本的單Token價值很低,只有專業、獨家、稀缺垂類內容才可能獲得高溢價。興業證券研報判斷:AI正在推動傳媒內容產業從消費品轉向“數據+IP資產”雙重定價。但這一判斷落地,需要確權、交易、溯源配套體系同步成熟。三、替代路徑:AI公司不需要搶書也能活如果語料短缺真的成為硬約束,AI公司不會坐等出版社開礦。合成數據的潛力正在被驗證。已有研究表明,高質量合成數據可在數學、代碼等領域部分替代真實數據,顯著降低對原生人類文本的依賴。

數據效率的提升也在改變算賬邏輯。模型架構改進(如MoE)、訓練方法優化(如課程學習)正在降低單位智能所需的原始數據量。RAG與持續學習更大幅擴展了模型獲取信息的邊界——大模型不需要在預訓練時記住所有知識,而是在推理時按需檢索。此外,AI公司還有多條備選路徑:自建人工標註團隊生產垂類數據、採購專業數據服務商(海天瑞聲等)、抓取開放合規公共數據、海外多語種數據集採購,以及直接簽約作者而非通過出版商。傳統圖書版權只是數據源之一,並非不可替代。中文高質量公開文本相對分散,專業出版、學術、行業報告等數據流通機制不成熟,很多數據“有,但難合規流通”,出版機構有內容資產,但未必有數據工程能力。

四、三重壁壘:從礦脈到定價權即便語料稀缺成立,從擁有版權庫到掌握定價權之間,還有三重現實壁壘需要跨越。第一,版權權屬錯綜複雜。出版社大多隻擁有出版版式權和信息網絡傳播權,文字著作權歸屬作者。要授權AI訓練,需要逐一與作者談判;大量老書作者失聯、授權鏈條斷裂。據業內人士透露,有頭部出版社嘗試將旗下圖書授權給AI公司,但因大量作者合同中未包含AI訓練權,最終完成授權的品種遠低於預期,談判週期長達數月。出版機構要真正掌握定價權,不能只靠存量版權,還需要同時具備版權確權能力、數據清洗加工能力、合規授權能力和安全流轉能力。

存量古籍、舊書可以短期補充語料池,但長期可持續的乾淨原生語料,依賴持續不斷的人類新創作。存量版權庫只能起到緩衝作用,無法永久解決數據迭代需求。第二,Token計價體系尚未成熟。如何統計一本書被抽取多少Token訓練、如何溯源、如何分成、如何防止數據被盜用二次流轉,全部缺少技術與規則支撐。當前海外大多采用打包授權(年費、整庫採購),按Token計價的精準交易模式距離落地還有距離。第三,AI公司的替代供給正在成形。合成數據、數據服務商、開源數據、直接簽約作者——傳統版權方議價能力被多條路徑同時稀釋。此外,大量古籍、近代公版文字、開放學術資源永久免費,持續壓制大眾普通圖書的語料議價天花板。

未來,若國內推出AI訓練數據的法定許可機制(統一費率、無需一對一談判),將徹底改變當前博弈格局——AI企業無需逐一獲取作者授權,出版社的獨家議價權將被大幅削弱。語料瓶頸更準確的說法或許是分層稀缺:未來真正稀缺的,可能不是普通公開文本,而是高質量、獨家、合規、可溯源、專業垂類數據,以及多模態、交互型數據。例如,醫學教材、法律判例、垂直行業深度報告更容易形成稀缺供給;大量同質化網絡通俗小說、公版古籍、通用百科條目,則供給相對充裕。回到8月的A股,語料板塊的暴漲反映的是資本對AI語料這一新敘事的飢渴,而非業績的兌現。

在確權體系、計價規則、分潤機制尚未跑通之前,出版企業的AI語料收入大概率仍停留在意向協議層面。長期來看,AI競爭持續向多模態演進,圖文、視頻、機器人交互數據集需求將持續上行,純文本版權語料的戰略權重會逐步被稀釋。所謂語料稀缺,也不止侷限於文字素材。行業潛在解決方案包括著作權集體管理組織統一談判、AI授權收益強制分成機制。如果長期收益集中在平臺與出版機構、一線創作者難以獲益,高質量原生內容創作動力終將持續衰減。乾淨、合規、獨家原生語料會成為重要競爭籌碼。但單純手握存量文字,不等於護城河。語料稀缺並不必然讓傳統出版商掌握定價權,定價權是多方持續博弈的動態結果。

真正決定議價能力的是:誰能持續生產高質量原創內容,誰能把版權資產轉化為合規、可溯源、可交易的數據資產,誰能在AI公司、平臺、作者之間建立穩定分潤機制。僅僅囤積存量文本,無法構築AI時代可持續的競爭壁壘。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛