國家數據局:全國已建成高質量數據集 12 萬個、總體量超 1565 PB,為 AI 發展提供有力支撐

重點摘要
國家數據局近日對外透露,我國在數據供給領域持續取得進展,截至今年6月底,全國已建成各類高質量數據集達12萬個,總體量超過1565拍字節(PB),較今年第一季末成長超過60%。這批數據集涵蓋科學研究、工業製造、醫療衛生、教育教學等多個重要行業領域,現有規模相當於中國國家圖書館數位資源總量的約547倍,為人工智慧技術的快速發展提供了關鍵的數據基礎。 數據被視為人工智慧時代的核心生產要素,高品質、多樣化的數據集是訓練大型語言模型與各類AI應用的必要條件。
國家數據局近日對外透露,我國在數據供給領域持續取得進展,截至今年6月底,全國已建成各類高質量數據集達12萬個,總體量超過1565拍字節(PB),較今年第一季末成長超過60%。這批數據集涵蓋科學研究、工業製造、醫療衛生、教育教學等多個重要行業領域,現有規模相當於中國國家圖書館數位資源總量的約547倍,為人工智慧技術的快速發展提供了關鍵的數據基礎。數據被視為人工智慧時代的核心生產要素,高品質、多樣化的數據集是訓練大型語言模型與各類AI應用的必要條件。國家數據局此次公布的數字,不僅顯示我國在數據資源建設上的快速累積,也反映出從中央政府到地方層級對數據基礎設施投入的具體成效。
相較於第一季末的統計,第二季整體數據規模出現顯著躍升,顯示相關建置工作正在加速推進。在數據集規模快速擴張的背後,數據標註產業也同步蓬勃發展。數據標註是將原始資料轉化為機器可讀、可學習結構的重要環節,其品質直接影響AI模型的表現。國家數據局指出,截至今年6月底,四川成都、遼寧瀋陽、安徽合肥、湖南長沙、海南海口、河北保定、山西大同這七個數據標註先行先試城市,合計標註規模已超過119 PB,從業人員總數達到14萬人。這七座城市涵蓋東北、華北、華中、華南與西南地區,顯示數據標註產業正逐步在全國形成分工協作網絡。這些標註數據廣泛應用於自動駕駛、智慧醫療、工業視覺檢測、自然語言處理等領域。
以醫療衛生為例,標註後的醫學影像與病歷資料可以協助AI系統進行疾病篩查與診斷輔助;在工業製造中,標註後的產品缺陷圖像則能訓練出更精準的品質檢測模型。標註產業的快速成長,也帶動了地方就業與數位經濟發展,七座城市已初步形成從數據採集、標註到模型應用的產業鏈雛形。國家數據局表示,下一步將深化建構服務人工智慧的高質量數據供給體系。具體作法上,將以模型應用需求牽動數據供給,反過來又以數據驅動模型迭代升級。此一策略的核心在於建立數據與AI模型之間的雙向正循環:實際應用場景會告訴數據供給者哪些資料最有價值,而經過訓練與回饋的模型又能對新產生的數據進行更有效的處理,從而形成持續優化的閉環。
推動數據集有償使用的價值閉環,是這套體系中相當關鍵的一環。過去數據流通往往面臨產權不清、定價困難、安全風險等問題,導致許多優質數據無法有效進入市場。國家數據局此次明確提出有償使用機制,意味著未來數據的採集、治理、標註與授權使用將有更清晰的商業模式。這不僅能激勵更多機構釋放手中數據,也為數據標註企業與技術服務商創造穩定的收入預期,進而吸引更多資本與人才投入。從宏觀角度看,12萬個高質量數據集與超過1565 PB的總體量,代表我國已初步建成一個規模可觀的數據資源庫。與中國國家圖書館數位資源總量相比(後者約2.
86 PB),這個數字足足高出547倍,若以一部高畫質電影約10 GB估算,1565 PB約可容納1.6億部電影。如此龐大的數據量,若能持續提升品質、完善分類與開放共享機制,將為國內AI研發團隊提供極具競爭力的訓練素材。目前這些數據集中的一部分已透過政府資料開放平台或行業數據共享平台提供給學術機構與企業使用。未來國家數據局預計將進一步建立標準化目錄與評鑑機制,讓使用者能快速定位所需數據,同時確保數據來源的合法性與隱私保護。業界分析認為,這一系列措施若順利落地,有望縮短AI產品的開發週期,降低中小企業的數據取得成本。隨著數據標註產業規模持續擴大,七個先行先試城市的經驗也將逐步複製到更多地區。
國家數據局未來可能根據各城市產業特色與技術能力,設立新的試點城市,或擴大既有試點範圍。例如成都聚焦於智慧醫療與金融科技,合肥則在工業互聯網與智慧製造領域累積相當經驗,這種差異化的分工策略有助於形成互補效應,避免重複建設。從整體發展趨勢來看,我國正處於從數據大國邁向數據強國的關鍵階段。12萬個數據集與1565 PB的規模只是起點,如何讓這些數據真正「活」起來、用得上,仍需要持續的制度創新與技術突破。國家數據局提出的「以模型應用牽引數據供給、以數據驅動模型迭代」路線,正是希望打通數據從產生到消費、從消費到再生的完整鏈路。
在人工智慧技術飛速演進的當下,高質量數據集的供給能力已成為國家競爭力的重要指標。我國在短短數年內便建立起如此規模的數據資源體系,顯示出強大的組織動員力與政策推動力。未來若能同時兼顧數據治理的合規性、安全性與效率性,將為人工智慧產業的可持續發展提供更穩固的支撐。隨著七座數據標註先行先試城市的產能持續提升,以及更多高質量數據集陸續投入應用,我國在AI基礎設施上的領先態勢可望進一步強化。國家數據局也預告,後續將推出更細緻的配套措施,包括數據分級分類標準、數據交易規則以及第三方評測機制。這些制度安排不僅有助於維護市場秩序,也將為數據供應鏈上的各參與方提供明確的行為指引。
從產業界反應來看,許多AI新創公司與研究機構對這項進展表達正面看法。過去數據取得成本高、品質參差不齊是常見痛點,如今隨著國家級數據集的公布與標註產業的成熟,相關業者預期能夠更快速、更低成本地獲取所需的訓練資料。這對於加速本土AI模型的迭代、縮小與國際前沿的差距,無疑是一大利多。總結而言,國家數據局此次披露的數據規模與成長速度,不僅呈現出我國在數據基礎設施建設上的階段性成果,更揭示出一條以數據驅動AI發展的明確路徑。從12萬個數據集到1565 PB總量,從七座標註城市到14萬從業人員,每一個數字背後都代表著一個正在成形的生態系統。
未來若能持續完善數據供給體系與有償使用機制,人工智慧的發展動能將更為強勁。
Related
相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑
阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

Caviar 推出 24K 鍍金版 Meta 雷朋智能眼鏡 Odyssey,售價 6130 美元限量 24 副
Caviar 推出限量 24 副的 Odyssey 智能眼鏡,以 Meta Ray-Ban 為基礎,提供 24K 金與 925 銀裝飾版本,售價分別為 6130 美元與 6840 美元。該產品保留原版功能,並附帶鱷魚皮充電盒,展現奢華工藝。

Suno 平臺將為 AI 生成音樂添加隱水印,防止濫用現象發生
Suno 平台將為其AI生成的音樂加入隱藏式音頻水印與指紋識別技術,以便在其他平台上被上傳時可辨識來源。此舉是因應索尼、環球等音樂巨頭組成的聯盟,要求防止AI音樂濫用並禁止其進入全球排行榜。

AI寫的PR堆成山,Rust已忍無可忍
Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

內置 10TOPS INT8 算力:韓 Mobilint 推出 USB AI 加速器 MLD-R1
韓國NPU企業Mobilint推出USB外接AI加速器MLD-R1,內建REGULUS AI SoC,提供10TOPS INT8算力與4核Arm處理器。該裝置支援多種AI框架與作業系統,功耗僅3W,具備IP65防塵防水,適合邊緣運算場景。

AI 藝人“方桃子”帶貨美瞳廣告遭下架,聲稱“戴了一天都很舒服”
AI 虛擬藝人「方桃子」因推廣美瞳廣告,聲稱「戴了一天都很舒服」引發爭議,網友質疑其無真實眼睛無法體驗產品效果。該廣告目前已從抖音下架,可能涉及違反《中華人民共和國廣告法》中關於虛假或誤導性內容的規定。