GAIR Paper 111 | 誰動了我的大模型?IJCAI 2026最新綜述揭秘大模型“隱式身份”防偽戰
重點摘要
能力越大,責任越大。大模型想要落地千行百業,需要一個“安全體檢”。 編輯丨岑峰 花費上億美元、集結頂尖算力訓練出的大模型,正面臨被惡意蒸餾、套殼甚至竊取核心數據的巨大風險。就在2026年近期,Anthropic 公開披露了針對 Claude 的大規模疑似惡意蒸餾事件——攻擊者利用欺詐賬戶和代理服務瘋狂收集模型輸出,試圖低成本複製大模型的能力。殘酷的現實證明:面對隱蔽的“白嫖”與盜用,僅靠賬戶封禁、訪問控制等外部防禦手段,已經防不勝防。數據從何而來?模型是否被惡意克隆?這篇爆火的AI爽文到底是誰生成的?為了回答這三個終極安全問題,建立一套嚴密的大語言模型(LLM)“身份認證”機制迫在眉睫。近日,來自西安交通大學、中國科學院信工所和澳大利亞迪肯大學的研究團隊,在人工智能頂會 IJCAI 2026 發表了題為“Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content”的重磅綜述論文,首次提出了大模型“隱式身份(Implicit-ID)”的統一理論框架。該研究徹底釐清了行業內長期混淆的“水印”與“指紋”技術,系統梳理了貫穿數據集、模型、生成內容全生命週期的身份認證方案,為構建可信、安全、可追溯的大模型生態提供了全景式的技術指南。論文作者來自西安交通大學、中國科學院信息工程研究所和澳大利亞迪肯大學,包括劉冰、王順平、朱煜帆、餘欣怡、黃晶、杜林康、裴紅斌(通信作者)和羅瑋。arXiv 預印本:https://arxiv.org/abs/2605.2924501為什麼大語言模型需要“隱形身份證”?大語言模型的研發需要投入大量的數據、算力與工程資源,有公開報道和研究估算認為,GPT-4的訓練成本達到億美元量級。
能力越大,責任越大。大模型想要落地千行百業,需要一個“安全體檢”。編輯丨岑峰 花費上億美元、集結頂尖算力訓練出的大模型,正面臨被惡意蒸餾、套殼甚至竊取核心數據的巨大風險。就在2026年近期,Anthropic 公開披露了針對 Claude 的大規模疑似惡意蒸餾事件——攻擊者利用欺詐賬戶和代理服務瘋狂收集模型輸出,試圖低成本複製大模型的能力。殘酷的現實證明:面對隱蔽的“白嫖”與盜用,僅靠賬戶封禁、訪問控制等外部防禦手段,已經防不勝防。數據從何而來?模型是否被惡意克隆?這篇爆火的AI爽文到底是誰生成的?為了回答這三個終極安全問題,建立一套嚴密的大語言模型(LLM)“身份認證”機制迫在眉睫。
近日,來自西安交通大學、中國科學院信工所和澳大利亞迪肯大學的研究團隊,在人工智能頂會 IJCAI 2026 發表了題為“Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content”的重磅綜述論文,首次提出了大模型“隱式身份(Implicit-ID)”的統一理論框架。
該研究徹底釐清了行業內長期混淆的“水印”與“指紋”技術,系統梳理了貫穿數據集、模型、生成內容全生命週期的身份認證方案,為構建可信、安全、可追溯的大模型生態提供了全景式的技術指南。論文作者來自西安交通大學、中國科學院信息工程研究所和澳大利亞迪肯大學,包括劉冰、王順平、朱煜帆、餘欣怡、黃晶、杜林康、裴紅斌(通信作者)和羅瑋。arXiv 預印本:https://arxiv.org/abs/2605.2924501為什麼大語言模型需要“隱形身份證”?大語言模型的研發需要投入大量的數據、算力與工程資源,有公開報道和研究估算認為,GPT-4的訓練成本達到億美元量級。
隨著模型能力、應用範圍和商業價值不斷提升,與大模型相關的安全與治理問題也日益突出,包括模型參數洩露、未經授權使用、訓練數據違規利用、模型輸出濫用,以及生成內容來源難以識別等。2026年以來,圍繞模型輸出使用邊界與模型蒸餾合規性的討論受到廣泛關注。Anthropic公開稱,其發現了利用欺詐賬戶和代理服務大規模訪問Claude、收集模型輸出並規避檢測的疑似模型蒸餾活動。該事件凸顯了僅依賴賬戶管理、訪問控制和外部行為檢測保護模型資產所面臨的侷限,迫切需要建立支持大語言模型資產保護與來源追溯的身份機制,從而回答三個基本問題:數據集是否遭到未經授權的使用?模型來自何處,是否經過複製、微調或其他改造?
內容是否由特定模型或某類模型生成?指紋識別(Fingerprinting)與水印技術(Watermarking)由此迅速成為研究熱點。然而,現有研究長期存在兩大突出問題:一是概念邊界不夠清晰,不同文獻對“指紋”和“水印”的定義存在交叉甚至混用;二是研究體系相對分散,數據集保護、模型所有權認證和生成內容檢測通常被分別研究,缺少覆蓋大模型全生命週期的統一視角。針對這些問題,該綜述提出大語言模型“隱式身份”這一統一框架,系統梳理大語言模型從數據、模型到生成內容的身份技術。02核心創新:打破術語混淆的“隱式身份”框架論文提出了由“頂層概念-中層實現-底層機制”三個層次構成的概念框架。
在頂層,論文提出隱式身份作為統一抽象,用於描述大語言模型系統中不易被直接觀察、但能夠通過特定驗證程序識別和確認的身份信號。大模型的身份需隱藏在參數、表示、行為響應或生成內容的統計規律中,需要藉助特定算法、測試樣本或密鑰才能驗證,因此被稱為“隱式身份”。這一概念將原本分散的指紋和水印技術納入同一理論框架,使研究者能夠從“身份如何產生、證據從何而來、聲明如何驗證”三個基本問題出發,對不同方法進行統一分析。在中層,論文根據身份信號的形成方式,將隱式身份劃分為兩種主要實現形式。
指紋技術(Fingerprinting)是一種非侵入式身份技術,其身份信號來源於數據集、模型或生成內容自身固有的內在特徵,例如模型的參數分佈、內部表示、輸入—輸出行為模式或生成內容的統計特徵,無需對原始資產進行主動修改。水印技術(Watermarking)則是一種侵入式身份技術,通過外部干預,將預先設計、可驗證的身份信號主動嵌入數據集、模型或生成內容中。簡言之,指紋識別是從資產的固有特徵中“提取身份”,後通過相似性比較歸因實現驗證;而水印技術是在資產中主動“植入身份”,後通過密鑰進行身份驗證。在底層,論文從證據來源和驗證路徑兩個方面歸納現有方法,形成一個緊湊的隱式身份技術設計空間。
不同方法所利用的身份依據可能來自數據集中的記憶與統計信號、模型參數及其統計不變量、模型內部表示與梯度、特定輸入下的行為響應,以及生成內容中的詞彙、句法、語義或分佈特徵。與之對應,驗證路徑主要包括兩類:一類是不依賴預設密鑰的相似性歸因,即提取待驗證資產的內在證據,並與候選來源的參考證據進行匹配;另一類是依賴預先嵌入身份信號和秘密信息的密鑰驗證,即通過相應檢測器判斷特定水印是否存在。這一框架不僅澄清了長期存在的術語混淆問題,也為比較不同訪問條件下的身份技術,以及推動方法、攻擊模型和評估標準在數據集、模型與生成內容之間遷移複用,提供了分析基礎。
03跨生命週期的生成式分類體系資產保護不應頭痛醫頭、腳痛醫腳。論文提出了一套橫跨大語言模型生命週期與驗證語義的二維分類體系(Taxonomy):生命週期維度:按照身份建立或驗證所處的資產階段,將相關技術劃分為數據集、模型和生成內容三個層面;身份驗證維度:根據驗證語義區分為基於相似性的歸因(對應非侵入式的指紋識別)與基於密鑰的驗證(對應侵入式的水印技術)。資產保護與來源追溯並不分別綁定於某一種技術,而是均可通過上述兩種驗證路徑實現。這種“生成性”的分類法不僅對現有研究進行歸類,還揭示了不同資產層面之間共享的驗證邏輯,從而幫助研究者推導方法、攻擊模型和評估壓力條件在不同生命週期階段之間的遷移關係。
各資產層面的技術要點如下:數據集層面:重點關注數據集指紋識別,包括統計指紋(基於損失、困惑度等記憶信號)和特定響應指紋,主要用於事後數據使用審計和所有權驗證;模型層面:技術最為豐富,涵蓋參數空間指紋、表示空間指紋、行為指紋,以及通過微調、模型編輯等方式嵌入身份信號的模型水印方法;生成內容層面:包括統計指紋、自然指紋,以及統計水印(紅綠列表等)和帶密鑰採樣水印(零失真水印等),可直接對輸出文本進行溯源。04評估框架:如何評判身份技術的好壞?為了讓身份驗證系統真正落地工業界,論文進一步建立了一套包含四個核心評估目標的評估框架,將隱式身份做為大模型身份驗證的“體檢標準”系統:1.
身份聲明正確性(Correctness of Identity Claims)衡量驗證系統能否接受真實聲明、拒絕虛假聲明。論文以真陽性率(TPR)和假陽性率(FPR)為核心指標,建議報告固定FPR下的TPR,或使用ROC曲線、精確率—召回率曲線進行評估;多源歸因場景還應關注Top-k準確率和置信度校準。2.良性變換魯棒性(Robustness to Benign Transformations)衡量身份信號在數據處理、模型微調、量化、剪枝、蒸餾、模型合併,以及文本改寫、翻譯和摘要等正常變換後能否繼續被驗證。論文提出良性魯棒性覆蓋率,用於彙總身份方法在不同良性變換下保持有效的比例。3.
對抗操縱魯棒性(Security against Adaptive Manipulation)評估身份技術面對移除、規避、偽造和冒充攻擊時的安全性。論文強調應明確攻擊者的知識、權限和能力,並以對抗魯棒性覆蓋率衡量方法在給定威脅模型下抵抗不同攻擊的能力。4.效用與部署成本(Utility and Deployment Cost)衡量身份技術對原有功能的影響及其實際應用代價。水印技術需重點評估嵌入身份信號造成的性能或文本質量下降;指紋識別通常不直接影響資產效用,但可能需要較高的查詢、計算和存儲開銷。部署成本進一步分為身份建立成本和身份驗證成本。
前者包括數據構造、模型微調、模型編輯、解碼干預和密鑰管理等;後者包括查詢次數、計算與存儲開銷、驗證延遲及訪問權限要求。即使方法具有較高識別性能,若依賴白盒訪問或大量查詢,也可能難以實際部署。這一評估框架為後續研究提供了系統、可比較的評估模板,有助於推動領域向更規範、更實用的方向發展。
05挑戰與未來:大模型安防的“深水區”儘管大語言模型身份技術突飛猛進,但該綜述也指出了當前行業面臨的三大痛點:一是身份安全信息與模型效用的“蹺蹺板”,即如何在不犧牲模型聰明程度的前提下打上強力水印;二是對跨生命週期漂移和自適應變換的魯棒性不足,面對模型迭代演化與自適應攻擊,身份信號極易發生“漂移”和失效;三是驗證過程往往需要極高的白盒權限或者算力開銷、缺乏低成本且標準化的評測基準。未來,語義保真度更高的身份機制、對模型演化和內容變換更加魯棒的身份信號、更加高效且可審計的驗證方法,以及覆蓋數據集、模型和生成內容的評測基準,將是下一個黃金研究方向。
06結語隨著大語言模型滲透進千行百業,如何實現模型、數據和生成內容的身份認證、知識產權保護與來源追溯,已成為可信人工智能不可迴避的重要基礎設施建設。這篇 IJCAI 2026 的重磅綜述,梳理了隱式身份技術的發展脈絡、統一框架和未來方向,為構建安全、可信、可追溯的大語言模型生態提供了參考。論文完整版預印本請訪問arXiv:https://arxiv.org/abs/2605.29245,進一步瞭解這一快速發展的研究方向。雷峰網
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。