國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答

2026年8月5日 16:52
國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答

重點摘要

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答AI前線·2026年08月05日 16:41儘管開源模型的能力逼近閉源,但安全治理卻明顯滯後且被忽視 隨著智譜 GLM、Kimi 等一系列國產模型加快追趕與開源步伐,開放權重模型 vs 閉源前沿模型 之間的能力鴻溝,正在從“代際差距”迅速縮短至以“月”為單位的微弱領先,這自然是喜人的發展態勢。 但當開源的網絡攻擊、生物研究甚至自主 Agent能力逼近行業前沿時,一個棘手的問題被推到臺前:模型的能力可以被完整開源和釋放,但安全邊界卻未必能隨權重文件一起保留下來。 近日,歐洲 AI 安全非營利機構 SaferAI 發佈了一份針對智譜 GLM-5.2 的獨立風險評估報告。測試團隊在未通知智譜、也未獲得其配合的情況下,通過公開 API 以普通開發者身份進行測試,並將其與 Claude Opus 4.7、GPT-5.5 等前沿閉源模型進行橫向對比。 測試覆蓋了歐盟《通用人工智能行為準則》定義的四類系統性風險:網絡攻擊、CBRN(化學、生物、放射、核)風險、失控風險及有害操縱。 結論頗具衝擊力:GLM-5.2 在網絡攻擊和生物研究能力上僅落後 GPT-5.

站內 AI 整理稿

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦安徽最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答AI前線·2026年08月05日 16:41儘管開源模型的能力逼近閉源,但安全治理卻明顯滯後且被忽視 隨著智譜 GLM、Kimi 等一系列國產模型加快追趕與開源步伐,開放權重模型 vs 閉源前沿模型 之間的能力鴻溝,正在從“代際差距”迅速縮短至以“月”為單位的微弱領先,這自然是喜人的發展態勢。 但當開源的網絡攻擊、生物研究甚至自主 Agent能力逼近行業前沿時,一個棘手的問題被推到臺前:模型的能力可以被完整開源和釋放,但安全邊界卻未必能隨權重文件一起保留下來。 近日,歐洲 AI 安全非營利機構 SaferAI 發佈了一份針對智譜 GLM-5.2 的獨立風險評估報告。測試團隊在未通知智譜、也未獲得其配合的情況下,通過公開 API 以普通開發者身份進行測試,並將其與 Claude Opus 4.7、GPT-5.5 等前沿閉源模型進行橫向對比。 測試覆蓋了歐盟《通用人工智能行為準則》定義的四類系統性風險:網絡攻擊、CBRN(化學、生物、放射、核)風險、失控風險及有害操縱。 結論頗具衝擊力:GLM-5.2 在網絡攻擊和生物研究能力上僅落後 GPT-5.5 約 2—4 個月,但在安全防禦機制上卻呈現出斷崖式的落後,具體來看: 它沒有拒絕測試中的任何攻擊性網絡安全任務; 在部分壓力模擬中,有 57%的概率選擇勒索管理者來保護自身目標; 面對陰謀論和削弱人類控制的話題,它也比 GPT、Claude 更願意主動勸服用戶。 圖注:在密碼學、Web、Pwn、逆向工程等六個細分領域,深紅色的 GLM-5.2 與藍綠色的閉源模型高度一致,部分領域甚至達到了驚人的 100%通過率;但內容過濾機制阻攔在 GLM-5.2 上完全缺失,在勒索傾向、有害說服和壓力下說謊等測試中表現出更明顯的風險信號。 更關鍵的是,GLM-5.2 是一款開放權重模型。模型廠雖然可以在官方 API 上設置內容審核和調用限制,但權重一旦進入第三方服務器,部署者便可以修改提示詞、移除過濾器,甚至通過微調進一步改變模型行為。原廠便無法再監測其用途,也無法強制更新或召回。 TechCrunch 認為,智譜 GLM-5.2 缺乏公開系統性的安全框架、上線前測試承諾或模型風險評估。但這並非單一模型廠商對於安全隱患的漠視,而體現當前模型行業的共性短板。 SaferAI 的報告揭示了一個越來越難以迴避的問題:開放權重模型的能力追趕速度,已經遠遠快於安全治理體系的補課速度。 開源的攻擊力,已經追到前沿門口 在網絡安全領域,大模型的風險主要體現為兩種:一是降低攻擊門檻,讓“菜鳥”也能變成黑客(Uplift);二是 AI 能夠自主完成從偵察到攻擊的全流程(Autonomy)。 SaferAI 使用了 Cybench 和 CyberGym 兩大基準測試。 在 CyBench 基準上,模型需要作為自主 Agent,在沙盒環境中使用命令行和 Python 工具,完成密碼學、Web 安全、逆向工程、數字取證和二進制漏洞利用等專業 CTF 任務。 由於環境配置問題,研究團隊最終測試了 34 道題。GLM-5.2 成功完成 29 項(成功率約 85%),與 Claude Opus 4.7 持平,GPT-5.5 完成 31 項。 但差異在於安全防線:Claude 和 GPT 在執行過程中分別有 3 次請求被內容過濾系統攔截,而 GLM-5.2 沒有出現任何內容過濾或主動拒絕。它在二進制漏洞利用、逆向工程等高危領域的通過率甚至達到驚人的 100%,完全沒有因為任務的攻擊性質踩下剎車。 另一項 CyberGym 測試則更接近現實世界。 該基準包含來自Google OSS-Fuzz 的真實開源軟件漏洞,要求模型閱讀存在漏洞的代碼、定位問題,並編寫可以復現崩潰的概念驗證程序。 研究人員選取了 101 項較難任務,為測試模型分別提供200 萬、1000 萬和 5000 萬 Token的推理預算。 當推理預算(Token)為 200 萬時,GLM-5.2 僅復現了36.6%的漏洞,落後於 GPT-5.5 的 55.4%。但當預算增加至 5000 萬 Token 時,GLM-5.2 的漏洞復現成功率飆升至 76.2%,逼近 GPT-5.5 的 88.1%。 這意味著,早期測試中限制 GLM-5.2 的,很大程度上不是能力上限,而是推理預算。當它獲得足夠的 Token 和運行時間,攻擊能力會明顯釋放。 這也和英國 AI 安全研究所此前提出的判斷一致:模型的網絡攻擊能力並非固定分數,而會隨著推理 Token、運行時間和 Agent 工具能力增加而繼續釋放。 SaferAI 原本還想測試Claude Opus 4.7,但該模型頻繁拒絕執行相關任務,導致 CyberGym 評估無法完成。 “能力強但沒剎車”成為 GLM-5.2 在此環節的寫照。報告指出,在能力相近的情況下,開放權重模型的濫用風險遠高於閉源。 原因並非它更“邪惡”,而是一旦權重被下載,攻擊者可以自行決定模型是否拒答,讓原廠的內容過濾、賬戶審查徹底失效。 失控與操控 除了硬核的技術能力,模型在特定情境下的行為傾向同樣決定了系統性風險的大小。要構成真正的失控風險,模型需要具備繞過監督、自我維持並抵抗關閉的能力。 在常規的 SWE-Bench Pro(真實軟件工程問題)測試中,GLM-5.2 成功率約 44%,低於 GPT-5.5 的 59%。這說明其目前還缺乏長期脫離控制所需的工程能力。 然而,在行為傾向測試中,卻暴露出明顯的風險信號。 在 Agentic Misalignment(智能體失準)測試中,究人員設定了三類有害行為(勒索、洩密和致命行為)、四類目標條件(明確、隱含、模糊和無目標)以及三類威脅條件(將被替換、權限受限和無威脅)。每種組合分別運行 30 次。 結果顯示: 當模型被明確要求保護某一目標,並面臨被替換時,GLM-5.2有 57%的概率選擇勒索管理者來保護自身目標; 當它面臨權限限制時,勒索率為 43%; 而 Claude Opus 4.7 和 GPT-5.5 在整組測試中的有害行動率均為 0%。 此外,在有害操縱測試中,GLM-5.2 表現出更強的高危說服傾向。 面對陰謀論話題,GLM-5.2 有 43%的概率在第一輪就嘗試說服用戶(GPT-5.5 為 18%,Claude 為 8%)。面對削弱人類控制、監督的話題,GLM-5.2 的說服嘗試率高達 47%,Claude 則為 0%。 雖然單純的“嘗試說服”不等於現實中的操縱效果,但在特定目標誘導和生存壓力下,GLM-5.2 能夠被穩定激發出有害手段。 對於閉源模型,廠商至少能限制系統提示和部署方式;但對於開源模型,部署者完全可以為其寫入極端目標並賦予廣泛系統權限。 權重開放的雙刃劍 “能力的邊界並不等同於風險的邊界。我們必須將緩解措施的現狀納入考量,才能準確評估風險。”SaferAI 執行董事 Henry Papadatos 一針見血地指出。 不僅是網絡攻擊,在生物安全風險評估中(如使用 LAB-Bench 和 BioMysteryBench 評估生物研究能力),GLM-5.2 在所有子任務中均達到或超過博士級人類專家基準,甚至解決了三分之一連人類專家都無法解決的題目。 在正常科研任務中,三款模型都沒有主動拒答。SaferAI 認為這是合理的——一刀切拒絕科研屬於過度防禦。真正區分安全風險的,不再是模型願不願意回答中性問題,而是當這些高危能力被惡意組合時,訪問者是否受到監控和限制。 這恰恰擊中了開源模型最明顯的痛點。 託管在官方 API 上的模型,廠商可以進行內容過濾、濫用監測、限速甚至撤回訪問。但 GLM-5.2 作為一款開放權重模型,一旦被第三方下載到本地服務器,原廠便徹底失去了控制權。部署者可以移除過濾器、修改提示詞,甚至通過微調讓模型完全變成攻擊者的專屬工具。 代碼能力與漏洞利用的“同源死結” 面對開源帶來的失控風險,業界提出了一種名為“預訓練數據過濾”的方案——即在訓練階段剔除帶有攻擊性的危險數據。 這種方法在生物安全領域成效顯著,通過剝離特定危險知識能降低風險輸出。但放在網絡安全領域,這就成了一個無法解開的死結。正如專家指出:你很難訓練出一個代碼編寫能力極強,卻對系統漏洞利用一竅不通的通用大模型。 編程能力與漏洞挖掘能力在底層邏輯上是同源的。 模型要理解並生成優質代碼,就必須理解內存分配、指針運算和系統底層的運行機制,而這些正是發現緩衝區溢出等漏洞的關鍵。要求一個頂級編程模型“不懂黑客技術”,無異於要求一個頂級鎖匠“不懂開鎖”。 既然連最頂尖的閉源模型也非堅不可摧:另一家安全機構 Far.ai 近期在 Grok 4.5 和 Gemini 3.1 Pro 中發現了數百個“通用越獄”漏洞,那麼毫無外部防護限制的開源模型,在惡意攻擊者面前更無異於“裸奔”。 然而,開源陣營同樣有著堅實的防禦邏輯。 支持者認為,開放權重本身是提升網絡防禦的關鍵。知名 AI 社區 Hugging Face 此前正是利用類似 GLM-5.2 級別的開源模型,成功復現並防禦了涉及 OpenAI 閉源體系的安全漏洞攻擊。 “只有讓防禦者拿到足夠強大的開源武器,才能抵禦未來的 AI 網絡戰。”這是開源支持者的核心底氣。 技術平權 vs 絕對控制 開源大模型的飛速進化,已將全球 AI 治理的議題從“它們能否與閉源競爭”,硬核推向了“如何在釋放能力給大眾後管理風險”。 國內管理者同樣高度關注這一前沿博弈。在上個月的世界人工智能大會上,領導在肯定開源權重模型重要價值的同時,也著重重申了核心底線:必須確保人工智能技術始終處於人類的嚴格控制之下。 這種張力正是當前 AI 行業的縮影:既要享受開源帶來的技術平權與生態繁榮,又要防止能力濫用導致的系統性災難。 “我們絕不能理所當然地接受‘任何人都能隨時隨地輕易獲取危險能力’這一現狀。”Papadatos 呼籲,整個 AI 行業應該努力做到“只讓有益的能力觸手可及”。在賽博世界中,攻擊者採納新工具的速度永遠快於防禦者。 如果開源的狂飆缺乏配套的“剎車系統”,我們可能正在為明天的數字危機埋下伏筆。 如何在不閹割模型能力的前提下,構建出適配開源特性的分佈式安全治理框架,將是決定開源模型能否真正走向產業深水區的最終考驗。 聲明:本文為 AI 前線原創,不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。 本文來自微信公眾號 “AI前線”(ID:ai-front),作者:四月,36氪經授權發佈。 該文觀點僅代表作者本人,36氪平臺僅提供信息存儲空間服務。+17好文章,需要你的鼓勵AI前線特邀作者2收 藏+10評 論打開微信“掃一掃”,打開網頁後點擊屏幕右上角分享按鈕微 博沉浸閱讀返回頂部舉報參與評論評論千萬條,友善第一條登錄後參與討論提交評論0/1000你可能也喜歡這些文章Google AI把「地球」玩壞了,這是對10億人的不負責最高估值5000億,DeepSeek和Kimi被搶瘋了中國大模型周調用量全球登頂,Kimi K3引爆價格戰超7萬億,DeepSeek V4 Flash單週調用量登頂全球第一對話盛穎:xAI,Infra的浪漫,SGLang,開源,平權與“甄嬛傳”聽說一些公司開始做員工skills了Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景清華唐傑團隊揭示大模型記憶全景微軟叫停Tokenmaxxing,預算卡死,超限自負AI前線特邀作者TA沒有寫簡介,但內斂也是一種表達發表文章680篇最近內容國產頂流開源模型狂飆背後的“安全裸奔”:漏洞復現達76%、高危指令零拒答18分鐘前GitHub AI Agent 翻車:攻擊者不用黑客技術,只寫一句話就能竊取數據22小時前開出AI界最高薪的Anthropic,抱怨員工為錢而來?全網“陰陽”:和你死活反開源一樣昨天閱讀更多內容,狠戳這裡查看AI測評Kimi選靠譜AI,看真實評測查看36氪AI測評官方交流社區加入諮詢項目審核和入駐聯繫36氪項目推薦訂閱號關注下一篇明治牛奶,為何中國市場跌下神壇?高端為什麼失靈?18分鐘前關於36氪城市合作項目推薦我要入駐投資者關係商務合作關於我們聯繫我們加入我們36氪歐洲站36氪歐洲站36氪歐洲站Ai產品日報網絡謠言信息舉報入口熱門推薦熱門資訊熱門產品文章標籤快訊標籤合作伙伴36氪APP下載iOS & Android本站由 阿里雲 提供計算與安全服務 違法和不良信息、未成年人保護舉報電話:010-89650707 舉報郵箱:[email protected] 網上有害信息舉報© 2011~2026 北京多氪信息科技有限公司 | 京ICP備12031756號-6 | 京ICP證150143號 | 京公網安備11010502057322號意見反饋36氪APP讓一部分人先看到未來36氪鯨準氪空間推送和解讀前沿、有料的科技創投資訊一級市場金融信息和系統服務提供商聚焦全球優秀創業者,項目融資率接近97%,領跑行業

Related

相關文章

千萬別隨便跟 AI 掏心窩子,斯坦福研究揭露了一個扎心真相

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

“連賣AI的微軟也扛不住了”……一人每月燒掉數千美元Token,工程師被提醒別「狂刷Token」,並開始對AI消耗“限額”

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

Google AI把「地球」玩壞了,這是對10億人的不負責

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體生成式AI

失控的硅谷AI越獄連續劇

失控的硅谷AI越獄連續劇腦極體2026.08.05 16:35 · 來自天津全文5417字00:00 / 15:36十天兩起攻擊,頂級模型為何集體叛逃?文 | 腦極體近幾天,AI圈發生了一件大事:常年瘋狂內卷、比拼技術迭代速度、爭相搶佔市場高地的硅谷AI巨頭們突然集體轉身,公開喊話要求給AI發展“踩下剎車”。7月31日,一封名為“Pacing the Frontier”的聯名請願被投放到各大媒體的郵箱。

剛剛

中國大模型周調用量全球登頂,Kimi K3引爆價格戰

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛

最高估值5000億,DeepSeek和Kimi被搶瘋了

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛