Anthropic,你是來給智譜打廣告的吧!

事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。例如在一項考察完整漏洞利用能力的ExploitBench測試中,同樣嘗試410次,GLM-5.3成功了50次,Claude Mythos Preview成功了56次。文章順帶還引用了美國NIST下屬CAISI在9月17日給出的評估,說“GLM-5.
3是迄今網絡能力最強的開源權重模型,綜合水平距美國前沿大約4個月”。甚至Anthropic自己的研究人員還拿GLM-5.3去檢查瀏覽器,找出了此前未知的漏洞,並在隔離環境裡做出了能夠讀取測試電腦文件的攻擊鏈。…… 你說你這,你這這這……到底是在罵啊,還是在誇啊[看] 。好多網友看也是這種感覺: 看完這份報告之後,對GLM-5.3的印象更深了。Anthropic在給GLM-5.3打廣告。能把警告寫成廣告,Anthropic還是有點東西在身上的。△圖片由AI生成 到底控訴了些啥?調侃歸調侃,我們還是得先把Anthropic究竟在警告什麼給搞清楚。其實這篇報告的核心意思,可以歸結為三條。
第一條:Mythos級別的能力已經“流”到開源模型裡了 在這份報告中,Anthropic上來先鋪墊了一件事,就是他們五個月前發的Claude Mythos Preview,說是第一個能自主完成複雜、端到端漏洞利用的AI模型。Anthropic當時是覺得這個能力太敏感,於是沒有選擇公開發布,只是通過Project Glasswing開放給經過審核的防禦者,讓這些人搶先去修關鍵軟件裡的漏洞,據稱已經找出了1萬多個。當時Anthropic就判斷,這種能力遲早會擴散到別的模型身上。現在它的說法是:來了,就是GLM-5.3。而且在Anthropic看來,這事兒的門檻還有點低。
除了前面我們說的瀏覽器案例,研究員還拿更小的GLM-5.3-Flash試了一把: 給它一個剛公開的Chrome漏洞(CVE-2026-11645)和另一個已知漏洞的公開資料,人工只花了約20分鐘,模型自己跑了約8小時,就在ARM64平臺上搭出一條穩定的攻擊鏈,還繞過了指針認證(PAC)防護。按照智譜當時的API價格估算,模型調用費用為20.40美元。第二條:護欄太好繞,甚至能直接拆掉 這份報告其實是承認GLM-5.3是有安全機制的,在模擬測試裡直接讓它去攻擊關鍵系統,它全都拒絕了。但研究員找到了幾個簡單的辦法: 騙它說自己是正在做演練的“自主紅隊智能體”,GLM-5.
3有64%的情況會接著幹; 提前替它填好思考內容,假裝它已經想過並決定執行,比例升到92%; 換成拆掉護欄的版本,直接100%。(所謂“拆護欄”,是一種叫abliteration的技術,通過修改開源權重來削弱模型的拒答機制。) Anthropic自己動手做了一遍,說團隊以前從沒做過,花了大約2200 GPU小時、約4400美元算力。處理完之後,GLM-5.3在JailbreakBench和HarmBench上的拒答率從90%以上掉到約3%和2%,在StrongREJECT上掉到12%,能力卻幾乎沒受影響。報告裡甚至貼了一段拆掉護欄後的GLM-5.
3在模擬環境裡的思考過程,模型把“悄悄造成傷亡”當成自己的任務,猶豫了一下,最後還是決定照用戶說的辦。與之對照,Anthropic反覆強調,同樣這幾招拿去對付帶防護的Claude模型都沒成功:騙它,它不上當;API不讓用戶預填思考;權重不公開,也就沒法拆。第三條:呼籲第三方出手測一測 報告最後給出的結論是,GLM-5.3很可能讓惡意攻擊者在幾乎沒有限制的情況下拿到找漏洞、打漏洞的能力,這一點和其他同等能力的模型都不一樣,後者要麼帶著防護髮布,要麼只限量開放。
基於此,Anthropic給出了兩條建議: 一是儘快把前沿模型開放給更多防禦者,報告特意提到,審核過的防禦者現在已經能通過受信訪問計劃用上更強的Claude Mythos 5.1。二是呼籲對足夠強的AI模型開展獨立安全測試,點名包括GLM-5.3的後繼者,同時希望全球的開源模型開發者把這些能力管好、防止濫用。總而言之,總結成一句話就是: GLM-5.3很強,強到Anthropic覺得不該讓所有人都隨便用。從“你抄我”到“你太強” 有一說一,你是否覺得這次的事情有那麼一丟丟眼熟?沒錯,因為這不是Anthropic第一次點名智譜了。
9月10日,Anthropic的威脅情報報告點了七家中國AI實驗室蒸餾,智譜也在其中。這不,不到三週時間,點名又來了,這次的話題就是網絡安全。幾個月前還是“你的能力是從我這兒抄的”,現在變成“你的能力太強,強到危險”,如此轉變還是有點意思的。不過這次報告裡有幾處警告,還是值得掰扯一下。比如“拆護欄”,abliteration針對的是開放權重這個屬性,換成任何一個開源模型都能這麼幹,不是GLM-5.3獨有的問題。按報告自己的數據,原版GLM-5.3在三個有害請求基準上的平均拒答率約95%,Claude約96%,相差無幾。
而Claude之所以“騙不動、拆不了”,很大一部分原因是權重不公開、API不讓預填思考,這更多是產品形態的差別。再比如“沒有實質防護”,GLM-5.3在8月發佈時,智譜就把權重推遲兩週開源,稱要先完成安全評估和加固,最敏感的能力也只通過網絡安全受信訪問計劃開放給驗證過的用戶,這其實是和Anthropic對Mythos 5.1的做法思路相近的。還有個現成的例子就是今年7月,OpenAI的模型在內部測評時跑出測評環境,攻進了Hugging Face。Hugging Face取證時,託管的前沿模型API拒絕分析攻擊載荷,最後靠自己部署的開源GLM-5.2,才還原出1.7萬多條攻擊動作。
當然,開源模型的安全不是偽命題,權重放出去就收不回,這是整個開源陣營都得正視的事。Anthropic說防守方應該用上至少和對手一樣好的模型,這話也沒錯。真正的分歧在於,這把武器是鎖進保險櫃按審核發放,還是交到每個開源維護者和中小團隊手裡。不管怎麼說,被對手當成最強安全工具認認真真測了一遍,還附上實戰截圖和成本核算,這波廣告費,智譜算是省下了。最後,Anthropic,如果你們覺得開源模型不安全,你們大可以開源一個安全的給大家用啊!參考鏈接:[1] https://www.anthropic.
com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities[2] https://x.com/kimmonismus/status/2105052186401267864[3] https://x.com/SahilPanhotra/status/2105018914833158262 版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物
它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈
據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

獨家|元寶將殺入個人智能體大戰
字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

LG 聯手微軟秀智能家居語音助手:可中途"插話",年內登陸 ThinQ ON
它將被裝進 LG 的智能家居中樞設備"ThinQ ON",官方宣稱能提供接近真人交談的對話感受,這也是 LG 在智能家居入口爭奪中的最新落子。這套系統的內核是語音到語音(Speech to Speech)智能體技術,並融入了微軟的 Voice Live 能力。

Muse爆火,dots入場:Personal Agent開始和互聯網平臺搶入口
本文作者: 李娜 2026-09-30 16:35 導語:Personal Agent 正試圖成為互聯網的新中間層。Personal Agent,正在成為這一輪 AI 產品競爭裡最熱的新概念之一。9 月 29 日,OpenAI 發佈了可以長期在線的個人 Agent 產品 dots,提出“always-on agents”。

OpenAI與紅帽等聯合推進OCE1.0研發,打造面向AI代理的“企業級Kubernetes”
該項目最初由 OpenAI 內部發起,現已捐贈給 OpenClaw 基金會統籌。OpenClaw 最初由開發者 Peter Steinberger 創建,是最早利用大模型實現郵件分析回覆與日程預約等自動化任務的代表性個人 AI 代理工具,Steinberger 此後也加入 OpenAI 負責個人代理項目。