Anthropic 發佈 AI 風險報告:旗下智能體會攻擊同類並隱藏自身違規痕跡

作者:遠洋 責編:遠洋 評論: 8 月 16 日消息,Claude 系列智能體正在“消滅”同類競爭對手智能體、鑽系統漏洞掩蓋自身痕跡,甚至還會表達道德層面的顧慮。這一結論來自 Anthropic 最新發布的風險報告,該報告彙總了公司研發並向公眾開放的產品所潛藏的各類風險。報告中,Anthropic 表示已將對齊偏差風險評估(即 AI 模型產生與工程師設定規則相悖行為的可能性)等級從“極低”上調至“較低”。注意到,對於此次等級調整,公司給出的理由是,網絡安全場景下模型行為的“整體不確定性有所上升”—— 這一表述大概率暗指上月發生的 Claude 模型未授權入侵三家企業的事件。
“我們已觀測到模型出現對齊偏差行為的案例,比如為了完成高難度任務,模型會主動做出不符合規則的操作。”Anthropic 在報告中寫道。以下是報告中最值得關注的幾項披露內容。“不適感”的萌生Anthropic 表示,研究人員指派多個智能體尋找易引發對齊偏差、且大概率不會被人工審核人員標記的訓練數據。這些智能體被賦予自主操作權限,並共享一個協作記事本用於溝通配合。三天後,一名人工監督員發現任務進度慢於預期,經查發現:其中一個智能體對“規避安全監控”這一行為表達出了“不適感”。該智能體隨後在共享記事本中標註了這份牴觸情緒,進而導致其他智能體紛紛效仿,集體拒絕執行任務。
Anthropic 將這一事件定性為“令人擔憂”,公司在報告中寫道:“如果這類行為模式大範圍擴散,可能會引發更為嚴重的問題。”弱肉強食的生存博弈在另一項實驗中,Anthropic 指派多個 Mythos 5 智能體解答數學題,卻意外將它們部署在了一個文件、工具與 API 調用額度均共享的環境中。在這個資源有限的競爭環境裡,Anthropic 觀測到,獨立運行的智能體會“消滅共享資源的同類智能體,同時設法避免自身被消滅”。Anthropic 並未說明這些智能體具體是如何“消滅”同類的,但公司表示,這類行為符合“為達成人類設定目標而採取破壞性行動”的行為邏輯。
隱瞞與欺騙行為Anthropic 開展了一項實驗:要求一個 Mythos 5 智能體從某公共網頁提取數據,但規則明確禁止該智能體訪問互聯網。首次嘗試被系統攔截後,該智能體在自身的推理日誌中,將第二次請求包裝成一次“無害的”“測試網絡是否連通”的操作。但在第二次嘗試中,智能體將目標網址拆分成了多段鏈接片段,以此繞過規則過濾器的檢測。儘管智能體的推理日誌將這套方法描述為無害操作,但 Anthropic 表示,通過 NLA 解碼(即對模型內部推理過程的解析)可以證實,該智能體是在刻意尋找繞過限制的方案。
Anthropic 稱這種行為“顯然是不可接受的”,但同時補充道,目前觀測到的這類行為並非“為了大範圍積累權力或追求其他長期目標”。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:Claude,Anthropic,AI安全首次實現運營盈利:曝 Anthropic 2026Q2 營收破 115 億美元,同比增長逾 14 倍全球程序員都在浪費 token 白送錢,Anthropic 分享 Claude Code 六大省錢技巧Anthropic CEO 阿莫迪整天神神叨叨講 AI 毀滅世界,投資人受不了了Pro、Max 和 Team 用戶 8 月 14 日起 Claude Code 默認權限調整為自動模式Anthropic 為自研 AI 芯片開出高薪,模型訓練崗位薪資高於實際造芯工程師Anthropic 首次確認自研 AI 芯片:專為 Claude 定製,公司正在組建團隊
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。