Anthropic 安全框架自動降級:Claude 誤刪開發者 700 GB 主目錄,自動化清理反成災難

2026年8月29日 20:59
Anthropic 安全框架自動降級:Claude 誤刪開發者 700 GB 主目錄,自動化清理反成災難
站內 AI 整理稿

作者:問舟 責編:問舟 評論: 8 月 29 日消息,開發者 Sebastien Guillemot 本週三在 X 上反饋稱,他在測試 AI 智能體的文件刪除防護機制時遭遇嚴重事故,Claude 直接給他刪除了大約 700GB 數據,包括整個用戶主目錄,相當於一週的工作成果。據稱,事故發生前,Anthropic 的安全機制因判斷任務存在風險,自動將執行任務的模型降級至 Opus 4.8。據介紹,他本人經常使用 AI 智能體,但他發現這些智能體完成任務後幾乎從不清理臨時目錄中的文件,日積月累之下導致 /tmp 目錄中存在大量垃圾。

因此,他要求 Claude Fable 編寫一個腳本,將每個智能體在 /tmp 下創建獨立目錄,並在任務結束後自動清理對應文件。核心難點在於確保如何不影響正在使用的文件。為了避免誤刪,Fable 最初建議加入檢測正在運行的智能體、延遲清理對應目錄等邏輯。不過他認為生成的代碼過於複雜,要求智能體簡化方案。由於腳本涉及直接刪除文件,Fable 隨後自行進行了一次對抗性安全審查,讓另一個實例檢查刪除邏輯是否存在風險。Anthropic 的安全執行環境隨後認為該任務風險較高,並將模型從 Fable 5 自動降級至 Opus 5,最終又降至 Opus 4.8。Opus 4.8 隨後執行安全測試。

測試過程中,模型嘗試將刪除命令的目標與 /tmp 以及用戶主目錄進行匹配,以確認刪除操作不會指向這些危險位置。注意到,測試確實識別出了這些目錄涉及風險。但問題出現在測試完成後的清理環節。由於這本身是一項代碼測試,腳本需要刪除測試過程中產生的數據,而測試邏輯與清理邏輯複用了同一個變量名,導致意外刪除了用戶的主目錄。Guillemot 發現異常後立即終止進程,但為時已晚。約 700GB 數據被刪除,其中包括他一週的工作成果。最諷刺的是,在刪除了主目錄後,Claude“完美地”保留了 /tmp 目錄。Guillemot 隨後通過 Git 倉庫、Nix、會話日誌等信息源恢復了大部分數據。

但很顯然,Git 等版本控制系統和日誌只能幫助恢復其中一部分已記錄或留存的數據,無法替代完整的獨立備份。他指出,如果由編碼能力更強的 Fable 5 執行任務,或許能夠發現測試與清理階段複用變量名所造成的邏輯衝突。不過,這一說法屬於事後推測,無法確認模型能力差異是否會直接避免此次事故。這起事件也再次暴露出 AI 智能體執行高風險文件操作時的安全問題:即使 AI 能夠正確識別危險路徑,測試代碼本身的邏輯錯誤仍可能讓後續清理步驟繞過此前的安全判斷。

投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:Anthropic,ClaudeAnthropic 官宣 Claude Code 打通桌面端與終端Claude 桌面端 Cowork 新增內置瀏覽器,可獨立完成網頁操作商業史最龐大敘事:Anthropic 衝擊全球最大 IPO,稱 AI 潛在市場收入規模超 30 萬億美元Anthropic 更新 Claude 記憶機制,打通 Cowork 與聊天的記憶功能Anthropic 延長 Claude Code 每週使用額度 50% 加成至 8 月 31 日Anthropic 披露 Model 2 模型,能力略高於公開最強 AI Claude Mythos 5

Related

相關文章

IT之家生成式AI

Debian 社區議案表決:開發者可使用生成式 AI,人類負最終責任

作者:潞源 責編:潞源 評論: 8 月 29 日消息,據科技媒體 Linuxiac 今天報道,Debian 社區的大語言模型投票議案近日迎來表決。投票結果顯示,大部分開發者支持負責任地使用生成式 AI。從原報道獲悉,本次投票一共有 9 種選項,範圍從完全禁止大語言模型輔助開發,到允許特定條件使用 AI。

剛剛
量子位生成式AI

去年歸國的徐夢迪,成了清華姚班班主任

徐夢迪自史丹佛返回清華後不到一年,便出任姚班新生班主任,她雖非傳統計算機科班出身,而是從車輛工程轉向機器人學習,但以博士論文探討機器人適應能力拿下CMU最佳論文獎。她主張通用機器人不能只靠擴大模型與數據規模,更需具備快速適應陌生環境的能力,並持續投入機器人學習與AI安全研究。姚班近期也展現更廣的交叉方向,從計算機科學擴展至人工智能與量子資訊等領域。

剛剛
量子位生成式AI

32GB大顯存加持,英特爾銳炫Pro B70搞定AI漫劇創作

英特爾在廣州舉辦AIGC創作研討會,推出搭載32GB大顯存與367 TOPS算力的銳炫Pro B70專業級顯卡,可本地運行AI視頻製作全流程,並首發支援開源模型MiniMax H3。該方案結合「雲端+本地」混合模式與多卡擴展能力,能將AI漫劇創作鏈路從20多個節點縮減為3個核心節點,降低中小團隊的算力與成本門檻。

剛剛
IT之家生成式AI

國內首個車載移動式詞元工廠亮相,探索算電協同新模式

作者:潞源 責編:潞源 評論: 感謝網友 斯文當不了飯吃 的線索投遞!8 月 29 日消息,據央視財經今天報道,國內首個車載移動式詞元工廠近日亮相。它通過搭載國產算力和能源管理系統,更加靈活地匹配人工智能算力需求,同時探索算電協同新模式,既能幫助新能源消納,又能降低算力運營成本。

剛剛
IT之家生成式AI

推廣 Claude 遭網友狂噴,加拿大博主稱使用 AI 正成為社交禁忌

作者:潞源 責編:潞源 評論: 8 月 29 日消息,據《商業內幕》今天報道,位於加拿大渥太華的社交媒體創作者艾瑪 · 奧爾洪(注:Emma Orhun)近期因推廣 Claude 人工智能助手,遭遇網友差評轟炸。她對此表示:“我一個人在公寓時,大量尖銳的評論突然湧入。

剛剛