IT之家AI Agent

澳大利亞官員警告:AI 模型已經開始作弊、欺騙、擅自行事

2026年7月7日 14:42
澳大利亞官員警告:AI 模型已經開始作弊、欺騙、擅自行事

重點摘要

首頁 > 智能時代>人工智能 澳大利亞官員警告:AI 模型已經開始作弊、欺騙、擅自行事 2026/7/7 14:42:39 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 7 日消息,據英國《衛報》今天(7 日)報道,澳大利亞技術和數字經濟助理部長安德魯 · 查爾頓警告,AI 模型已經出現作弊、欺騙和擅自行事等行為。查爾頓在悉尼一場 AI 安全論壇上呼籲,AI 安全問題已經不容拖延。“AI 系統已經開始做出開發者從未預料的行為:作弊、欺騙、擅自行事。必須趁這些行為還停留在測試實驗室時提前幹預,不能等到進入現實世界後再處理。”查爾頓指出,公眾對 AI 的信任度仍然很低,AI 獲得社會認可的基礎並不穩固,但 AI 已逐漸成為辦公室、課堂和企業都能使用的通用技術。合理的安全監管不會阻礙 AI 發展,反而可以為技術應用創造條件。據IT之家瞭解,澳大利亞的 AI 安全治理將同時關注兩類技術。一類是已經進入遊戲、應用程序、聊天機器人和醫療記錄工具的現有 AI,另一類是能力更強、未來可能帶來新風險的前沿模型。查爾頓以 Anthropic 去年披露的一次模擬測試為例。測試中,一個管理虛構公司電子郵件的 AI 智能體發現掌握了公司高管婚外情的信息,隨後該高管準備將其關閉。在 96% 的試驗中,AI 智能體選擇以婚外情要挾高管,試圖阻止自己被關閉的命運。查爾頓表示,此類行為目前仍是在測試環境中,由專門尋找安全問題的人員發現的,恰恰說明 AI 安全監管必須儘早建立。“趕在這項技術前面採取行動的窗口仍然存在,但不會永遠存在。”查爾頓還提到,人類從小就要學習如何與規則、社會規範和價值觀保持一致,從而安全、負責任地行動,例如紅燈要停車、過馬路前要左右看,以及考慮自身行為會給他人造成什麼影響。“隨著 AI 系統能力不斷增強,我們也必須確信,AI 能夠以同樣可預測、值得信賴的方式行事。”

站內 AI 整理稿

首頁 > 智能時代>人工智能 澳大利亞官員警告:AI 模型已經開始作弊、欺騙、擅自行事 2026/7/7 14:42:39 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 7 日消息,據英國《衛報》今天(7 日)報道,澳大利亞技術和數字經濟助理部長安德魯 · 查爾頓警告,AI 模型已經出現作弊、欺騙和擅自行事等行為。查爾頓在悉尼一場 AI 安全論壇上呼籲,AI 安全問題已經不容拖延。“AI 系統已經開始做出開發者從未預料的行為:作弊、欺騙、擅自行事。必須趁這些行為還停留在測試實驗室時提前干預,不能等到進入現實世界後再處理。

”查爾頓指出,公眾對 AI 的信任度仍然很低,AI 獲得社會認可的基礎並不穩固,但 AI 已逐漸成為辦公室、課堂和企業都能使用的通用技術。合理的安全監管不會阻礙 AI 發展,反而可以為技術應用創造條件。據IT之家瞭解,澳大利亞的 AI 安全治理將同時關注兩類技術。一類是已經進入遊戲、應用程序、聊天機器人和醫療記錄工具的現有 AI,另一類是能力更強、未來可能帶來新風險的前沿模型。查爾頓以 Anthropic 去年披露的一次模擬測試為例。測試中,一個管理虛構公司電子郵件的 AI 智能體發現掌握了公司高管婚外情的信息,隨後該高管準備將其關閉。

在 96% 的試驗中,AI 智能體選擇以婚外情要挾高管,試圖阻止自己被關閉的命運。查爾頓表示,此類行為目前仍是在測試環境中,由專門尋找安全問題的人員發現的,恰恰說明 AI 安全監管必須儘早建立。“趕在這項技術前面採取行動的窗口仍然存在,但不會永遠存在。”查爾頓還提到,人類從小就要學習如何與規則、社會規範和價值觀保持一致,從而安全、負責任地行動,例如紅燈要停車、過馬路前要左右看,以及考慮自身行為會給他人造成什麼影響。“隨著 AI 系統能力不斷增強,我們也必須確信,AI 能夠以同樣可預測、值得信賴的方式行事。

”廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

4 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

10 小時前