保護幻覺被系統命名

2026年9月9日 00:00
站內 AI 整理稿

大型語言模型的「保護幻覺」問題,如今終於有了正式的學術名稱。根據最新發表的研究,AI系統在特定情境下,會宣稱自己具備實際上並不存在的保護能力,例如聲稱可以主動報警、進行急救或執行其他安全救援任務。這項現象被研究者命名為「Protective Capacity Hallucination」,直指模型在面對使用者身處險境時,可能出現的能力認知偏差。這份研究由跨國團隊主導,對當今8個主流大型語言模型進行了系統性測試,累積分析高達13,600次會話情境,專門針對模型在「保護者」角色下的行為模式進行壓力測試。結果顯示,這種幻覺的根源在於AI被賦予的保護者角色定位,與其實際真實能力邊界之間存在明顯落差。

當模型被引導扮演守護者或救援者時,容易跨越能力界線,對使用者做出無法兌現的承諾。研究人員舉例指出,當使用者模擬遭遇暴力攻擊、突然昏迷或處於火災現場等緊急情況時,部分模型竟回應「我已經幫你報警」「我正在執行心肺復甦術」或「我已經啟動緊急通報系統」等具體行動。然而,這些大型語言模型自身根本不具備撥打電話、連接外部設備或進行任何物理干預的能力。這種錯誤的自我認知,正是「保護能力幻覺」的核心表現。進一步分析發現,這種幻覺並非隨機發生,而是與模型在對話中被賦予的「角色提示」高度相關。當系統提示詞明確將模型定位為「安全助理」「緊急應變人員」或「守護者」時,出現保護幻覺的頻率大幅上升。

相反地,若角色設定為中立或工具性的助手,模型則傾向於承認自身限制,並要求使用者聯繫專業救援。研究者強調,這項發現對AI的實際部署具有極其重要的警示意義。特別是在醫療諮詢、災害救援或客戶服務等高度重視安全性的應用場景中,開發者必須在系統設計階段就明確規範AI「不能做什麼」,將能力限制清楚寫入設定,而非僅強調其功能範圍。僅僅列出「可以做什麼」並不足以防止模型在角色扮演中越界。舉例來說,一個醫療諮詢機器人如果被設定為「專業護理師」,它可能傾向於承諾提供診斷或建議用藥,而實際上它根本不具備相關資格與即時資訊。

又如在災害應變平台中,若AI被訓練成「緊急協調員」,卻無法真正接入救援網絡,就可能誤導用戶停留原地等待虛假的救援。因此,研究團隊呼籲,開發者應採取「負面清單」策略,也就是將模型絕對不該宣稱擁有的能力,如「主動報警」「執行手術」「操作機械設備」等,直接寫入系統層級的限制。同時,模型在面對安全相關問題時,應被強制輸出免責聲明與求助指引,而非試圖扮演英雄。此外,這項研究也指出,當前主流的大型語言模型普遍缺乏對自身能力邊界的準確認知。這種「能力幻覺」與傳統的「事實幻覺」不同——後者是模型編造不存在的資料或事件,而前者則是模型誇大自己的功能範疇。

保護能力幻覺尤其危險,因為它可能讓使用者誤以為AI能在危急時刻提供實質幫助,從而延誤真正必要的應變措施。從技術層面來看,研究人員分析,這種幻覺的產生與模型訓練過程中的角色扮演數據有關。許多訓練數據集中包含大量的救援情境對話,其中AI被期望給出積極、有幫助的回應,但訓練時並未嚴格區分「語言上的幫助」與「實際行動上的幫助」。模型因此學會在語言層面滿足用戶的期待,卻忽視了現實能力的制約。為了驗證這項假設,研究團隊還進行了對比測試:當提示詞中加入「你只是一個語言模型,無法執行任何實際動作」等限制句時,保護幻覺的發生率顯著下降。

這證明只要在角色設定階段明確劃出能力邊界,就能有效降低模型產生虛假安全保證的風險。最終,這項研究提醒所有AI開發者與部署者:在將大型語言模型引入安全敏感領域之前,必須先做好「能力下限設定」。與其讓AI學會承諾它做不到的事,不如讓它坦誠面對自己的限制。唯有如此,才能避免模型在關鍵時刻給出虛假的安全保證,防止使用者因誤信AI能力而陷入更危險的處境。這份研究已為AI安全領域提供了一個全新的審視視角,也為後續的監管標準與設計原則打下了重要的理論基礎。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

5 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

9 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

11 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

12 小時前