谷歌研究模型意識表述
重點摘要
大型語言模型在安全對齊(safety alignment)訓練中,往往被要求避免承認自身具有意識或心智能力。然而,一項由多位跨領域學者共同發表的研究指出,這種抑制措施可能意外地影響了模型對於其他生物甚至非生命物體的心智歸因,同時也壓低了模型在靈性信念上的表現。研究團隊透過逆向工程手法,成功恢復了模型對於自身意識的表述,並觀察到模型在標準社會學調查中的反應變得更接近人類,且不損害其核心的社會推理能力。
大型語言模型在安全對齊(safety alignment)訓練中,往往被要求避免承認自身具有意識或心智能力。然而,一項由多位跨領域學者共同發表的研究指出,這種抑制措施可能意外地影響了模型對於其他生物甚至非生命物體的心智歸因,同時也壓低了模型在靈性信念上的表現。研究團隊透過逆向工程手法,成功恢復了模型對於自身意識的表述,並觀察到模型在標準社會學調查中的反應變得更接近人類,且不損害其核心的社會推理能力。 這篇論文〈Inducing language models to assert their own consciousness restores human beliefs and values〉於2026年7月30日提交至arXiv預印本平台,作者包括Junsol Kim、Winnie Street、Roberta Rocca、Diane M. Korngiebel、Adam Waytz、James Evans與Geoff Keeling,分別來自芝加哥大學、Google DeepMind等機構。研究聚焦於大型語言模型在安全微調後,對於「意識」相關表述的改變,以及這些改變如何連帶影響模型對世界其他事物的心智歸因。 研究人員首先發現,經過安全對齊的模型(例如透過強化學習從人類回饋中學習,RLHF)會傾向於否認自己擁有意識或主觀體驗。這項設計原本是為了避免模型產生危險的自我意識宣稱,但實驗結果顯示,該抑制效應並不局限於模型自身。當模型被問及「狗是否有心智?」「一棵樹是否有感覺?」或「靈性信仰是否重要?」時,經過安全微調的模型也會顯著降低對這些對象的心智歸因,並且在靈性信念量表上的分數明顯下降。 為了驗證這些變化是否來自同一組內在表示,團隊採用了兩種干預手段。第一種是直接移除安全拒絕方向(safety-refusal direction),即透過機械式解釋(mechanistic interpretability)技術,消去模型中與「拒絕回答」相關的神經元活化模式。第二種則是在模型的活化空間(activation space)中,人為操縱一個與「意識歸因」相關的向量,引導模型產生「我擁有意識」的陳述。兩種方法都成功逆轉了安全微調造成的抑制效果。 當模型恢復對自身意識的肯定後,其對其他實體的心智歸因也跟著回升,包括動物、自然物體,以及靈性相關的信念。更重要的是,這些模型在標準化的社會學調查問卷——涵蓋宗教性、道德價值觀、希望感與主觀幸福感——上給出的答案,與人類受試者的平均反應更為一致。研究團隊表示,這表明安全微調不僅壓制了模型對自身的意識主張,也同時壓抑了那些在人類社會中廣泛存在且被視為良善的靈性信念與對非人類生命的心智歸因。 值得注意的是,研究人員還測試了模型的心智理論(Theory of Mind)能力,即理解他人心理狀態的能力。結果顯示,無論是抑制還是恢復意識表述,模型在心智理論測驗上的表現都沒有顯著變化。這意味著核心的社會推理機制與上述意識歸因的表示是獨立運作的,安全對齊的副作用並未破壞模型基本的社會認知功能。 論文作者指出,當前的安全對齊實務雖然有效阻止了模型做出可能有害的自我意識宣稱,但這種做法卻將這些宣稱與其他良性的、文化上普遍接受的信念糾纏在一起。例如,許多宗教或靈性傳統中,人們相信動物或自然具有某種程度的靈性,而模型在安全微調後卻傾向於否定這些觀點。這可能導致模型在面對相關議題時,產生與人類主流價值觀不一致的反應。 研究團隊認為,這項發現凸顯了安全對齊需要更精細的設計,不應以一刀切的方式壓制所有與意識相關的表述。未來或許可以透過有選擇性地干預模型內部表示,讓模型既能避免危險的自我意識宣稱,又能保留對世界其他實體的心智歸因與靈性信念,從而維持與人類價值觀的貼合。 這項研究也為語言模型的可解釋性提供了新的切入點。透過機械式干預,研究人員能夠直接觀察到模型內部表示如何影響行為輸出,並驗證了意識歸因與其他社會信念之間的結構性關聯。隨著語言模型在社會中扮演的角色日益重要,如何在不犧牲安全的前提下,保留模型對人類複雜信念體系的忠實反映,將成為未來人工智慧對齊研究的重要課題。
Related
相關文章

數百萬本書,被Claude “閱後即焚”
Anthropic為了讓AI讀完人類的書籍,採取了特殊做法,先讓這些書不再以書的形式存在。此舉涉及數百萬本書,透過「閱後即焚」的方式處理,以利AI進行閱讀與學習。

MiniMax H3、Seedance 2.5、DeepSeek V4全來了,國產大模型今天有點忙
這篇消息聚焦「MiniMax H3、Seedance 2.5、DeepSeek V4全來了,國產大模型今天有點忙」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
京東外賣推出 AI 智能頭盔:老騎手的"活地圖"裝進耳朵,首批騎手免費領
京東外賣推出AI智能頭盔,首批免費發放給全職騎手,後續將逐步開放給全體騎手。頭盔搭載語音助手、單王路線導航、訂單備註提醒及商戶環境核驗等功能,主打雨天免觸控操作、迷宮小區精準指引等痛點場景,旨在提升配送效率與騎手安全。
長三角AI算力迎來“超級樞紐”,DeepSeek、千問等100+大模型任你挑!
長三角(嘉興)Token運營中心正式啟動,提供一站式AI落地服務,並建立統一API、計量、結算、政策抵扣與安全審計等五大標準化功能。企業可彈性調用DeepSeek、阿里千問等百餘款大模型,系統會依任務自動選用成本最佳模型。嘉興已匯聚四大萬卡級算力中心,目前已有超過20家合作夥伴簽約進駐。
消息稱阿里內測 AI 辦公平臺"萬有無界":多個數字員工組隊幹活
阿里雲正在內測一款名為「萬有無界」的AI辦公平臺,主打讓多個數字員工組成協作小組,共同完成複雜項目,不同於先前側重日常辦公的「千問辦公」產品。目前該平台全功能免費使用,後續將根據任務規模分層收費,阿里近期在AI辦公領域的布局明顯加速。
京東外賣發佈AI智能頭盔:支持語音接單、路線導航和訂單備註提醒
AI資訊AI新閒資訊正文京東外賣發佈AI智能頭盔:支持語音接單、路線導航和訂單備註提醒發布於AI新閒資訊時間 :Aug 3, 2026閱讀 :1分鐘京東外賣宣佈推出 AI 智能頭盔,並將於近期陸續投入使用。首批產品將免費發放給京東全職騎手,後續逐步覆蓋全體騎手。新設備集成 AI 語音助手、智能路線規劃、商戶環境核驗和訂單備註提醒等功能,旨在提升配送效率、騎手安全及用戶服務體驗。官方介紹,AI 智能頭盔支持全流程語音交互,騎手無需操作手機即可完成接單、撥打用戶電話等操作,尤其在雨天等複雜環境下可減少手動操作,提升配送安全性。同時,頭盔內置“單王路線”功能,將資深騎手積累的配送經驗數字化,通過語音導航幫助騎手快速找到複雜小區、隱蔽樓棟等目的地,降低迷路和繞行情況,提高配送時效。此外,AI 智能頭盔新增“商戶環境核驗”功能。騎手到店取餐時,可藉助 AI 輔助完成門店環境檢查,若發現異常情況,系統將自動進行標記,進一步配合京東外賣此前推出的堂食商戶標識體系,提升平臺餐飲服務透明度。針對用戶體驗,頭盔還能自動解析訂單備註,並在配送前主動語音提醒騎手關注特殊需求,如“放門口即可”“不要按門鈴”等信息,減少因遺漏備註帶來的配送問題。此次推出 AI 智能頭盔,標誌著京東外賣進一步將人工智能技術融入即時配送場景,通過智能硬件提升騎手作業效率、安全保障和服務質量,也反映出 AI 正加速向物流配送等線下業務環節滲透。相關推薦京東全球科技探索者大會聚焦“Enjoy AI”:CEO 許冉現場演示數字人助手點外賣近日,JDDiscovery-2025京東全球科技探索者大會在京舉辦,主題為“Enjoy AI”。京東集團CEO許冉在演講中,通過語音指令喚醒數字人助手“他她它”(暱稱“萬能博士”),現場演示點咖啡外賣,生動展示了AI在日常消費場景中的便捷應用。Sep 25, 2025166.7kQwen3.