視覺語言模型心智測試
重點摘要
視覺語言模型心智測試。 多模態模型存在心智斷裂現象。實驗結果見心智理論論文原文所述。測試顯示模型 ��� 任務表現差異很大。自我偏差在導演任務中達到了高位。動畫測試下其表現更接近自閉成人。
一項針對視覺語言模型(Vision-Language Model)進行的心智理論(Theory of Mind)測試近日公布結果,研究發現這類具備多模態能力的系統在處理涉及他人心理狀態的任務時,普遍出現明顯的「心智斷裂」現象。這項研究設計了多種不同的實驗任務,用以評估各家模型在社會認知層面的表現,結果顯示不同模型之間的差異相當懸殊,並非所有系統都具備同等程度的社會推理能力,部分模型在特定情境下的表現甚至遠低於預期。所謂心智理論,是指個體能否理解他人擁有與自己不同的信念、意圖、情緒與知識狀態,並據此推測他人行為的能力。
這項能力是人類社會互動的基礎,也是人工智慧系統若要真正融入人類生活、進行自然協作所不可或缺的關鍵環節。然而,這項最新研究卻揭示出,即便當前最先進的視覺語言模型在影像辨識與語言生成等任務上已展現出高度水準,但在需要推論他人心理狀態的社會情境中,仍然存在相當大的進步空間。研究團隊特別設計了「導演任務」(Director Task)來測試模型的視角取替能力。在這類任務中,模型必須根據一個「導演」角色所看到的資訊來做出判斷,而導演所掌握的資訊可能與模型自身從畫面中獲得的資訊不完全一致。
結果顯示,模型在執行這項任務時,自我偏差指數達到高點,意味著它們極難區分「自己知道什麼」與「他人當下能知道什麼」之間的界線。這種將自身所知資訊投射到他人身上的傾向,正是社會認知推理上的根本缺陷。自我偏差的現象在人類發展心理學中早有研究,幼童在成長過程中往往需要經過一段時間才能逐漸克服這種以自我為中心的認知傾向。然而,這項研究顯示,當前視覺語言模型在這方面的表現,似乎仍停留在一個相當初階的階段。當模型看到完整場景時,它便傾向於假設對話中的另一方也同樣看到了完整場景,即使實驗設計明確暗示對方只能看到部分資訊,模型仍難以調整自己的回應策略。
除了導演任務之外,研究團隊還進一步採用了動畫測試來評估模型對他人心理狀態的推論能力。這項測試的結果更為引人注目:視覺語言模型在該情境下的反應模式,竟然與自閉症成人的表現更為接近。這項發現並非意味著模型具有任何病理特徵,而是反映出它們在處理社會訊息時,採用的策略與典型發展個體有本質上的差異,反而與自閉症患者在解讀社會情境時所展現的某些特徵模式有相似之處。這項發現為人工智慧研究領域投下了一枚震撼彈。過去幾年來,視覺語言模型的發展可謂一日千里,從影像問答、圖文生成到跨模態理解,各項基準測試的分數屢屢被刷新。
然而,這項研究卻清楚地指出,模型在「看懂」畫面的同時,未必能「理解」畫面中人物之間複雜的社會關係與心理狀態。換言之,視覺語言模型在感知層面的能力飛速成長,但在認知層面的社會推理能力卻未能同步跟上。研究團隊指出,這種「心智斷裂」現象的普遍存在,凸顯出當前多模態模型在理解他人信念、意圖與視角時仍有明顯侷限。即便模型能夠準確辨識出畫面中的人物、物體與動作,它們仍然難以進一步推論這些人物各自知道什麼、相信什麼,或者他們在當下情境中可能抱持何種意圖。這種能力的缺失,將直接影響模型在需要社會智慧的應用場景中的表現,例如人機協作、教育輔助、照護機器人等領域。
值得注意的是,不同模型之間的表現差異極大,這意味著「心智理論能力」並非所有視覺語言模型共同具備或共同缺乏的統一特質,而是與模型的架構設計、訓練資料與訓練方式密切相關。某些模型在特定任務上展現出相對較好的社會推理能力,顯示這項能力是可以透過某種方式被模型所習得的,而非完全不可企及。這也為未來改善模型設計提供了具體的切入點。這項研究的價值不僅在於揭示當前模型的缺陷,更在於為未來打造更貼近人類認知機制的模型提供了關鍵的比較基準。
透過將模型的反應模式與人類不同群體(包括典型發展成人與自閉症成人)進行對照,研究團隊建立了一套可量化的評估框架,讓研究者得以更精確地定位模型在社會認知光譜上的位置,並據此調整模型的訓練目標與評估標準。從更宏觀的角度來看,這項研究也對人工智慧發展方向提出了深層次的反思。當前的人工智慧系統大多以任務導向的方式進行訓練,追求在特定基準上達到最高分數,但這種訓練模式是否能夠培養出真正的社會理解能力,仍是個未解的問題。視覺語言模型在導演任務與動畫測試中展現出的侷限,恰恰說明了「能看」與「能懂」之間存在著一道巨大的鴻溝,而跨越這道鴻溝,可能需要從根本上重新思考模型的訓練哲學。
研究團隊最後強調,這項發現並不否定視覺語言模型的價值與潛力,而是希望透過揭露當前的不足,為下一階段的技術突破指明方向。人工智慧要真正成為人類社會的一員,具備與人類流暢互動的能力,就不能只停留在感知與生成的層面,還必須發展出對他人心理狀態的深刻理解。這項研究所揭示的「心智斷裂」現象,正是通往這個目標道路上必須克服的關鍵障礙之一。
Related
相關文章

天才,對AI發展到底有多重要?
加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

微軟 Copilot 新版圖標洩露,趨向扁平化、設計更簡潔
微軟 Copilot 圖標在 Edge Canary 測試版中意外曝光,新設計去除了 3D 陰影,變得更加扁平化。據悉,該圖標還曾短暫出現在新版 Microsoft 365 應用中,但上線時間尚未確定。#微軟Copilot#

Jeff Dean們,趕在貝葉斯AI到來之前跳船
Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時
首頁 > 智能時代>人工智能 谷歌推出 WeatherNext 氣旋模型,AI 高精度預報颶風平均提前 24 小時 2026/8/7 14:11:01 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 8 月 7 日消息,谷歌 DeepMind 團隊昨日(8 月 7 日)發佈博文,宣佈推出 WeatherNext Cyclones 天氣預測模型,主要。

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分
Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

智元下架了首席科學家羅劍嵐
智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。