何夕2077研究與前沿

視覺語言模型心智測試

2026年8月5日 00:00

重點摘要

視覺語言模型心智測試。 多模態模型存在心智斷裂現象。實驗結果見心智理論論文原文所述。測試顯示模型 ��� 任務表現差異很大。自我偏差在導演任務中達到了高位。動畫測試下其表現更接近自閉成人。

站內 AI 整理稿

一項針對視覺語言模型的心智理論測試發現,多模態模型在處理涉及他人心理狀態的任務時,普遍出現明顯的「心智斷裂」現象。研究團隊透過多種任務評估不同模型的能力,結果顯示各模型的表現差異極大;其中在「導演任務」中,模型的自我偏差指數達到高點,意味著它們難以區分自身已知的資訊與他人當下所能掌握的知識,暴露出社會認知推理上的根本缺陷。 進一步的動畫測試則呈現更引人注目的結果:視覺語言模型在該情境下的反應模式,竟與自閉症成人的表現更為接近。這項發現不僅揭示了當前多模態模型在理解他人信念、意圖與視角時仍有明顯侷限,也為未來打造更貼近人類認知機制的模型提供了關鍵的比較基準與改進方向。

Related

相關文章

人形機器人做手術上《Nature》,臨床成熟度拿了2.5分

人形機器人成功完成手術任務,相關成果登上《Nature》,並首次獲得臨床成熟度評分2.5分。該分數代表技術已完成概念驗證與初步可行性測試,但距離大規模臨床應用仍有一段距離。專家指出,要真正參與臨床手術,仍需克服精密控制、即時反饋與人機協作等挑戰。

8 小時前
MarkTechPost AI研究與前沿

Cursor 開源 Mixture-of-Kittens (MoK):專為 GB300 NVL72 機架設計的確定性 MoE 訓練巨內核

Cursor Research 正式開源 Mixture-of-Kittens(MoK),這是其 Composer 模型背後的混合專家(MoE)訓練巨內核。MoK 將所有 MoE 通訊與計算步驟融合為單一確定性內核。據 Cursor 團隊報告,其吞吐量最高可達最強公開基準的 2.37 倍,目前已支援數萬顆 GPU 的 Composer 訓練。部署門檻較高:需 NVIDIA Blackwell SM100 或 SM103 GPU(即 GB200 NVL72 或 GB300 NVL72 機架),並要求 Python 3.12+、PyTorch 2.10+ 及 CUDA toolkit 13.0+,且 GPU 間緩衝區依賴 PyTorch 對稱記憶體。因此,實際採用者限於擁有或租用 NVL72 容量的機構,如前沿實驗室與資金充足的模型新創公司。MoK 以 Apache-2.0 授權發布於 GitHub。

9 小時前