視覺語言模型心智測試
重點摘要
視覺語言模型心智測試。 多模態模型存在心智斷裂現象。實驗結果見心智理論論文原文所述。測試顯示模型 ��� 任務表現差異很大。自我偏差在導演任務中達到了高位。動畫測試下其表現更接近自閉成人。
一項針對視覺語言模型的心智理論測試發現,多模態模型在處理涉及他人心理狀態的任務時,普遍出現明顯的「心智斷裂」現象。研究團隊透過多種任務評估不同模型的能力,結果顯示各模型的表現差異極大;其中在「導演任務」中,模型的自我偏差指數達到高點,意味著它們難以區分自身已知的資訊與他人當下所能掌握的知識,暴露出社會認知推理上的根本缺陷。 進一步的動畫測試則呈現更引人注目的結果:視覺語言模型在該情境下的反應模式,竟與自閉症成人的表現更為接近。這項發現不僅揭示了當前多模態模型在理解他人信念、意圖與視角時仍有明顯侷限,也為未來打造更貼近人類認知機制的模型提供了關鍵的比較基準與改進方向。
Related
相關文章

世界模型的下一步?牛津、NUS團隊提出「心智世界建模」MWM:遠不止物理世界
這篇消息聚焦「世界模型的下一步?牛津、NUS團隊提出「心智世界建模」MWM:遠不止物理世界」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

人形機器人做手術上《Nature》,臨床成熟度拿了2.5分
人形機器人成功完成手術任務,相關成果登上《Nature》,並首次獲得臨床成熟度評分2.5分。該分數代表技術已完成概念驗證與初步可行性測試,但距離大規模臨床應用仍有一段距離。專家指出,要真正參與臨床手術,仍需克服精密控制、即時反饋與人機協作等挑戰。
Cursor 開源 Mixture-of-Kittens (MoK):專為 GB300 NVL72 機架設計的確定性 MoE 訓練巨內核
Cursor Research 正式開源 Mixture-of-Kittens(MoK),這是其 Composer 模型背後的混合專家(MoE)訓練巨內核。MoK 將所有 MoE 通訊與計算步驟融合為單一確定性內核。據 Cursor 團隊報告,其吞吐量最高可達最強公開基準的 2.37 倍,目前已支援數萬顆 GPU 的 Composer 訓練。部署門檻較高:需 NVIDIA Blackwell SM100 或 SM103 GPU(即 GB200 NVL72 或 GB300 NVL72 機架),並要求 Python 3.12+、PyTorch 2.10+ 及 CUDA toolkit 13.0+,且 GPU 間緩衝區依賴 PyTorch 對稱記憶體。因此,實際採用者限於擁有或租用 NVL72 容量的機構,如前沿實驗室與資金充足的模型新創公司。MoK 以 Apache-2.0 授權發布於 GitHub。

數學家24小時駁回OpenAI攻破的猜想!“AI證對了每句話,但已跟原猜想無關”
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 數學家24小時駁回OpenAI攻破的猜想!

AI 輔助“推翻”考拉茲猜想失敗,Lean 4.32.2 修復內核漏洞
一項藉助AI輔助、聲稱推翻考拉茲猜想的Lean形式化證明被確認無效,原因是Lean內核存在漏洞,導致系統能無條件接受假命題。Lean團隊在收到報告後迅速發布4.32.2版本修復該漏洞,該漏洞涉及內核處理嵌套歸納類型時忽略幽靈類型參數的檢查。

微軟測試其首款自研全雙工 AI 語音 MAI Realtime 模型:支持中文等 16 種語言、2 種風格
微軟正在測試其首款全雙工 AI 語音模型 MAI Realtime,支援中文等 16 種語言與兩種語音風格,可實現同步聆聽與回應。該模型目前僅開放給部分合作夥伴在 MAI Playground 進行測試,正式上線時間尚未公布。