自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
AI資訊AI新閒資訊正文自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論發布於AI新閒資訊時間 :Sep 28, 2026閱讀 :1分鐘最新涉及3132名參與者的五項實驗研究表明,引入AI大語言模型(如GPT-5.5、Claude4.6Sonnet及Gemini3.5Flash等)正顯著削弱人類懸置判斷的能力,使人們幾乎完全喪失承認“我不知道”的意願。研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。
更為矛盾的是,在AI輔助下,參與者的答題自信心從29.6分(滿分100分)暴漲至75.9分,但實際答對率卻從27.5%大幅跌至9.2%,表明即便面對Step3.5Flash等模型給出的錯誤建議,人類依然傾向於盲目採納併產生過度自信。引入答對獎勵與答錯扣減的經濟激勵機制雖能在一定程度上降低人們向AI求助的頻率,但未能從根本上扭轉這一信任錯位。更值得行業警惕的是,當測試模擬當前搜索引擎和寫作助手的常態,將AI生成的答案自動展示給用戶時,即便在有經濟激勵的條件下,參與者懸置判斷的比例依然從39%暴跌至7%。
研究人員將此現象歸結為一種新型輕信趨勢,即人類容易被AI流暢的表達所說服,從而打破了傳統求助行為中保留部分獨立判斷的習慣。結合此前微軟及相關學術機構關於AI削弱人類批判性思維的發現,過度依賴AI正促使人們將認知任務過度外包。隨著生成式AI在各類數字化工具中的無縫嵌入,如何在提升模型自身準確率的同時,設計合理的人機交互機制以維持人類對自身知識邊界的認知,將成為下一階段AI應用落地的重要課題。相關推薦OpenAI 宣佈 GPT-5.5 將於 10 月 14 日下線:ChatGPT 與 Codex 同步移除OpenAI宣佈GPT-5.
5將於10月14日從ChatGPT、ChatGPT Work及Codex下線,覆蓋所有訂閱方案。官方提醒Codex用戶儘快切換至GPT-5.6 Sol或GPT-6 Astra。此次停用涉及全部計劃,替代模型為上述兩個。該模型於今年4月24日推出,較GPT-5.4在同等任務上有所優化。Sep 16, 2026180.9k玩偶也能當“AI 導師”?MONTEE AI 完成首輪融資,擬年底衝擊千萬營收MONTEE AI完成首輪融資,該品牌將AI大語言模型與玩偶結合,打造交互式故事機。本輪由徐匯資本領投,資金用於研發、量產及推廣。公司2025年成立於上海,致力為家庭場景注入AI創意。
Jul 3, 2026199.6k舊版強制退役!Codex將下線多款大模型,GPT-5.5 降智風波仍懸而未決平臺宣佈將於2026年6月2日強制下線GPT-5.2、GPT-5.3-Codex等多款舊版大語言模型,全面推行旗艦模型GPT-5.5。此舉引發開發者群體爭議,因新版模型在實際應用中存在明顯性能下降問題,開發者公開抱怨並反彈。May 28, 2026398.1k微軟 MDASH 安全系統一舉超越 GPT-5.5,挑戰漏洞掃描新高度!微軟近日發佈MDASH多模型智能體掃描框架,這是一種創新的代碼安全系統。與GPT-5.
5和Mythos模型相比,MDASH在漏洞識別上表現突出,其獨特之處在於不依賴單一模型,通過多智能體協作提升檢測能力,展現了人工智能在安全領域的前沿應用。May 14, 2026228.6kOpenAI系統提示詞遭洩露,新模型GPT-5.5 嚴禁討論“哥布林”OpenAI最新開源的Codex CLI代碼意外曝光了GPT-5.5的系統提示詞,其中包含一條神秘指令:嚴禁在對話中談論“哥布林”及“小精靈”等幻想生物。這份長達3500多詞的基礎指令集顯示,除非用戶查詢存在絕對明確的關聯性,否則模型不得討論這些內容,旨在防範AI陷入特定幻覺。Apr 30, 2026763.
7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

千問創作上線 7 天會員:200 積分 + 快速通道,瞄準旅行出片等即時創作
用戶購買後,可獲得 200 積分、專享快速生成通道,以及新模型與新功能的優先體驗權益。短週期降低嚐鮮門檻相較於包月訂閱,7 天會員以更短的使用週期,明顯降低了用戶的嘗試與決策門檻。對那些只想在一段旅行、一場活動或一輪社媒運營中集中用 AI 出圖、寫文案的用戶來說,不必為長期訂閱買單,也能解鎖快速生成與搶先體驗等核心權益。

千問APP支持中國移動算力套餐,用戶可在工作助理中啟用
已訂閱中國移動該服務的用戶,可在千問APP或PC端的「工作助理」中,使用中國移動賬戶中的Token額度完成複雜工作任務,相關Token將從本人對應賬戶中扣除。同時,雙方還推出了“千問X中國移動聯名版”,用戶辦理指定套餐,即可獲得千問會員權益。

從端側推理到物理AI,芯片行業正面臨新考題
Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡
ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra
從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。更為矛盾的是,在AI輔助下,參與者的答題自信心從29.