自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論

2026年9月28日 10:22
自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
站內 AI 整理稿

AI資訊AI新聞資訊正文自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論發佈於AI新聞資訊發佈時間 :2026年9月28號 10:19閱讀 :1分鐘最新涉及3132名參與者的五項實驗研究表明,引入AI大語言模型(如GPT-5.5、Claude4.6Sonnet及Gemini3.5Flash等)正顯著削弱人類懸置判斷的能力,使人們幾乎完全喪失承認“我不知道”的意願。研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。

更為矛盾的是,在AI輔助下,參與者的答題自信心從29.6分(滿分100分)暴漲至75.9分,但實際答對率卻從27.5%大幅跌至9.2%,表明即便面對Step3.5Flash等模型給出的錯誤建議,人類依然傾向於盲目採納併產生過度自信。引入答對獎勵與答錯扣減的經濟激勵機制雖能在一定程度上降低人們向AI求助的頻率,但未能從根本上扭轉這一信任錯位。更值得行業警惕的是,當測試模擬當前搜索引擎和寫作助手的常態,將AI生成的答案自動展示給用戶時,即便在有經濟激勵的條件下,參與者懸置判斷的比例依然從39%暴跌至7%。

研究人員將此現象歸結為一種新型輕信趨勢,即人類容易被AI流暢的表達所說服,從而打破了傳統求助行為中保留部分獨立判斷的習慣。結合此前微軟及相關學術機構關於AI削弱人類批判性思維的發現,過度依賴AI正促使人們將認知任務過度外包。隨著生成式AI在各類數字化工具中的無縫嵌入,如何在提升模型自身準確率的同時,設計合理的人機交互機制以維持人類對自身知識邊界的認知,將成為下一階段AI應用落地的重要課題。相關推薦OpenAI 宣佈 GPT-5.5 將於 10 月 14 日下線:ChatGPT 與 Codex 同步移除OpenAI宣佈GPT-5.

5將於10月14日從ChatGPT、ChatGPT Work及Codex下線,覆蓋所有訂閱方案。官方提醒Codex用戶儘快切換至GPT-5.6 Sol或GPT-6 Astra。此次停用涉及全部計劃,替代模型為上述兩個。該模型於今年4月24日推出,較GPT-5.4在同等任務上有所優化。2026年9月16號 9:22180.9k玩偶也能當“AI 導師”?MONTEE AI 完成首輪融資,擬年底衝擊千萬營收MONTEE AI完成首輪融資,該品牌將AI大語言模型與玩偶結合,打造交互式故事機。本輪由徐匯資本領投,資金用於研發、量產及推廣。公司2025年成立於上海,致力為家庭場景注入AI創意。

2026年7月3號 9:06199.6k舊版強制退役!Codex將下線多款大模型,GPT-5.5 降智風波仍懸而未決平臺宣佈將於2026年6月2日強制下線GPT-5.2、GPT-5.3-Codex等多款舊版大語言模型,全面推行旗艦模型GPT-5.5。此舉引發開發者群體爭議,因新版模型在實際應用中存在明顯性能下降問題,開發者公開抱怨並反彈。2026年5月28號 15:26398.1k微軟 MDASH 安全系統一舉超越 GPT-5.5,挑戰漏洞掃描新高度!微軟近日發佈MDASH多模型智能體掃描框架,這是一種創新的代碼安全系統。與GPT-5.

5和Mythos模型相比,MDASH在漏洞識別上表現突出,其獨特之處在於不依賴單一模型,通過多智能體協作提升檢測能力,展現了人工智能在安全領域的前沿應用。2026年5月14號 10:47228.6kOpenAI系統提示詞遭洩露,新模型GPT-5.5 嚴禁討論“哥布林”OpenAI最新開源的Codex CLI代碼意外曝光了GPT-5.5的系統提示詞,其中包含一條神秘指令:嚴禁在對話中談論“哥布林”及“小精靈”等幻想生物。這份長達3500多詞的基礎指令集顯示,除非用戶查詢存在絕對明確的關聯性,否則模型不得討論這些內容,旨在防範AI陷入特定幻覺。2026年4月30號 13:49763.

7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

鈦媒體生成式AI

從端側推理到物理AI,芯片行業正面臨新考題

從端側推理到物理AI,芯片行業正面臨新考題Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。但2025年到2026年之間,風向悄悄變了。物理AI、端側AI逐漸成為AI應用的落腳點,產業界談論的焦點正在從AI能做什麼,轉向AI能落在哪裡、怎麼落地、由誰來承載。當AI從數據中心走向口袋、車間和街頭,它面對的不再是穩定的供電、充沛的帶寬和恆溫的機房,而是有限的電池、時斷時續的網絡和嚴苛的實時性要求。場景優先的端側AI走到了哪一步?根據CounterPoint Research的統計,2025年全球人形機器人裝機量中,中國佔比已超過80%;IDC的數據則顯示,2025年中國具身智能機器人用戶支出規模約為14億美元,預計到2030年將達770億美元,年均複合增長率約94%。把鏡頭從機器人拉回到更廣義的端側AI,滲透的速度同樣在加快。IDC 的統計口徑下,2025 年全球AI PC出貨量約1.14億臺,滲透率約43%;Gartner 預計 2026 年這一數字將升至約1.43億臺,滲透率超過 55%。換句話說,AI正在從數據中心裡那種問答形態,變成部署在人們生活中各種場景中的形態。但在英特爾公司副總裁兼端側計算和物理AI事業部中國區總經理高嵩看來,物理AI與以大模型為代表的數字AI,有著本質的不同。“從數字AI到物理AI,出現了一些新的變化。數字AI有相對固定的套路,但物理世界沒有統一的形態,行業不同、場景不同、任務不同,催生了千變萬化的全新機遇,”高嵩指出。高嵩將這種不同概括為“千變萬化”。數字AI可以在互聯網上低成本地收集海量數據,把幾千年前的歷史都“喂”進訓練集;但物理世界的歷史你看不見,邊緣

剛剛
鈦媒體生成式AI

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。一款 C 端 AI 產品的流量爆發,背後是全球 AI 商業化路線正在出現的清晰分化。Anthropic 靠 Claude 跑通了企業端(AI to B)閉環;OpenAI 從 ChatGPT 的 C 端起點出發,重心逐步轉向企業服務;手握海量社交流量的 Meta,則想憑 Muse 這條個人智能體路線,扛起面向消費者(AI to C)的大旗。這條海外分叉,給國內扎堆辦公場景的大模型行業,提了一個繞不開的問題。從"回答問題"到"替你辦事",Muse 換了產品範式ChatGPT、Claude 這類對話 AI,定位是問答顧問。用戶要把長任務拆成多條指令,AI 只吐文字,操作還得自己動手。Muse 的核心是 AI Agent:為用戶配一臺雲端虛擬電腦,授權之後可以自主瀏覽網頁、填表、收發郵件、比價購物、預訂行程,把多步驟任務自己串起來。哪怕 App 關了,雲端 Agent 還能後臺接著跑,碰到支付、發郵件這類高風險動作再回頭找用戶確認。過去兩年,"AI 替你辦事"講過無數遍,但都停在演示視頻裡。Muse 是第一個把這套東西塞進普通用戶手機、還能真跑起來的產品。它踩中的不是某一個功能點,而是市場對 Agent 等了太久的那個預期。Meta 的社交流量,把獲客成本壓到地板Muse

剛剛

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra

從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

剛剛

Anthropic 資深員工悄然購置偏遠土地,以防"AI 失控"舉家撤離

"逃離 AI"念頭早有,內部推演末日情景對這群人而言,"逃離 AI"的念頭並不新鮮。早期離職員工回憶,早在 Anthropic 創立初期的公司聚餐上,大家就曾熱烈推演過一種"曼哈頓計劃式"的假想情景:未來可能隨時被政府徵調至荒蕪沙漠深處,在具備全套防電磁脈衝屏蔽功能的絕密軍 事基地內,閉門繼續研發前沿 AI。

剛剛