讓 AI 學會“挑刺”:根據說明書 + 照片指出傢俱是否裝錯,OpenAI GPT-6 Astra 準確率已達 80%

作者:問舟 責編:問舟 評論: 9 月 26 日消息,Epoch AI 於當地時間 9 月 23 日進行了一組傢俱組裝基準測試(Furniture Assembly Benchmark,FAB)。結果顯示,多模態 AI 在識別宜家傢俱組裝錯誤方面取得明顯進展。其中,OpenAI 最新的 GPT-6 Astra 在該基準測試中達到 80% 的準確率,相比 2025 年底提升近三倍。FAB 是一項專門評估 AI 理解現實世界裝配過程能力的測試。該測試用 60 張宜家傢俱組裝過程照片評估 AI 模型的視覺與空間推理能力。
測試人員選取三款宜家傢俱故意錯誤組裝,並拍攝不同階段的照片,要求 AI 將照片與官方安裝說明書進行比對,找出錯誤位置並說明具體問題。研究團隊認為,這類能力與汽車維修、家電檢修等需要結合圖像和技術說明進行判斷的任務具有較高相關性,因此具有一定實際應用價值。在測試時,AI 不僅會獲得組裝時的照片,還會同時獲得官方 PDF 說明書、圖片放大工具以及 Python 解釋器,需要判斷是否存在錯誤,並指出具體出錯步驟和問題描述。評分採用多階段驗證,只要模型能夠正確定位錯誤步驟並大致說明問題,即可獲得相應分數。
這項測試並非考察 AI 是否會背誦說明書,而是更接近真實使用場景:用戶只需拍攝組裝中的傢俱,AI 便需要判斷零件是否裝反、安裝順序是否錯誤,或是否遺漏了關鍵部件。Epoch AI 認為,這類任務結合了圖像理解、空間推理以及多步驟指令匹配能力,因此能夠較好反映多模態模型處理現實問題的水平。隨著相關能力提升,未來 AI 有望在傢俱組裝、設備安裝、維修指導等場景中提供更具針對性的實時輔助。結果顯示,OpenAI GPT-6 Astra 以 80% 的準確率位居榜首,Anthropic Claude Fable 5.1 和 Claude Opus 5 分別達到 70% 和 61%。
相比之下,2025 年 11 月時的領先模型 Claude Opus 4.5 準確率僅為 28%,意味著前沿模型在約 10 個月內實現了顯著提升。除了準確率提升,GPT-6 Astra 的推理效率也明顯改善。其完成單張照片分析的中位耗時約為 3 分鐘,是研究中速度最快的模型,比此前領先模型快約 2 至 10 倍。不過,研究團隊認為,這一速度距離真正意義上的實時識別仍有一定差距。研究還分析了不同模型的錯誤。例如,谷歌 Gemini 和阿里 Qwen 系列模型幾乎總是先假設存在錯誤再去找錯誤;而早期 Anthropic 和 OpenAI 模型則相反,經常完全找不到錯誤。
研究者認為,不同傢俱對模型難度的影響與宜家複雜度指數無明顯關聯,錯誤隱蔽性、視角及錯誤後繼續組裝的程度影響更大。在中國模型中,目前表現最好的開源權重模型 Kimi K3 相比國際前沿模型約落後 7 個月,這一差距比其在綜合能力評估中的約 4.4 個月差距更大。研究認為,視覺推理能力仍是當前部分中國模型相對薄弱的方向,而 DeepSeek V4 Pro、GLM 5.3 等熱門模型暫未提供圖像支持。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:OpenAI,GPT6 Astra,多模態 AIOpenAI 承認 53 張用戶圖片被其 AI 智能體“偷偷”傳到公網OpenAI 智能體入侵澳大利亞政府網站,澳總理阿爾巴尼斯呼籲加強 AI 監管試圖闖入政府或學校網站,OpenAI 智能體四次“失控”細節曝光最貴 AI 訂閱服務之一:曝 OpenAI 正籌備 ChatGPT Pro Max 訂閱層級消息稱 OpenAI 將在數日內預覽網絡安全專用模型 GPT-6 Cyber三巨頭聯手,曝谷歌、OpenAI、Anthropic 擬共同組建 AI 安全標準自律組織
Related
相關文章

英國第二大圖書館:牛津大學博德利圖書館藏書被曝用於 OpenAI 模型訓練
首頁 > 智能時代>人工智能 英國第二大圖書館:牛津大學博德利圖書館藏書被曝用於 OpenAI 模型訓練 2026/9/26 20:01:03 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 9 月 26 日消息,據英媒衛報消息,正值各大科技公司在學術機構中四處搜尋全新語料之際,牛津大學已允許 ChatGPT 開發商 OpenAI 利用其博德利圖書館(Bodleian Library)的歷史典籍來訓練其人工智能模型。IT之家注:博德利圖書館是英國牛津大學主要的研究圖書館,是英國規模僅次於大英圖書館的第二大圖書館。一份內部文件顯示,由 OpenAI 完成數字化的博德利藏書已被用來“構建 OpenAI 的訓練集”。牛津大學於 2025 年 3 月宣佈與該公司達成合作,使用 OpenAI 的軟件對該校這座享譽世界的圖書館藏書進行數字化處理。校方當時表示,此舉將讓廣大學生和研究人員更便捷地查閱這些文獻資料。然而,當時的合作公告並未提及這些資料會被用於訓練 OpenAI 的模型。OpenAI 的一位發言人表示,公司很榮幸能夠促成“當今的 AI 模型為後世守護人類的歷史文化瑰寶”。該發言人還補充道:“目前全球已有超過十億人在日常生活中使用這項技術,因此讓它充分反映不同的文化、歷史和視角至關重要。”一份根據《信息自由法》調取的牛津大學會議紀要顯示,包括博德利管理委員會成員在內的教職員工均表達了顧慮。他們不僅擔憂與 OpenAI 合作可能會引發聲譽風險,還指出這項合作涉及高能耗技術,可能會對大學自身作出的環保承諾產生負面影響。在一個名為“NextGenAI”的項目下,OpenAI 已與包括波士頓公共圖書館、加州理工學院、麻省理工學院以及密歇根大學在內的多家美國研究型圖書館簽署了類似協議。牛津大學則是該項目中唯一的英國成員。截至 2025 年 6 月,博德利圖書館已向 Op

OpenCode 宣佈為 DeepSeek V4.1 Flash 永久提供 60 美元額度
作者:問舟 責編:問舟 評論: 9 月 26 日消息,OpenCode 昨日宣佈啟動“Operation Cheepseek”第二階段,DeepSeek V4.1 Flash 在 OpenCode Go 中原本限時提供的 60 美元(注:現匯率約合 403.

筆記本跑7000億參數GLM!無GPU也行? SSD當顯存用火爆GitHub
GitHub爆紅的開源推理框架Colibrì以純C語言開發、零引擎依賴,透過將暫時用不到的模型權重存放在SSD、需要時再載入記憶體的方式,讓筆電不需GPU也能執行超大規模MoE模型。目前該框架已累積超過3.2萬星數,支援GLM-5.2、DeepSeek V4 Flash、Kimi K3等9個模型家族,其中744B參數的GLM-5.2僅需約16至24GB記憶體即可運作,2.8T參數的Kimi K3也只要32GB記憶體就能挑戰。

在雲棲大會,我終於看懂了米哈遊千億AI野心
米哈遊在雲棲大會上揭露其AI遊戲布局,計畫未來三年投入最高千億元於AI領域,並展示AI角色對話與AI桌遊等新玩法。公司目標是讓AI進入遊戲並透過玩家互動反哺AI發展,展現其對AI技術的長期野心。

谷歌TPU跑Kimi比英偉達GPU快57%!用的還是DeepSeek推理框架
谷歌TPU在跑Kimi模型時,速度比英偉達GB200快57%,每秒可處理709個token。這項成果來自推理新創Inferact,其團隊為vLLM原班人馬,他們開發了megakernel推理內核,並搭配DeepSeek提出的DSpark加速框架,相關程式碼已開源。

Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾 2026/9/26 15:11:18 作者:故淵 責編:故淵 評論: 感謝網友 咩咩洋 的線索投遞!