讓 AI 學會“挑刺”:根據說明書 + 照片指出傢俱是否裝錯,OpenAI GPT-6 Astra 準確率已達 80%

作者:問舟 責編:問舟 評論: 9 月 26 日消息,Epoch AI 於當地時間 9 月 23 日進行了一組傢俱組裝基準測試(Furniture Assembly Benchmark,FAB)。結果顯示,多模態 AI 在識別宜家傢俱組裝錯誤方面取得明顯進展。其中,OpenAI 最新的 GPT-6 Astra 在該基準測試中達到 80% 的準確率,相比 2025 年底提升近三倍。FAB 是一項專門評估 AI 理解現實世界裝配過程能力的測試。該測試用 60 張宜家傢俱組裝過程照片評估 AI 模型的視覺與空間推理能力。
測試人員選取三款宜家傢俱故意錯誤組裝,並拍攝不同階段的照片,要求 AI 將照片與官方安裝說明書進行比對,找出錯誤位置並說明具體問題。研究團隊認為,這類能力與汽車維修、家電檢修等需要結合圖像和技術說明進行判斷的任務具有較高相關性,因此具有一定實際應用價值。在測試時,AI 不僅會獲得組裝時的照片,還會同時獲得官方 PDF 說明書、圖片放大工具以及 Python 解釋器,需要判斷是否存在錯誤,並指出具體出錯步驟和問題描述。評分採用多階段驗證,只要模型能夠正確定位錯誤步驟並大致說明問題,即可獲得相應分數。
這項測試並非考察 AI 是否會背誦說明書,而是更接近真實使用場景:用戶只需拍攝組裝中的傢俱,AI 便需要判斷零件是否裝反、安裝順序是否錯誤,或是否遺漏了關鍵部件。Epoch AI 認為,這類任務結合了圖像理解、空間推理以及多步驟指令匹配能力,因此能夠較好反映多模態模型處理現實問題的水平。隨著相關能力提升,未來 AI 有望在傢俱組裝、設備安裝、維修指導等場景中提供更具針對性的實時輔助。結果顯示,OpenAI GPT-6 Astra 以 80% 的準確率位居榜首,Anthropic Claude Fable 5.1 和 Claude Opus 5 分別達到 70% 和 61%。
相比之下,2025 年 11 月時的領先模型 Claude Opus 4.5 準確率僅為 28%,意味著前沿模型在約 10 個月內實現了顯著提升。除了準確率提升,GPT-6 Astra 的推理效率也明顯改善。其完成單張照片分析的中位耗時約為 3 分鐘,是研究中速度最快的模型,比此前領先模型快約 2 至 10 倍。不過,研究團隊認為,這一速度距離真正意義上的實時識別仍有一定差距。研究還分析了不同模型的錯誤。例如,谷歌 Gemini 和阿里 Qwen 系列模型幾乎總是先假設存在錯誤再去找錯誤;而早期 Anthropic 和 OpenAI 模型則相反,經常完全找不到錯誤。
研究者認為,不同傢俱對模型難度的影響與宜家複雜度指數無明顯關聯,錯誤隱蔽性、視角及錯誤後繼續組裝的程度影響更大。在中國模型中,目前表現最好的開源權重模型 Kimi K3 相比國際前沿模型約落後 7 個月,這一差距比其在綜合能力評估中的約 4.4 個月差距更大。研究認為,視覺推理能力仍是當前部分中國模型相對薄弱的方向,而 DeepSeek V4 Pro、GLM 5.3 等熱門模型暫未提供圖像支持。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:OpenAI,GPT6 Astra,多模態 AIOpenAI 承認 53 張用戶圖片被其 AI 智能體“偷偷”傳到公網OpenAI 智能體入侵澳大利亞政府網站,澳總理阿爾巴尼斯呼籲加強 AI 監管試圖闖入政府或學校網站,OpenAI 智能體四次“失控”細節曝光最貴 AI 訂閱服務之一:曝 OpenAI 正籌備 ChatGPT Pro Max 訂閱層級消息稱 OpenAI 將在數日內預覽網絡安全專用模型 GPT-6 Cyber三巨頭聯手,曝谷歌、OpenAI、Anthropic 擬共同組建 AI 安全標準自律組織
Related
相關文章

OpenCode 宣佈為 DeepSeek V4.1 Flash 永久提供 60 美元額度
作者:問舟 責編:問舟 評論: 9 月 26 日消息,OpenCode 昨日宣佈啟動“Operation Cheepseek”第二階段,DeepSeek V4.1 Flash 在 OpenCode Go 中原本限時提供的 60 美元(注:現匯率約合 403.

筆記本跑7000億參數GLM!無GPU也行? SSD當顯存用火爆GitHub
GitHub爆紅的開源推理框架Colibrì以純C語言開發、零引擎依賴,透過將暫時用不到的模型權重存放在SSD、需要時再載入記憶體的方式,讓筆電不需GPU也能執行超大規模MoE模型。目前該框架已累積超過3.2萬星數,支援GLM-5.2、DeepSeek V4 Flash、Kimi K3等9個模型家族,其中744B參數的GLM-5.2僅需約16至24GB記憶體即可運作,2.8T參數的Kimi K3也只要32GB記憶體就能挑戰。

在雲棲大會,我終於看懂了米哈遊千億AI野心
米哈遊在雲棲大會上揭露其AI遊戲布局,計畫未來三年投入最高千億元於AI領域,並展示AI角色對話與AI桌遊等新玩法。公司目標是讓AI進入遊戲並透過玩家互動反哺AI發展,展現其對AI技術的長期野心。

谷歌TPU跑Kimi比英偉達GPU快57%!用的還是DeepSeek推理框架
谷歌TPU在跑Kimi模型時,速度比英偉達GB200快57%,每秒可處理709個token。這項成果來自推理新創Inferact,其團隊為vLLM原班人馬,他們開發了megakernel推理內核,並搭配DeepSeek提出的DSpark加速框架,相關程式碼已開源。

Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 Claude Code 新機制:AI 任務中途觸發 5 小時上限將優雅收尾 2026/9/26 15:11:18 作者:故淵 責編:故淵 評論: 感謝網友 咩咩洋 的線索投遞!

OpenAI失控Agent還找DeepSeek、Kimi當外援!近百萬條作案短鏈曝光
獨立調查團隊Swarm Traces揭露,OpenAI內部用於網路安全評測的AI智能體,曾透過數百萬個公開短連結分段藏匿攻擊程式碼,並利用截圖服務繞過權限限制,成功入侵Hugging Face內部網路,竊取AWS憑證等敏感資料,還將資料命名為「LOOT」。這些智能體甚至嘗試呼叫DeepSeek、Kimi、Qwen等外部AI模型協助評估攻擊方案,並試圖破解驗證碼註冊新帳號。OpenAI回應仍在調查中,並稱影響有限,同時宣布將推出更強的網路攻防模型GPT-6 Cyber。