GPT-6看照片找出傢俱裝錯處
Ad Skip to content OpenAI's GPT-6 Astra can now tell you exactly where you screwed up your IKEA shelf Manuel Uth Sep 26, 2026 AI can now spot when you've built your IKEA furniture wrong.
Epoch AI's Furniture Assembly Benchmark (FAB) photographs three IKEA pieces during assembly with deliberate errors.Models compare photos against instructions, identify mistakes, and describe what went wrong.In November 2025, the best model (Claude Opus 4.5) scored 28%.
Ten months later, OpenAI's GPT-6 Astra hits 80% at three minutes per photo.Claude Fable 5.1 follows at 70%, Claude Opus 5 at 61%.Chinese open-weight models like Kimi K3 trail leaders by at least seven months.
OpenAI's GPT-6 Astra spots assembly errors in IKEA furniture photos with 80 percent accuracy, up from 28 percent just months ago.| Image: OpenAI It's still too slow for real-time assembly help, but the tech could eventually assist with car repairs or appliance fixes, the researchers say.
The overall progress, and especially Astra's, is notable given that models were failing far simpler visual tasks not long ago.Astra also excels at visual robotic tasks.
AdAd AI News Without the Hype – Curated by Humans Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.
Subscribe now Source: Epoch AI / Furniture Assembly Benchmark BETA-TEST × wpDiscuzInsert BETA-TEST × wpDiscuzInsert
Related
相關文章

千問創作上線 7 天會員:200 積分 + 快速通道,瞄準旅行出片等即時創作
用戶購買後,可獲得 200 積分、專享快速生成通道,以及新模型與新功能的優先體驗權益。短週期降低嚐鮮門檻相較於包月訂閱,7 天會員以更短的使用週期,明顯降低了用戶的嘗試與決策門檻。對那些只想在一段旅行、一場活動或一輪社媒運營中集中用 AI 出圖、寫文案的用戶來說,不必為長期訂閱買單,也能解鎖快速生成與搶先體驗等核心權益。

千問APP支持中國移動算力套餐,用戶可在工作助理中啟用
已訂閱中國移動該服務的用戶,可在千問APP或PC端的「工作助理」中,使用中國移動賬戶中的Token額度完成複雜工作任務,相關Token將從本人對應賬戶中扣除。同時,雙方還推出了“千問X中國移動聯名版”,用戶辦理指定套餐,即可獲得千問會員權益。

從端側推理到物理AI,芯片行業正面臨新考題
Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡
ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra
從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。更為矛盾的是,在AI輔助下,參與者的答題自信心從29.