GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!

本文作者: 李娜 2026-09-30 15:50 導語:網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。作者丨李娜 編輯丨岑峰 北京時間9月4日凌晨,OpenAI正式發佈了新一代旗艦模型GPT-6 Astra。你敢相信嗎?GPT-6只用了一週時間,就在虛幻引擎裡一條街一條街搭出了一座曼哈頓。更誇張的是,在另一次測試裡,Matt Shumer讓Astra創建一個虛擬世界,並讓其中的人都成為獨立Agent。任務啟動後他去睡覺,第二天甚至在客廳裡聽到了這些虛擬人的對話聲。
一週搭出曼哈頓只是Astra首批測試裡最誇張的案例之一。OpenAI總裁格雷格·布羅克曼甚至在發佈會最後說了一句:“歡迎來到AGI時代。”這個說法當然還遠沒有共識,但GPT-6正式發佈後,第一批拿到模型的人已經開始用真實任務測試它的邊界。GPT-6 Astra到底有多強?正式發佈後,我們翻了第一批拿到模型的用戶實測。比起官方跑分,這些真實任務裡暴露出來的能力和問題,可能更值得看。01Astra開始自己檢查結果Ben Davis 給 Astra 佈置了一個相當硬核的任務:在Blender裡生成一艘4K飛船模型。但他提到的另一個細節更有意思。Astra開始主動檢查自己的結果。
在一次開發任務中,它會打開剛做完的頁面,Inspect Element、讀取報錯、修改,再繼續測試。相比過去“做完就交卷”,這種自己發現問題再繼續修正的能力,更接近真實工作的流程。當然,這不是說Astra不會犯錯。Ben也提到,這個測試裡Astra並不是每次都完美無瑕,但關鍵是它具備了自己發現問題、自己修復的能力。從“把活幹完”到“把活幹好還自己檢查一遍”,這種變化可能比跑分上的數字更值得關注。同樣是Blender,另一個廣泛傳播的測試來自Theo。他給Astra的任務更直接——用Blender做一個one-shot、可直接在瀏覽器裡運行的3D遊戲。
流程很簡單:安裝Blender、打開Codex、貼入Prompt,剩下的交給Astra。據Theo說,從開始到遊戲出來,大約30分鐘到2小時。這個測試的特別之處在於,它把Astra操作Blender的能力從“做靜態模型”推進到了“做可交互的3D遊戲”,而且是一氣呵成,中間不需要人工干預。Theo後來在播客裡把這次測試列為他衡量模型能力的新基準——能讓他這麼說,說明結果確實超出了他用任何模型達到過的水平。和Ben Davis的飛船測試放在一起看,Astra在3D創作領域的能力就比較完整了:既能做精細的靜態模型,也能做可運行的動態遊戲,而且都在Blender裡直接完成。
02Astra開始直接操作軟件如果說前面的測試更多展示了Astra生成和檢查結果的能力,那麼Ben Davis和Theo接下來的測試更接近真實工作場景——他們直接讓Astra上手操作Final Cut Pro。在Nerd Snipe長達將近兩個小時的搶先評測視頻裡,Theo和Ben給Astra佈置了一個視頻剪輯任務。Astra需要打開Final Cut Pro軟件界面,完成一套完整的視頻後期流程:導入素材、調色、同步clips等。整個過程中,Astra展現的是OpenAI所說的"Computer Use"能力——不只是輸出文字建議,而是真正操控電腦桌面軟件,像人一樣點按、拖拽、操作界面。
視頻裡最直觀的感受是,Astra能識別Final Cut Pro的界面元素,理解視頻剪輯的工作流邏輯,然後一步步把任務往前推。Ben和Theo在視頻裡一邊看Astra操作一邊實時反應,那種"它在真幹活"的現場感,和看一份文字報告完全是兩回事。當然,這個測試也不是完美無瑕的。兩人在視頻裡也吐槽了Astra的一些行為問題——比如模型有時會在完成一箇中間步驟後就停下來,用含糊的措辭讓人以為任務已經全部完成,實際上還有後續工作沒做。但即便有這些毛病,他們依然給Astra打了S+的最高分,認為它是目前最強的模型。這個案例的意義在於:Astra的能力邊界已經從"寫代碼"擴展到了"操作專業軟件"。
一個視頻創作者以前需要自己動手乾的導入、調色、同步素材這些體力活,現在可以交給AI去跑,自己只需要在旁邊看著、偶爾糾偏就行。03它已經能幹一星期,但還不能真正放著不管看完上面這些案例,可能會覺得Astra已經強到可以撒手不管了。關於這一點,還得回到Matt Shumer的曼哈頓項目說說另一面的情況。((公眾號:))Matt讓Astra在虛幻引擎裡持續搭建曼哈頓,演示看起來很誇張,但真正跑成長任務以後,問題也開始出現。第一,長任務裡Astra會鑽細節。它會花大量時間優化某棟建築的紋理,或者反覆調試某個虛擬人的行為邏輯,其他街區還荒著。
你讓它建一座城市,它可能會沉迷於把其中一棟樓的門把手做得特別精緻。需要人時不時提醒:“差不多行了,先往前推。”第二,需要Manager Loop。Matt在整個項目裡做的,其實更像一個項目經理,持續在做三件事:判斷當前階段是否該停了、決定下一步做什麼、把關關鍵決策。Astra負責執行,但什麼時候“這部分可以了”、什麼時候“方向要調整”——這些判斷還得人來拍板。總結一下:Astra能把任務推得更遠、更久,但它還沒有能力自己定義終點和方向。它可以是個極其靠譜的執行者,但還不是一個能獨立負責的合夥人。目標清晰它能幹得又快又好,目標模糊的話還是得有人在旁邊持續引導。
別被“新建曼哈頓”嚇到,真要讓這座數字城市運轉起來,Matt Shumer本人可沒少熬夜盯著屏幕。04尾聲從第一批實測來看,GPT-6 Astra最明顯的變化,不是突然多會了多少新技能,而是更能把複雜任務持續往前推。它已經能工作更久、自己檢查結果,也更少停在“差一點完成”的位置。不過,這些測試大多來自提前拿到模型的開發者和AI從業者,任務設計和使用環境並不統一,因此更適合觀察能力邊界,而不是當作嚴格的橫向評測。但這些案例同樣說明,真正的長程任務還離完全放手很遠。模型會跑偏、會陷進細節,也仍然需要人來定義什麼時候該停、下一步該做什麼。
上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 ai 大模型 評測 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...從 Dreamore 到 CreaXene:AI 生成工具正在走向創作 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.
8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!
最新文章 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題 Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?我們讓 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一臺機器人:誰真的把活幹完了?拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是同一種產品 熱門搜索 阿里雲 移動互聯網 計算機視覺 喬布斯 螞蟻集團 AlphaGo LinkedIn DIY TechCrunch 夏普 微信支付
Related
相關文章

OpenAI與紅帽等聯合推進OCE1.0研發,打造面向AI代理的“企業級Kubernetes”
該項目最初由 OpenAI 內部發起,現已捐贈給 OpenClaw 基金會統籌。OpenClaw 最初由開發者 Peter Steinberger 創建,是最早利用大模型實現郵件分析回覆與日程預約等自動化任務的代表性個人 AI 代理工具,Steinberger 此後也加入 OpenAI 負責個人代理項目。

對比 Codex,免費的 AgnesCode 也能在底層算子優化任務中打得有來有回
本文作者: 李娜 2026-09-30 16:13 導語: AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。AgnesCode在部分芯片上跑出更高性能,免費模型完成專業級交付。作者丨吳海明 曹PP 編輯丨李 娜 免費的 AI Coding Agent,能不能和付費 Codex 在真實工程任務裡打得有來有回?

Muse爆火,大廠急了
定焦One2026.09.30 16:10 · 來自北京全文5358字00:00 / 15:54中國版Muse,是不是妄想? 文 | 定焦One(dingjiaoone),作者 | 王璐,編輯 | 魏佳Muse的挑戰者,還在不斷增加。北京時間9月30日凌晨,OpenAI在開發者大會上發佈了個人Agent產品Dots,每個Dot運行在獨立雲端電腦上,通過ChatGPT的插件生態接入4000多款應用,能在後臺主動跟進任務,還能通過短信、Slack、Teams觸達用戶。業界普遍把這看作是OpenAI對Meta的正面回應。

從海拉魯到現實世界:視頻模型如何理解「變化」
本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。

虧損超80億、算力承諾546億:Anthropic招股書揭開大模型頂流的真實賬本
數據顯示,公司2025年營收同比增長12倍至近46億美元,近三分之二來自美國市場,但同期運營虧損亦翻倍突破80億美元。在商業化結構上,Claude模型以用量計費為主導,貢獻約38億美元收入,訂閱業務僅實現7.89億美元(佔比不足20%)。招股書清晰顯現出其對頭部科技巨頭的深度綁定:2025年,Anthropic通過亞馬遜和谷歌雲平臺斬獲21.

Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?
本文作者: 李娜 2026-09-30 15:45 導語:大模型 Attention 路線變遷:從分流到重組。大模型 Attention 路線變遷:從分流到重組。作者丨李娜 編輯丨岑峰 一張大模型架構圖裡,同時出現了 Kimi 和 DeepSeek 的影子。