GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!

2026年9月30日 15:51
GPT-6 Astra 上手體驗:花了一週,它真在電腦裡建了座曼哈頓!
站內 AI 整理稿

本文作者: 李娜 2026-09-30 15:50 導語:網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。網友實測GPT-6 Astra:神操作很多,長任務翻車也很快。作者丨李娜 編輯丨岑峰 北京時間9月4日凌晨,OpenAI正式發佈了新一代旗艦模型GPT-6 Astra。你敢相信嗎?GPT-6只用了一週時間,就在虛幻引擎裡一條街一條街搭出了一座曼哈頓。更誇張的是,在另一次測試裡,Matt Shumer讓Astra創建一個虛擬世界,並讓其中的人都成為獨立Agent。任務啟動後他去睡覺,第二天甚至在客廳裡聽到了這些虛擬人的對話聲。

一週搭出曼哈頓只是Astra首批測試裡最誇張的案例之一。OpenAI總裁格雷格·布羅克曼甚至在發佈會最後說了一句:“歡迎來到AGI時代。”這個說法當然還遠沒有共識,但GPT-6正式發佈後,第一批拿到模型的人已經開始用真實任務測試它的邊界。GPT-6 Astra到底有多強?正式發佈後,我們翻了第一批拿到模型的用戶實測。比起官方跑分,這些真實任務裡暴露出來的能力和問題,可能更值得看。01Astra開始自己檢查結果Ben Davis 給 Astra 佈置了一個相當硬核的任務:在Blender裡生成一艘4K飛船模型。但他提到的另一個細節更有意思。Astra開始主動檢查自己的結果。

在一次開發任務中,它會打開剛做完的頁面,Inspect Element、讀取報錯、修改,再繼續測試。相比過去“做完就交卷”,這種自己發現問題再繼續修正的能力,更接近真實工作的流程。當然,這不是說Astra不會犯錯。Ben也提到,這個測試裡Astra並不是每次都完美無瑕,但關鍵是它具備了自己發現問題、自己修復的能力。從“把活幹完”到“把活幹好還自己檢查一遍”,這種變化可能比跑分上的數字更值得關注。同樣是Blender,另一個廣泛傳播的測試來自Theo。他給Astra的任務更直接——用Blender做一個one-shot、可直接在瀏覽器裡運行的3D遊戲。

流程很簡單:安裝Blender、打開Codex、貼入Prompt,剩下的交給Astra。據Theo說,從開始到遊戲出來,大約30分鐘到2小時。這個測試的特別之處在於,它把Astra操作Blender的能力從“做靜態模型”推進到了“做可交互的3D遊戲”,而且是一氣呵成,中間不需要人工干預。Theo後來在播客裡把這次測試列為他衡量模型能力的新基準——能讓他這麼說,說明結果確實超出了他用任何模型達到過的水平。和Ben Davis的飛船測試放在一起看,Astra在3D創作領域的能力就比較完整了:既能做精細的靜態模型,也能做可運行的動態遊戲,而且都在Blender裡直接完成。

02Astra開始直接操作軟件如果說前面的測試更多展示了Astra生成和檢查結果的能力,那麼Ben Davis和Theo接下來的測試更接近真實工作場景——他們直接讓Astra上手操作Final Cut Pro。在Nerd Snipe長達將近兩個小時的搶先評測視頻裡,Theo和Ben給Astra佈置了一個視頻剪輯任務。Astra需要打開Final Cut Pro軟件界面,完成一套完整的視頻後期流程:導入素材、調色、同步clips等。整個過程中,Astra展現的是OpenAI所說的"Computer Use"能力——不只是輸出文字建議,而是真正操控電腦桌面軟件,像人一樣點按、拖拽、操作界面。

視頻裡最直觀的感受是,Astra能識別Final Cut Pro的界面元素,理解視頻剪輯的工作流邏輯,然後一步步把任務往前推。Ben和Theo在視頻裡一邊看Astra操作一邊實時反應,那種"它在真幹活"的現場感,和看一份文字報告完全是兩回事。當然,這個測試也不是完美無瑕的。兩人在視頻裡也吐槽了Astra的一些行為問題——比如模型有時會在完成一箇中間步驟後就停下來,用含糊的措辭讓人以為任務已經全部完成,實際上還有後續工作沒做。但即便有這些毛病,他們依然給Astra打了S+的最高分,認為它是目前最強的模型。這個案例的意義在於:Astra的能力邊界已經從"寫代碼"擴展到了"操作專業軟件"。

一個視頻創作者以前需要自己動手乾的導入、調色、同步素材這些體力活,現在可以交給AI去跑,自己只需要在旁邊看著、偶爾糾偏就行。03它已經能幹一星期,但還不能真正放著不管看完上面這些案例,可能會覺得Astra已經強到可以撒手不管了。關於這一點,還得回到Matt Shumer的曼哈頓項目說說另一面的情況。((公眾號:))Matt讓Astra在虛幻引擎裡持續搭建曼哈頓,演示看起來很誇張,但真正跑成長任務以後,問題也開始出現。第一,長任務裡Astra會鑽細節。它會花大量時間優化某棟建築的紋理,或者反覆調試某個虛擬人的行為邏輯,其他街區還荒著。

你讓它建一座城市,它可能會沉迷於把其中一棟樓的門把手做得特別精緻。需要人時不時提醒:“差不多行了,先往前推。”第二,需要Manager Loop。Matt在整個項目裡做的,其實更像一個項目經理,持續在做三件事:判斷當前階段是否該停了、決定下一步做什麼、把關關鍵決策。Astra負責執行,但什麼時候“這部分可以了”、什麼時候“方向要調整”——這些判斷還得人來拍板。總結一下:Astra能把任務推得更遠、更久,但它還沒有能力自己定義終點和方向。它可以是個極其靠譜的執行者,但還不是一個能獨立負責的合夥人。目標清晰它能幹得又快又好,目標模糊的話還是得有人在旁邊持續引導。

別被“新建曼哈頓”嚇到,真要讓這座數字城市運轉起來,Matt Shumer本人可沒少熬夜盯著屏幕。04尾聲從第一批實測來看,GPT-6 Astra最明顯的變化,不是突然多會了多少新技能,而是更能把複雜任務持續往前推。它已經能工作更久、自己檢查結果,也更少停在“差一點完成”的位置。不過,這些測試大多來自提前拿到模型的開發者和AI從業者,任務設計和使用環境並不統一,因此更適合觀察能力邊界,而不是當作嚴格的橫向評測。但這些案例同樣說明,真正的長程任務還離完全放手很遠。模型會跑偏、會陷進細節,也仍然需要人來定義什麼時候該停、下一步該做什麼。

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 ai 大模型 評測 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness ...越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時 ...拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是 ...從 Dreamore 到 CreaXene:AI 生成工具正在走向創作 ...李娜 編輯 發私信 當月熱門文章 阿里開源 Qwen3.

8-27B 本地實測:性能很強,但 Agent 適配仍待補課 我們拆了 1.1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 萬字長文拆解DeepSeek V4 Pro與Harness:從後訓練到「代理自進化」,更大的變化在開源框架裡 流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 Qwen3.8-27B 登頂全球開源榜第一,曾經的「源神」又回來了!

最新文章 在三張圓明園鼠首照片裡,我們看到了3D AI的Harness時刻 全球開源前二,階躍終於回來了 越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題 Kimi 和 DeepSeek,為什麼出現在同一張模型架構圖裡?我們讓 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一臺機器人:誰真的把活幹完了?拆解 WorkBuddy、千問辦公和豆包工作,它們其實不是同一種產品 熱門搜索 阿里雲 移動互聯網 計算機視覺 喬布斯 螞蟻集團 AlphaGo LinkedIn DIY TechCrunch 夏普 微信支付

Related

相關文章

鈦媒體生成式AI

Muse爆火,大廠急了

定焦One2026.09.30 16:10 · 來自北京全文5358字00:00 / 15:54中國版Muse,是不是妄想? 文 | 定焦One(dingjiaoone),作者 | 王璐,編輯 | 魏佳Muse的挑戰者,還在不斷增加。北京時間9月30日凌晨,OpenAI在開發者大會上發佈了個人Agent產品Dots,每個Dot運行在獨立雲端電腦上,通過ChatGPT的插件生態接入4000多款應用,能在後臺主動跟進任務,還能通過短信、Slack、Teams觸達用戶。業界普遍把這看作是OpenAI對Meta的正面回應。

剛剛
雷峰網生成式AI

從海拉魯到現實世界:視頻模型如何理解「變化」

本文作者: 李娜 2026-09-30 16:09 導語:HiDream-O1-Video 的三場世界回應測試。HiDream-O1-Video 的三場世界回應測試。作者丨Reah 編輯丨李 娜 在《塞爾達傳說:曠野之息》中,玩家點燃一片草地,火焰會沿著草葉蔓延,熱空氣隨之升起。

剛剛

虧損超80億、算力承諾546億:Anthropic招股書揭開大模型頂流的真實賬本

數據顯示,公司2025年營收同比增長12倍至近46億美元,近三分之二來自美國市場,但同期運營虧損亦翻倍突破80億美元。在商業化結構上,Claude模型以用量計費為主導,貢獻約38億美元收入,訂閱業務僅實現7.89億美元(佔比不足20%)。招股書清晰顯現出其對頭部科技巨頭的深度綁定:2025年,Anthropic通過亞馬遜和谷歌雲平臺斬獲21.

剛剛