GPT-6 Astra搓3D刷屏後,3D生成的競爭規則變了

2026年9月23日 13:06
GPT-6 Astra搓3D刷屏後,3D生成的競爭規則變了
站內 AI 整理稿

寫代碼、調Blender、搭場景,甚至從零做出一款3D遊戲。過去要在專業軟件裡折騰半天的活兒,現在一句話就能讓Agent接手。△圖源:小紅書 不過吧,GPT-6 Astra的表現,也讓3D生成行業突然多了一個問題: 通用大模型自己都能建模了,專業3D生成模型還有用嗎?事實上,GPT-6 Astra擅長理解目標、拆解任務,也能通過代碼和基礎幾何體完成機械結構、工業零件等模型。但遇到人體、動物和複雜道具等曲面豐富、細節密集的對象,還需要專業3D生成模型提供更完整的幾何、網格和材質。通用模型負責「想清楚怎麼做」,專業3D模型負責「把複雜模型做好」。這也意味著,3D生成正在迎來下一代用戶:Agent。

過去,3D生成產品主要服務人類創作者。行業競爭圍繞「Production-Ready」展開,誰能生成質量更高、更可控,也更容易進入生產管線的資產,誰就更有優勢。當Agent開始接管創作任務,評價標準又多了一層。模型質量仍然是基礎,但3D能力還要能夠被Agent理解和調用。面對不同輸入,系統需要自己判斷建模路徑;資產生成之後,還要支持Agent繼續編輯、拆分和加工。這也是3D生成在Agent時代的競爭新標準——Agent-Ready。它代表的變化,是3D生成從一個等待人操作的單點工具,轉向Agent工作流中的專業能力。

人可以直接在產品裡發起創作,外部Agent也可以根據任務需要調用3D生成,並繼續推進後續流程。但當3D工具的用戶從人擴展到Agent,新的問題也來了:Agent能否看懂輸入素材,選對建模路徑,並在模型生成後繼續修改?國際領先的3D生成大模型公司影眸Hyper3D今日上線的Agentic Mode,正是沿這條路線展開。Agent會參與輸入整理、參考圖分析和建模路徑選擇,接管了建模過程中的更多專業判斷,並圍繞創作目標持續推進任務。生成的Low-poly N-GONS模型還可以繼續進行參數化調整、調用動畫預設和增強材質。

從Production-Ready到Agent-Ready,3D生成競爭的重點正在從「能不能生成可用資產」,擴展到「能不能讓Agent把專業3D能力真正用起來」。圖別整理了,直接一股腦丟進去 Agentic Mode在自動優化輸入上有怎樣的表現?第一輪,我先準備了5張不同產品圖。主角都是同一臺復古桌面風扇,但每張圖提供的信息不太一樣。第一張是產品正面照,能看到深青色機身、奶油色扇葉和黃銅支架;第二張繞到背後,露出了電機外殼、散熱孔和電源線。第三張只拍網罩、轉軸和扇葉根部;第四張是一張雜亂的桌面照,風扇旁還堆著電腦、書、杯子和植物。最後還有一張規格卡,文字描述了扇葉數量、材料和零部件顏色。

常規的多圖生3D,最佳輸入通常是一組提前整理好的參考圖:主體一致,角度互補,背景儘量乾淨。部分工具雖然已經支持背景去除和圖片增強,但遇到場景圖、局部特寫和文字卡混在一起,用戶往往還是要先挑圖、裁圖,甚至指定不同視角。這裡,我直接把5張圖一口氣輸入給了Agentic Mode,看看它能做成什麼樣。圖片上傳後,Agentic Mode沒有立刻開始生成,界面下方先滾動起了一連串分析過程。仔細查看,它先沿著物體邊緣識別整體輪廓,再判斷不同圖片的拍攝角度,區分真實結構與光影,再尋找機身與局部零件之間的邊界。單張圖片裡看不清的信息,則會從其他參考圖中補全。

比如正面照能看清扇葉和網罩,但電機有多厚、背面長什麼樣,還得結合後側圖判斷。據影眸Hyper3D介紹,這一過程中,系統還會按需增強輸入素材。用戶無需提前篩選標準主圖,也不用手動裁掉場景背景,再反覆嘗試不同的圖片組合。整個過程沒花多久,一臺完整的復古桌面風扇就出現在了我的工作臺裡。出來一看,我還挺意外——桌面照裡那些電腦、杯子、書,壓根沒跑進模型裡。它自動把主體和背景分了家,還把5張圖裡的信息拼到了一起:正面的扇葉網罩、背面的電機散熱孔、特寫裡的轉軸細節,一臺完整的風扇就這麼出來了。

這也是Agentic Mode這次更新的一大重點,模型在處理輸入上不是簡單把多張圖堆在一起,而是先理解、自主篩選和組織參考信息,再進入生成。對於Low-poly N-GONS生成的模型,Agentic Mode提供了可以用自然語言驅動的參數化調整、動畫預設、材質增強等後續編輯功能,為用戶提供了創作的延伸可能性。嫌底座太寬,拉窄一點;支柱太矮,直接抬高。深青色搪瓷機身、黑色橡膠電源線和緞面黃銅支架隨你挑,都可以單獨換顏色、改質感。甚至連怎麼動都準備好了,開關循環、左右掃風、向上送風,點一下就能運行~ 小物體玩熟了,難度直接拉滿——這次輸入的不是單個物體,而是一張完整的住宅建築圖紙。

正面、側面和背面立面圖擠在一起,還有一張帶房間佈局的平面圖,密密麻麻標著尺寸和材料說明。對於普通圖像生成模型來說,它看到的可能只是一張線條和數字堆成的複雜圖片。想把它變成3D模型,還得先理解不同圖紙之間的關係:平面圖決定房間和牆體位置,立面圖提供門窗、樓層與屋頂結構,尺寸標註則約束各部分比例。這次依然沒有提示詞,只上傳圖紙,剩下的交給Agentic Mode處理。結果它自己讀完了整套圖——平面圖管房間佈局、立面圖管門窗屋頂、尺寸標註管比例大小,全給理清楚了,直接就出了3D模型。右側同樣有一整套參數化調整面板,建築的結構、材質都能繼續改。這一輪考驗的能力,和前面的風扇不太一樣。

上一輪的難點,是從一堆雜亂資料中找出共同主體,再把不同圖片裡的信息拼到一起。這一次,素材本身已經整理成了建築圖紙,難點變成了讀懂這套專業表達:哪些是平面佈局,哪些是不同方向的立面,尺寸標註又該如何約束模型結構。兩輪試下來,我感覺Agentic Mode最不一樣的地方就在於:無論是雜亂的產品照,還是信息密集的建築圖紙,系統都會先理解其中的主體、視角和約束關係,再根據任務特點自主規劃最合適的建模路徑。而且生成不是終點,參數化調整、材質增強、動畫預設等表現還能圍繞同一個資產繼續調整。模型出來還不算完,接著改就行 當然,如果你連參數名稱都不想研究,還可以直接描述修改目標。

我們回到剛才生成的復古風扇,試著直接用自然語言下指令: 修改完成後,風扇網罩被明顯抬高,底座、網罩尺寸和5片扇葉則基本保持原樣。整個過程中,我沒有尋找對應的參數滑桿,也沒有給出具體建模步驟。系統需要先從文字中判斷想改哪個部件,再將要求映射到相應參數,最後執行調整。結構之外,材質也能繼續修改。這一次,我要求系統只把5片奶油色扇葉改成半透明琥珀色,其他部件保持不變。可以看到,5片扇葉都變成了暖橙色,深青色網罩、黃銅中心蓋、支架和底座仍然保留原來的配色,模型結構也沒有發生變化。半透明效果不算特別強烈,但部件範圍控制得比較準確。系統識別出了需要修改的扇葉,沒有把旋鈕或整颱風扇一起染成橙色。

類似的修改也適用於更復雜的3D資產。比如在廚房場景中,用戶可以選中局部區域,單獨替換材質,而不必重新生成整個空間。用戶還可以為模型添加動畫,讓原本靜止的資產直接動起來。對於機械手這類包含可動部件的模型,系統還提供了動作預設,可以直接調用相應動作。從尺寸、材質到動畫,修改都可以圍繞已經生成的資產繼續進行。用戶不必每次都回到輸入端重新生成,3D模型也從一次性的結果,變成了可以反覆加工的工作對象。3D生成進入下半場,開始比「Agent-Ready」 前幾輪實測,其實都指向了影眸Hyper3D一整套與AI融合、為AI適配的能力:Agent-Ready。

它具體包含三層意思: 第一層,是讓Agent真正讀懂任務。面對一組角度不同的產品照片,系統要知道哪些圖片描述的是同一個物體,哪些場景元素應該排除;換成建築圖紙,還要理解平面圖、立面圖和尺寸標註之間的關係,再規劃相應的建模路徑。第二層,是讓生成結果可演進、可迭代。過去的文生3D或圖生3D,往往生成完一個模型,任務就結束了。但如果3D要進入Agent工作流,模型還得支持後續修改:尺寸能夠調整,材質可以替換,零部件可以拆分,局部結構也能繼續編輯。Agent拿到的不能只是一份用來預覽的3D成品,還得是一份可以接著加工的資產。第三層,則是讓這項能力能夠被其他Agent調用。

此前影眸Hyper3D開放了面向AI Agent的MCP接口,接入之後,用戶可以在支持MCP的AI客戶端中直接描述需求,由Agent調用Hyper3D Rodin完成3D生成,再查詢進度並取回結果。如今,全球越來越多創作者都在使用「GPT-6+Hyper3D MCP」的組合進行3D內容創作。這樣一來,3D生成就不必始終停留在獨立網頁裡。它可以被接入更長的任務鏈,比如從產品設計圖生成模型,再繼續製作材質、拆分部件,最終交給遊戲引擎或其他生產工具。回頭看影眸Hyper3D這幾年的產品演進,一條路線已經逐漸清晰。

從自然語言驅動的3D Editing、支持模型智能分件的BANG,到開放MCP接口,再到如今的Agentic Mode,Hyper3D持續把3D生成從一次性交付,推向可調用、可修改、可繼續執行的生產能力。3D生成的上半場,主要服務的用戶是人。評價標準在於,幾何結構是否準確,材質和拓撲能否進入生產管線。它們決定了用戶拿到的究竟是一份可供展示的3D結果,還是能夠繼續編輯和投入使用的3D資產。Production-Ready,是影眸Hyper3D對這個階段的回答。GPT-6 Astra重新點燃3D生成之後,行業多了一個新問題:當通用模型也開始調用工具、搭建場景,專業3D生成模型還需要承擔什麼角色?

影眸Hyper3D的判斷是,單次生成質量只是起點,真正的下一步是讓3D能力接入更長的創作鏈路。通用模型擅長理解目標、拆解任務,也能通過基礎幾何體與參數完成結構明確的模型。但面對人體、動物和複雜道具等曲面豐富、細節密集的對象,專業3D生成模型仍然承擔著高質量資產生成的核心任務。二者的協作,正在帶來一個更關鍵的變化:3D工具的使用者,開始從人擴展到Agent。進入下半場,單次生成質量依然是基礎,新的競爭門檻則是Agent能否順利使用這些3D能力。工具需要能夠被Agent調用,生成資產需要支持後續編輯,建模流程也要接入更長的任務鏈條。這就是Agent-Ready。

從Production-Ready到Agent-Ready,影眸Hyper3D已經走在了下半場的前列。當Agent能夠理解素材、選擇建模路徑,並圍繞資產繼續完成編輯和加工,3D生成才真正從單點工具走進下一代內容生產流程。—完— 版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

Jev vs Decitron:同為決策AI,為什麼不是一回事?

它來自TypeSafe AI。這支有OpenAI背景的團隊沒有繼續卷生成和推理,而是換了個方向:讓AI直接做判斷。他們甚至把口號直接寫成:Decisions, not strings(要決策,不要文本)。Jev的走紅,也讓“Decision”(決策)重新成為AI圈的熱門詞。

剛剛

Win11 驚現 AI 惡意軟件 ClosedQuorum:入侵後自主決策,專挖最有價值信息

該惡意軟件主要針對 Windows 11 平臺,會在成功入侵用戶電腦後調用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等 AI 模型自主決策,專門挖掘攻擊目標最有價值的信息。調用 Gemini、DeepSeek 等模型,入侵後自主決策Talos 深入分析後發現,ClosedQuorum 在成功入侵目標設備後,會藉助多個 AI 模型來決策攻擊方案,包括竊取瀏覽器登錄憑證、提取加密貨幣信息、持久化執行惡意軟件,以及向其他設備橫向散播惡意軟件。

剛剛
量子位生成式AI

阿里千問AI平臺全面升級模型服務、Agent服務、AI應用

阿里巴巴宣布千問AI平台全面升級,以推動Agent進入生產為核心,新增Agent服務與行業AI解決方案,並推出API優速模式、Agent Studio、千問AI座艙等能力。平台強調從消耗Token轉向交付結果,並預計至2032年算力規模將超過20GW,以支撐完整AI體系。Agent Studio提供企業級全棧服務,支援模型路由、託管運行與生態工具接入,同時強化模型服務的效能與成本優化。

剛剛
量子位生成式AI

Claude Opus 5.5突襲!68萬行代碼一天遷完,API價格打8折

Anthropic突襲發布Claude Opus 5.5,在代碼生成、知識工作與計算機操作等基準測試中奪冠,輸出速度較Opus 5提升逾三成,API輸入與輸出價格下調20%,緩存讀取價格更砍六成。該模型能在一日內遷移68萬行代碼,並在安全護欄上與Fable 5.1同級,且Anthropic預告Sonnet 5.5與Haiku 5.5將於數週內接續推出。

剛剛