Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景

重點摘要
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。
圍著桌上的小擺件隨手拍幾張照片,幾秒後,這些二維影像竟從螢幕中「立」了起來,變成一個可以自由旋轉、探索的三維場景。沒有複雜的掃描設備,也幾乎不需要等待,只要幾聲快門,就能把現實世界瞬間轉化為數位空間。這項技術來自一個名為「影溯」的開源模型,它正嘗試用Transformer架構打開三維內容生產的新入口,讓原本需要大量運算與專業軟體的工作,變得像拍照一樣簡單。影溯的核心突破在於,它不再依賴傳統的多視角重建或深度估計流程,而是直接從少量二維圖像中學習場景的立體結構。無論是桌上的小擺件、咖啡店的角落,還是家中的臥室,只要用手機從不同角度拍攝六張左右照片,模型就能在數秒內生成一個可自由探索的3D場景。
這項能力的背後,是從二維像素到三維場景查詢(Query)的技術架構轉變,讓Transformer能夠理解不同視角之間的空間關係,並即時補全視覺盲區。實際體驗令人印象深刻。記者用手機對著樓下咖啡店的外圍拍了六張照片,上傳到影溯模型後,幾乎沒有等待時間,一個立體的咖啡店場景便出現在畫面上。你可以拖曳視角,從側面觀察招牌的細節,或者繞到後方看看小巷的模樣。同樣的過程也應用在臥室中——幾張隨手拍下的床鋪、書桌與窗簾,立刻重組成一個可以走進去的虛擬空間,連光線的明暗與物品的相對位置都相當自然。這項技術的應用場景遠不止於此。
聚餐時記錄下歡樂的餐桌佈置,桌搭愛好者展示自己精心整理的電腦桌面,畢業生在校園角落留下最後的紀念,搬家前把舊房間的模樣保存下來,甚至婚禮現場的溫馨瞬間——這些原本只能以平面照片保存的回憶,現在都能轉化為可以自由探索的3D場景,並分享給遠方的朋友。影溯讓「把場景發給朋友」這件事,從一張靜態圖片升級為一個可互動的立體世界。從技術層面來看,影溯的開源特性意味著開發者與創作者都能自由使用這套模型,進一步推動三維內容的規模化生產。過去,建立一個高品質的3D場景往往需要專業掃描器、數十張照片與漫長的運算時間,而影溯將這個過程壓縮到秒級,同時保持場景的幾何結構與視覺真實度。
這對於電商展示、虛擬旅遊、遊戲資產製作、建築可視化等領域,都具有潛在的變革價值。Transformer架構的引入,是三維重建領域的一個重要轉折點。傳統方法通常依賴卷積神經網路或光流演算法,需要大量標註數據與顯式深度資訊。而Transformer的自注意力機制,讓模型能夠在缺乏先驗的情況下,從多張圖像中自動學習場景的全局結構與局部細節。影溯正是利用這種能力,在二維圖像與三維空間之間建立直接映射,從而實現「幾張照片生成可探索場景」的即時體驗。值得一提的是,影溯並非只是學術研究的成果,它已經以開源形式釋出,任何人都可以下載使用。
這意味著,即便沒有專業的電腦視覺背景,普通用戶也能透過簡單的拍照步驟,創造出屬於自己的3D內容。社群中也開始出現各種創意應用:有人用它記錄寵物的活動空間,有人用它製作虛擬展覽,甚至有人嘗試將多個場景拼接成一個連續的空間地圖。當然,目前的模型仍有其限制。例如,對於透明物體、鏡面反射或極度複雜的場景,影溯的重建效果可能不夠理想;另外,場景的探索範圍也受限於輸入照片的覆蓋角度。但隨著更多開發者參與調校與數據貢獻,這些問題有望在後續版本中得到改善。影溯的開源生態,正在為三維內容的民主化鋪平道路。從2D像素到3D場景查詢,影溯不僅是技術上的創新,更代表一種新的內容生產思維。
當每個人都能用手機輕鬆創造可探索的立體世界,社交分享、遠距協作、數位保存的方式都將隨之改變。未來,或許我們不再需要文字描述或平面照片來回憶一個地方,只要幾張照片,就能把那個瞬間完整地「打包」發送給任何人。這個由Transformer驅動的三維世界入口,剛剛打開。而影溯,正是那個讓一切變得簡單又神奇的開端。
Related
相關文章

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
首頁 > 智能時代>人工智能 谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏 2026/7/21 15:00:10 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
AI資訊AI新閒資訊正文打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘谷歌 DeepMind 團隊近日推出了全新的 GenCeption 模型,嘗試將傳統的視頻生成 AI 逆向改造成能夠深度理解現實世界的視覺分析引擎。

大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分
西北工業大學與香港科技大學團隊提出IQA-T1框架,讓多模態大模型在評估圖像質量時,不再僅憑直覺,而是透過生成噪聲殘差圖、頻譜圖等視覺證據來進行判斷。此方法在七個圖像質量評估基準上取得綜合最優成績,平均PLCC/SRCC達到0.784,並使評估過程更具可解釋性。
Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結
國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。