Stream3D補全流式三維
重點摘要
Stream3D提出了一種無需訓練的串流機制,能將凍結的單視角3D生成器轉換為串流生成器,透過證據記憶機制快取歷史中最具資訊的幀來解決長時間單眼影像串流的時間不一致問題。該方法在真實與合成串流基準測試中,在光度與幾何指標上均優於現有基線方法。
「Stream3D補全流式三維」——這項由Kaichen Zhou、Zeyang Bai、Xinhai Chang、Mengyu Wang、Paul Liang與Fangneng Zhan共同提出的研究,近日在電腦視覺領域引起關注。研究團隊來自多個學術機構,他們在arXiv上發表論文,詳細介紹了名為Stream3D的全新架構,目標是解決現有3D生成模型在處理連續影像串流時產生的嚴重時間不一致問題。 目前主流的單視角3D生成模型,如SAM 3D、TRELLIS與Hunyuan3D,能在單張影像輸入下產出高品質的物體重建結果。然而現實世界的視覺資訊往往是以長時間的單眼影片串流形式出現,並非靜態單張影像。若將這些模型直接套用在串流的每一幀,獨立進行3D生成,就會造成前後幀的生成結果在幾何與外觀上出現劇烈跳動,無法維持連貫性。 Stream3D的設計核心在於提出一種「無需訓練」的串流機制,可將已凍結的視角條件3D生成器轉變為真正的串流生成器,同時維持固定的跨區塊記憶體。研究人員引入了一個精簡的「證據記憶」(evidential memory)結構,其運作原理是基於一套新提出的「證據評分機制」,有選擇性地快取最具資訊量的歷史幀。 隨著串流持續前進,記憶內容會動態更新,始終保留固定數量的資訊幀,避免記憶體用量隨著序列長度線性增長。這項設計不僅防止了長時間序列導致的生成品質劣化,更讓底層的3D生成模型完全保持原樣,無需重新訓練、修改架構或添加輔助損失函數,真正實現了「即插即用」的便利性。 在評估階段,研究團隊分別在真實場景與合成資料的串流基準測試上進行驗證。結果顯示,Stream3D在光度指標與幾何指標兩方面,均優於潛在傳輸基準方法,包括KV-cache重用與基於流動的特徵編輯技術。這意味著在保持生成穩定性的同時,Stream3D也兼顧了視覺品質與形狀準確度。 論文作者強調,這項工作填補了現有3D生成模型在串流應用上的空白。過去許多研究專注於提升單張影像的3D重建品質,卻忽略了現實中觀測資料往往是連續變化的。Stream3D的出現,為自動駕駛、機器人視覺、擴增實境等需要即時處理視訊串流的領域,提供了更可靠的3D生成解決方案。 為了讓更多研究者能重現並應用這項成果,團隊已將論文全文、補充資料以及示範連結公開於arXiv。論文最初於2026年5月20日提交,經過多次修訂後,於6月11日發布第四版。有興趣的讀者可透過arXiv編號2605.21472查閱詳細內容,並在論文中找到對應的計畫網址。 整體而言,Stream3D以輕量且無需訓練的記憶機制,成功將凍結的3D生成器擴展至串流情境,並在實驗中展現出顯著優勢。這項技術不僅為後續的串流式3D生成研究樹立了新基準,也為實際應用打開了更多可能性。
Related
相關文章

聯發科:第二款 AI ASIC 加速器有望 2028 年量產,英特爾代工 EMIB 進展良好
聯發科在財報會議上表示,第二款AI ASIC加速器開發順利,預計2028年進入量產階段,同時英特爾代工的EMIB先進封裝技術也穩步推進。首款AI ASIC加速器則預計於2026年第二季量產。聯發科也批准了50億美元資金以確保供應鏈並擴展系統級業務。

2026上半年海外短劇AI劇:APP狂攬12.7億美金,全年規模60億
2026年上半年海外微短劇市場規模預估超過60億美元,其中APP內購收入達12.7億美元,較去年同期成長13%。AI短劇與漫劇成為增長核心引擎,帶動下載量與收入持續走高,中國廠商在市場中佔據主導地位。

賈躍亭:法拉第未來 FF EAI 機器人 7 月實現銷售及出貨 152 臺,創單月新高
首頁 > 智能時代>具身智能 賈躍亭:法拉第未來 FF EAI 機器人 7 月實現銷售及出貨 152 臺,創單月新高 2026/8/3 7:16:23 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 3 日消息,法拉第未來創始人賈躍亭今日發文透露,FF EAI 機器人 7 月實現銷售及出貨 152 臺,再創單月新高。
谷歌要在 2028 年囤 1500 萬顆自研 AI 芯片,直接掀翻英偉達算力王座
AI資訊AI新閒資訊正文谷歌要在 2028 年囤 1500 萬顆自研 AI 芯片,直接掀翻英偉達算力王座發布於AI新閒資訊時間 :Aug 3, 2026閱讀 :1分鐘據臺媒鉅亨網援引一份市場分析報告,谷歌計劃在 2028 年部署 1200 萬至 1500 萬顆自家自研的 TPU v9 AI 加速芯片。
AGI Bar免費token上線
AGI Bar免費token上線。 北京店今起開放免費token。進店連WiFi即可���調用。查看即刻發佈原文詳情稱本地推理。先供DeepSeek V4 Flash���。上海店後續也會接入。
A Tutorial on GeoAI: Designing Footprint Extraction from NAIP Imagery Using U-Net, Grounding DINO, SAM, and Mask R-CNN
本教學示範如何從高解析度NAIP航照影像中提取建築物足跡,涵蓋從環境設置、資料下載、圖像切割到模型訓練的完整工作流程。使用U-Net(ResNet-34編碼器)進行語義分割,並與Grounding DINO、SAM及預訓練Mask R-CNN進行零樣本與實例分割比較。最後將預測遮罩轉換為正規化建築物多邊形,並計算IoU與F1指標。