我和「二次元老公」約上會了!全球首個可以玩的實時交互模型,Xmax X2.0發佈

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 我和「二次元老公」約上會了!全球首個可以玩的實時交互模型,Xmax X2.
2026年7月15日,人工智能公司Xmax AI正式发布全球首个可实时交互的視頻模型——X2.0。該模型打破了傳統AI視頻生成「輸入—等待—輸出」的單向模式,用戶不僅能觀看視頻,更能像操作遊戲一樣即時參與並改變畫面內容,標誌著AI視頻正式邁入「可玩」的新階段。長期以來,AI視頻雖已能生成流暢畫面,但本質上仍是靜態等待渲染完成,且生成後無法改變。X2.0徹底改寫這一規則:它透過攝像頭捕捉現實世界,並在毫秒級延遲下進行即時渲染與交互。用戶不需要等待數秒甚至更久的預生成,體驗如同打開鏡頭就能立刻改變所見世界。在核心功能上,X2.0提供了四大能力維度。
首先是「實時渲染」,可在保留原始動態與光影的前提下,對視頻中的角色、服裝與背景進行即時更換。無論是將自己變成動漫人物,或是為場景疊加全新視覺風格,所有替換都是幀級連貫,彷彿為現實畫面裝上可即時調整的濾鏡。其次是「次元交互」,讓虛擬角色真正「住進」現實世界。用戶只需將攝像頭對準某個物體或空間,即可召喚異次元角色並與其進行凝視、撫摸等深度互動,甚至可透過現實物體作為錨點控制虛擬角色的移動路徑。礦泉水瓶能被憑空替換為一把匕首,房間裡的任何物品都可能「活」過來,模糊物理與虛擬的邊界。第三是「觸屏交互」,賦予靜態圖像動態生命。用戶只需在屏幕上輕輕拖拽,照片中的寵物、畫中人物便能即時動起來。
這項功能讓任何靜止圖片都能化身為可互動的「桌寵」或動態創作素材,極大降低了動態內容的創作門檻。此外,X2.0還設有Free模式,允許用戶以自然語言指令自由創造噴火、空間扭曲等特效,將想像力化為即時視覺反饋。這些應用體驗的實現,依託於Xmax在技術架構上的根本性突破。傳統視頻模型大多採用雙向注意力機制,須完整計算整段或一個片段後才輸出結果,導致延遲明顯。X2.0則採用逐幀自迴歸生成的「流式架構」,模型在持續計算的同時,用戶端已能同步看到畫面流出,響應時間壓縮至毫秒級,實現了真正即時。
面對速度、成本、品質三者的「不可能三角」,團隊提出多階段多目標融合蒸餾以大幅減少採樣步數,利用上下文持久化技術確保長時間生成不衰減,再結合注意力矩陣稀疏化、FP8量化等極致壓縮手段,最終使單張消費級顯卡即可滿血運行X2.0,以960p@24fps的分辨率流暢輸出。更值得關注的是,Xmax成功將X2.0部署至iPhone端,在本地完成384p@16fps的即時交互生成。這是全球首個能在手機上本地運行的同類模型。為攻克這一難關,團隊在訓練端採用混合精度量化與結構化剪枝壓縮模型體積,在推理端透過計算圖算子融合與專屬芯片硬件加速,使最廣泛的C端用戶也能隨時隨地打開這扇「異世界之門」。在交互維度,X2.
0構建了「統一交互架構」,它不僅理解文字指令,還能解析攝像頭畫面、辨識手勢動作與屏幕觸控,幾乎覆蓋所有自然交互動機。這讓用戶能以最直覺的方式與視頻內容溝通,無需複雜學習即可上手操作。產業應用方面,X2.0的潛力不限於個人娛樂。電商領域可即時試穿服裝,大幅降低退貨率;虛擬陪伴賽道能讓手辦或角色「甦醒」,提供強烈在場感;直播行業可實現千人千面的即時換裝、場景轉移,將觀看變成一場互動遊戲。針對存量IP激活、文旅、教育等場景,這套模組同樣能注入全新體驗。Xmax同時宣布開放API,希望將X2.0打造成為視頻交互的底層基礎設施。
其成本僅為海外同類模型(如Decart)的十分之一,讓中小開發者也能輕鬆接入,調用即時渲染與交互能力。這一生態佈局意在讓所有與視頻相關的行業,都有機會被這套「消費級可交互視頻底座」重新書寫。回顧視頻載體的一百多年演變,從膠片到數字,從專業設備到手機鏡頭,但「可看不可觸」的壁壘始終存在。X2.0憑藉對即時性與交互性的極致追求,首次推開了現實與虛擬世界之間那扇門。當生成成本降至消費級、終端覆蓋到手機,所有視頻都將成為可即時交互的資產。正如團隊所言,這或許正是交互視頻模型迎來「GPT-3時刻」的開端。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。