阿里通義實驗室發佈 Wan-Streamer v0.2 模型,AI 視頻電話響應延遲僅 550ms

重點摘要
阿里通義實驗室近日推出 Wan-Streamer v0.2 模型,主打極低延遲的即時人機互動,將端到端響應時間壓縮至僅 550 毫秒,讓 AI 能夠在真實對話場景中「邊聽、邊看、邊回應」,大幅提升對話流暢度與即時感。 這款模型將「聽、看、說、演」四項能力整合至單一 Transformer 架構,支援全雙工交互模式,也就是使用者與 AI 可以同時發話、中斷或接話,不再需要輪流等待。此外,v0.
阿里通義實驗室正式發表最新一代即時互動模型 Wan-Streamer v0.2,主打極低延遲的人機對話體驗,將端到端響應時間壓縮至僅 550 毫秒。這項突破讓 AI 能在真實對話場景中「邊聽、邊看、邊回應」,大幅提升互動流暢度與即時感,為即時視訊通話、沉浸式遊戲等應用帶來全新可能性。Wan-Streamer v0.2 的核心技術架構將「聽、看、說、演」四項能力整合至單一 Transformer 模型之中。
傳統語音或視覺 AI 通常需要依序處理聲音、影像、語意理解及生成回覆,導致明顯延遲;而新模型透過統一架構實現多模態同步推理,使得 AI 在接收用戶語音與影像輸入的同時,即可開始運算並即時輸出回應,達到近乎無縫的對話節奏。該模型採用全雙工交互模式,使用者與 AI 可以同時發話、中斷或接話,不再需要像傳統語音助手那樣輪流等待。這項設計更貼近人類自然對話中的打斷與接話行為,讓互動不再生硬。舉例來說,當用戶正在說話時,AI 可以根據用戶的語調、表情或手勢變化即時插入簡短回應,或主動引導話題轉向,營造出有來有往的交流氛圍。除了延遲大幅縮短,Wan-Streamer v0.
2 在輸出解析度上也獲得明顯提升。根據阿里通義實驗室說明,新版模型的視覺回饋更加清晰細緻,無論是即時生成的虛擬人物表情,還是場景中的文字、圖形元素,都能呈現更高品質的畫面。這對於需要精準視覺資訊的應用場景,如遠距教學、醫療諮詢或虛擬客服,尤為關鍵。在實際應用方面,Wan-Streamer v0.2 最具代表性的場景之一就是即時視訊通話助手。當用戶與 AI 進行視訊對話時,模型能同步分析語音內容與影像資訊 —— 例如用戶的表情、環境背景、手勢動作 —— 並在此基礎上給出精準且即時的回應。舉例來說,若用戶在視訊中拿起一件物品詢問,AI 可立即辨識物品並提供相關資訊,無需等待用戶說完或切換模式。
另一個重點應用領域是沉浸式遊戲中的非玩家角色(NPC)。傳統遊戲 NPC 通常依賴預先編寫的對話樹或有限的觸發條件,反應單一且缺乏彈性。而 Wan-Streamer v0.2 賦予 NPC 即時感知玩家表情、語氣與動作的能力,讓角色能夠根據玩家的即時狀態做出動態回應。例如,當玩家表現出緊張或興奮的情緒時,NPC 可以調整對話語氣、提供提示或改變任務引導方式,從而創造更具臨場感的互動體驗。阿里通義實驗室表示,Wan-Streamer v0.2 不僅在技術指標上取得顯著進展,更重要的是為人機互動的「即時性」設下了新標竿。
550 毫秒的端到端響應時間意味著 AI 幾乎感覺不到延遲,使用者能自然流暢地與之交談,這對於建立信任感與使用舒適度至關重要。未來,這套模型可望應用於智慧家居、虛擬助理、線上教育、遠距協作等領域,推動 AI 從被動應答走向主動參與的人機協作模式。值得注意的是,Wan-Streamer 系列模型由阿里通義實驗室自主研發,該實驗室長期專注於多模態 AI 技術,此前已推出多款具影響力的語言與視覺模型。Wan-Streamer v0.2 的誕生,進一步展現了阿里在即時互動 AI 領域的技術實力,也為業界提供了一個低延遲、高品質的全雙工互動解決方案。
業界分析認為,隨著即時通訊與虛擬實境應用的普及,用戶對 AI 回應速度與自然度的要求越來越高。Wan-Streamer v0.2 的 550 毫秒延遲不僅領先許多現有語音助手(通常在 1 至 2 秒之間),更透過全雙工設計打破了「輪流發言」的互動瓶頸。加上解析度提升帶來的視覺品質改善,這款模型有望成為新一代人機介面的重要基礎設施。目前,阿里通義實驗室尚未公布 Wan-Streamer v0.2 的具體開源計畫或商用時程,但已開放部分技術細節供開發者與研究機構參考。
隨著更多應用案例的落地,Wan-Streamer 系列將持續迭代,朝向更低延遲、更高畫質、更豐富互動方式的方向演進,為智慧時代的人機對話注入更多可能性。
Related
相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑
阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

Caviar 推出 24K 鍍金版 Meta 雷朋智能眼鏡 Odyssey,售價 6130 美元限量 24 副
Caviar 推出限量 24 副的 Odyssey 智能眼鏡,以 Meta Ray-Ban 為基礎,提供 24K 金與 925 銀裝飾版本,售價分別為 6130 美元與 6840 美元。該產品保留原版功能,並附帶鱷魚皮充電盒,展現奢華工藝。

Suno 平臺將為 AI 生成音樂添加隱水印,防止濫用現象發生
Suno 平台將為其AI生成的音樂加入隱藏式音頻水印與指紋識別技術,以便在其他平台上被上傳時可辨識來源。此舉是因應索尼、環球等音樂巨頭組成的聯盟,要求防止AI音樂濫用並禁止其進入全球排行榜。

AI寫的PR堆成山,Rust已忍無可忍
Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

內置 10TOPS INT8 算力:韓 Mobilint 推出 USB AI 加速器 MLD-R1
韓國NPU企業Mobilint推出USB外接AI加速器MLD-R1,內建REGULUS AI SoC,提供10TOPS INT8算力與4核Arm處理器。該裝置支援多種AI框架與作業系統,功耗僅3W,具備IP65防塵防水,適合邊緣運算場景。

AI 藝人“方桃子”帶貨美瞳廣告遭下架,聲稱“戴了一天都很舒服”
AI 虛擬藝人「方桃子」因推廣美瞳廣告,聲稱「戴了一天都很舒服」引發爭議,網友質疑其無真實眼睛無法體驗產品效果。該廣告目前已從抖音下架,可能涉及違反《中華人民共和國廣告法》中關於虛假或誤導性內容的規定。