IT之家生成式AI

京東發佈 JoyAI-Talker 實時語音交互模型與 JoyAI-Video-Edit 視頻編輯模型

2026年7月18日 22:44
京東發佈 JoyAI-Talker 實時語音交互模型與 JoyAI-Video-Edit 視頻編輯模型

重點摘要

京東於2026世界人工智能大會推出JoyAI-Talker實時語音交互模型與JoyAI-Video-Edit視頻編輯模型,前者具備低延遲對話與情緒理解能力,後者支援自然語言即時編輯視頻畫面。京東同步展示JoyAI模型矩陣,並開源業界最大人類視角數據集EgoLive。

站內 AI 整理稿

2026 年世界人工智能大會暨人工智能全球治理高級別會議(WAIC)7 月 17 日在上海正式揭幕,今年以「三地四館」模式同步串聯世博展覽館、張江科學會堂與西岸會場。作為大會重點參展企業之一,京東於 7 月 18 日在上海世博展覽館以「AI 進入物理世界」為核心主題首度公開亮相,系統展示其專為物理場景打造的 JoyAI 模型矩陣,並同步發表兩款全新模型:即時語音對話模型 JoyAI-Talker 與即時影片編輯模型 JoyAI-Video-Edit。京東本次發表的 JoyAI-Talker 是一款專注於即時語音互動的模型,強調低延遲對話能力,同時內建情緒理解、工具呼叫與記憶機制。

根據京東官方說明,該模型能夠從過去機械式的指令執行,進化為真正理解使用者意圖與當下狀態。具體來說,模型可以透過聲紋辨識用戶身份,並結合環境數據來判斷對話情境與目的,從而在互動過程中提供更貼近人類直覺的回應。例如,在居家或物流場景中,用戶無須反覆下達明確指令,模型便能根據語調與環境變化自動調整應答策略。另一款同步亮相的 JoyAI-Video-Edit 則將重點放在影片創作的即時性與靈活性。這款模型支援使用者自訂畫面內容,並且能夠在編輯過程中「邊預覽邊修改」,大幅降低傳統影片後製的等待時間。

JoyAI-Video-Edit 的技術核心在於將影片處理能力延伸至流式編輯架構,意味著用戶可以直接對著正在播放的影片畫面,用自然語言下達增減物件、替換人物、轉移服裝,甚至重建整個場景的指令,模型隨即即時更新輸出。這項能力對於短影音製作、廣告創意、電商商品展示等領域尤具應用潛力。事實上,京東在今年以來已陸續推出七個基礎模型,涵蓋不同模態與任務。先前發表的包括 Joy-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction 等模型,這些產品共同構成了京東以 JoyAI 基座大模型為核心的技術版圖。

目前京東的基礎模型體系已涵蓋語音、圖像、影片、即時互動、世界模型與具身智能等面向,企圖打造一條從虛擬到物理世界的完整 AI 能力鏈。在本次 WAIC 期間,京東也宣布開源了目前業界最大的人類視角數據集 EgoLive,該數據集專門用於訓練第一人稱視角的 AI 模型,有助於讓機器更理解人類的真實觀察與行為模式。此外,京東打造了首個名為 JoyInside 的「AI Home」示範空間,讓參觀者能夠現場佩戴 JoyEgoCam 頭戴裝置,親身體驗第一視角數據的採集過程,感受 AI 如何從人類的視角「邊看邊說」。

從展區設計來看,京東今年的展位試圖讓 AI 不再只是螢幕後的對話框,而是真正走進生活空間。透過 JoyAI 模型矩陣,無論是在倉儲物流的語音排程、居家環境的互動控制,還是影片內容的即時編輯,京東都在嘗試將 AI 與物理世界中的具體操作場景銜接起來。這與今年大會不少廠商強調的「從虛擬到大規模落地」趨勢相互呼應。值得注意的是,京東在模型能力上的布局並非僅停留在技術展示層面。

以語音互動為例,JoyAI-Talker 所具備的記憶與情境感知能力,可在電商客服、倉庫揀貨、智能家居等場景中提供更自然的對話體驗;而影片編輯模型則可能直接服務於京東平台的商品展示、直播帶貨與短影音行銷,讓創作者與商家能以更低門檻產出高品質視覺內容。業界分析指出,京東選擇在 WAIC 這個全球 AI 對話平台上集中展示實時語音與視頻編輯兩項技術,反映出其對於「互動即時化」與「內容生成低延遲」兩大方向的戰略優先級。隨著多模態大模型競賽進入白熱化階段,京東正試圖透過整合自身在供應鏈與零售場景的數據優勢,讓 AI 模型不僅能「聽懂話」,還能「看懂畫面」並即時作出反應。

在展會現場,京東也同步開放了部分模型的體驗環節,吸引大批參觀者排隊測試。搭配開源數據集 EgoLive 與 AI Home 沉浸式展區,京東希望讓外界更直觀地理解第一人稱視角對於未來 AI 訓練的重要性。據了解,未來京東將持續擴充 JoyAI 模型矩陣,並逐步將這些模型嵌入到旗下的物流、零售及雲端服務產品中。整體而言,京東在 WAIC 2026 上的亮相,不只是單純的模型發表,更是一次從技術到場景的全鏈路展示。

從 JoyAI-Talker 的語音互動到 JoyAI-Video-Edit 的即時編輯,再到 EgoLive 數據集的開源與 AI Home 的落地體驗,京東正努力把 AI 從「一問一答」的對話框解放到「邊看邊說」的物理世界。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前