AI日報:京東開源視頻實時編輯模型;Qwen-Image-3.0上線;騰訊混元發佈Hy ASR 3.0 preview

2026年8月5日 08:33

重點摘要

AI資訊最新AI日報正文AI日報:京東開源視頻實時編輯模型;Qwen-Image-3.0上線;騰訊混元發佈Hy ASR 3.0 preview發布於最新AI日報時間 :Aug 5, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。新鮮AI產品點擊瞭解:https://app.aibase.

站內 AI 整理稿

近日,AI領域迎來多項重要更新,從影像生成到語音辨識,各大科技公司紛紛推出新模型與開源工具,為開發者與創作者提供更強大的技術支援。其中,京東開源了自研的實時流式視頻編輯模型 JoyAI-Video-Edit,在處理速度與影片長度上取得突破,實現「邊看邊改」的即時編輯體驗;阿里巴巴的千問系列則推出全新圖像生成模型 Qwen-Image-3.0,以極具競爭力的價格與高品質輸出登上國內文生圖排行榜首位;騰訊混元也加入戰局,發布 Hy ASR 3.0 preview 預覽版,持續深化語音辨識技術的應用。

京東此次開源的 JoyAI-Video-Edit 模型,主打實時流式編輯能力,能在 720P 解析度下達到每秒 30 幀的推理速度,用戶在觀看影片的同時即可直接修改畫面內容,無需等待冗長的渲染過程。這項技術不僅大幅提升影片創作的靈活性,也為機器人訓練數據的合成開闢了新路徑。傳統上,機器人需要大量標註影片進行訓練,而 JoyAI-Video-Edit 能夠在即時生成與編輯中產出多樣化的場景數據,降低人工標註成本,加速自動化領域的研發進程。從技術架構來看,JoyAI-Video-Edit 採用流式處理機制,模型能夠在接收影片流的同時進行逐幀推理與修改,這與傳統的離線編輯方式截然不同。

開發者可以將此模型整合到即時互動應用中,例如直播特效、線上教學、虛擬角色控制等。京東選擇以開源方式釋出,意在吸引更多社群參與優化,並推動影片編輯技術在更多垂直場景落地。阿里巴巴則在圖像生成領域補上重要拼圖,千問系列的 Qwen-Image-3.0 模型正式上線,並在文生圖榜單中拿下國內第一的成績。該模型支援超長文本理解,能精準捕捉用戶輸入的複雜描述,進而渲染出符合要求的圖像。無論是寫實風格、插畫設計,還是融合多種語言的文字提示,Qwen-Image-3.0 都能保持穩定的輸出品質。值得注意的是,其定價僅為每張 0.

18 元人民幣,在商業工作流中極具成本優勢,適合大量生成素材的場景,如電商產品圖、廣告素材、遊戲原畫等。Qwen-Image-3.0 的推出,補齊了千問系列在生成式 AI 的版圖。此前阿里巴巴已陸續推出語言模型、程式碼生成模型與影片理解模型,如今圖像生成模型加入,使得開發者能夠在同一生態中調用多模態能力,減少跨平台整合的麻煩。官方表示,該模型在超長文本理解上進行了專門優化,能夠處理數百字的提示詞,並將其中細節逐一對應到生成的圖像中,避免遺漏或誤讀。騰訊混元團隊則在語音辨識領域迎來新進展,發布 Hy ASR 3.0 preview 預覽版。

雖然目前相關細節尚未完全公開,但從命名序列來看,這次更新預計會在辨識準確率、延遲以及多語言支援上有所提升。混元系列一直是騰訊在 AI 基礎模型上的重要布局,涵蓋語言、圖像與語音等方向,Hy ASR 3.0 的預覽版釋出,意味著騰訊正逐步完善其多模態技術棧,為後續的商業應用打下基礎。綜合來看,這三項更新分別觸及影片編輯、圖像生成與語音辨識三個關鍵領域,展現出 AI 技術從單一模態走向多模態融合的趨勢。

京東的開源策略有助於降低即時影片編輯的技術門檻,讓更多中小型開發者能夠嘗試實時互動應用;阿里的圖像生成模型以高性價比切入市場,有望帶動內容創作產業的生產效率提升;騰訊的語音辨識預覽版則預示著更流暢的人機互動體驗即將到來。對於開發者而言,這些工具與模型不僅提供了現成的解決方案,也開放了改進與整合的空間。京東的 JoyAI-Video-Edit 開源後,社群可以依此開發出更貼近特定需求的編輯工具;Qwen-Image-3.0 的 API 價格親民,適合大規模呼叫;Hy ASR 3.0 preview 則讓語音應用開發者提前熟悉新功能。

整體而言,2026 年下半年的 AI 生態正變得更加開放與成熟,各家公司不再僅滿足於自用,而是積極透過開源與低價策略爭取開發者社群的支持。此外,這些技術進步也反映出產業對實時性與成本效益的追求。影片編輯從離線轉向即時,圖像生成從實驗室邁向商業化部署,語音辨識則持續追求更低的辨識延遲。隨著模型能力不斷提升,AI 工具將更深入地融入日常創作與生產流程,成為不可或缺的基礎設施。未來,我們可以期待更多跨領域的整合應用出現,例如結合即時影片編輯與語音指令的互動式內容製作,或是利用千問圖像模型生成素材後,再透過語音標註進行自動化調整,實現真正的端到端創作體驗。

總之,京東、阿里巴巴與騰訊在同一天內分別釋出或更新其 AI 模型,顯示出中國科技巨頭在 AI 賽道上的競爭已進入白熱化階段。開源、低價、預覽版等策略的背後,是對開發者生態與市場份額的爭奪。對於使用者而言,這無疑是利多消息,因為更多選擇、更低成本與更強性能的模型正在加速湧現。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

17 分鐘前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

1 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

1 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

1 小時前