阿里發佈實時語音交互對話模型 Qwen-Audio-3.0-Realtime,號稱懂傾聽、更聰明

重點摘要
首頁 > 智能時代>人工智能 阿里發佈實時語音交互對話模型 Qwen-Audio-3.0-Realtime,號稱懂傾聽、更聰明 2026/7/15 11:00:22 來源:IT之家 作者:清源 責編:清源 評論: IT之家 7 月 15 日消息,阿里巴巴實時語音交互對話模型 Qwen-Audio-3.
阿里發佈實時語音交互對話模型 Qwen-Audio-3.0-Realtime,號稱「懂傾聽、更聰明」
2026年7月15日,阿里巴巴正式發佈了旗下最新一代實時語音交互對話模型——Qwen-Audio-3.0-Realtime。這款模型從智商水準、Agent 工具調用能力、共情對話深度以及雙工交互流暢度四大維度進行了全面升級,官方口號為「懂傾聽,更聰明」。這意味著語音助手不再只是簡單地「聽到」聲音,而是能真正「聽懂」語境、情緒與意圖,並給出更貼近人類交流習慣的回應。本次發佈的模型分為兩個版本:Qwen-Audio-3.0-Realtime-Plus 和 Qwen-Audio-3.0-Realtime-Flash。
Plus 版本在推理能力上更加強勁,適合需要高精度理解與複雜邏輯判斷的場景;Flash 版本則在響應速度上做了極致優化,適用於對即時性要求極高的互動。二者均針對智能客服、線上教育、娛樂互動與情感陪伴等領域進行了定向調優,力求在實際業務中兼顧效率與質量。其中最具突破性的亮點是模型的「擬人化表達」能力。Qwen-Audio-3.0-Realtime 能根據語境動態調整語氣、節奏、音調與情感張力,徹底告別機械式朗讀感。
例如在激烈辯論中,它能準確捕捉對方論點,快速組織反駁邏輯,同時保持口語化且帶有適當強度的語氣;在角色扮演場景中,它可以根據設定的人物背景(如歷史人物、職業身份)切換說話風格、用詞習慣與情感輸出;在情感陪伴情境下,當用戶訴說煩惱或分享喜悅時,模型能通過語調的抑揚頓挫與共情話語傳遞溫暖,真正做到「有溫度的交流」。此外,該模型還支持自定義音色克隆功能,企業或個人可根據實際業務需求定製專屬語音形象,進一步拓展品牌辨識度與交互親和力。語音交互的另一大痛點——複雜環境下的干擾問題,Qwen-Audio-3.0-Realtime 也給出了系統級解決方案。
其內置的多模態雙工控制模型支持聲紋級背景過濾,即便身處餐廳、開放工區等高噪場景,依然能精準鎖定主體說話人的聲音,確保對話不被打斷。在多人交談中,模型能準確識別當前的對話對象,不被旁人插話干擾,並根據上下文線索在不同說話人之間智能切換,實現自然流暢的群體對話體驗。在工具調用與任務執行方面,Qwen-Audio-3.0-Realtime 不再侷限於「你問我答」的聊天形式,而是具備動態工具調用能力。它可以根據實時對話內容自主觸發路線規劃、信息查詢、日程安排等操作,形成完整的語音指令閉環。
官方更在 S2S 語音指令遵循公開 Benchmark VStyle 上取得了 SOTA 成績,證明其在語音到語音的直接任務執行上已達到業界領先水準。引人關注的是,在 Artificial Analysis 的子項評測中,Qwen-Audio-3.0-Realtime 綜合排名第一,超越了 OpenAI GPT-Realtime-2。這一對比凸顯了阿里在端到端語音對話模型領域的技術儲備已具備國際競爭力。
從生成側的技術優化來看,該模型實現了四大突破:一是情感感知生成,即時識別用戶情緒並給出共情回應;二是韻律動態調整,根據語義重點與對話節奏自動控制語速、停頓與重音;三是副語言信息處理,能夠理解並生成笑聲、嘆息、猶豫等非語言信號,還原真人交流的細膩層次;四個性化風格適配,用戶可以通過簡單指令讓模型一秒切換至設定的角色風格,適用於創意互動、教學仿真等多種場景。阿里巴巴本次未僅停留在實驗室級別的能力展示,而是將所有模型能力封裝為可直接調用的 API 與完整開發文檔,方便開發者快速集成。同時官方也開放了在線 Demo 供公眾體驗,用戶可以親自感受「懂傾聽」的語音交互新體驗。
業內人士分析指出,隨著大語言模型在文本領域的逐漸成熟,語音作為最自然的交互入口正在迎來新一輪技術躍遷。阿里本次推出的 Qwen-Audio-3.0-Realtime 在情感理解、環境適應性與任務執行效率上的同步提升,將加速語音助理從工具型向伴侶型的演進,也為智能客服、在線教育、無障礙輔助等行業提供了更高質量的解決方案基礎。目前該模型已開放 Plus 與 Flash 版本的 API 申請,相關技術文檔與體驗地址已在千問官方平台同步上線。阿里方面表示,未來將持續迭代模型能力,推動語音交互向更自然、更智能、更具人情味的方向發展。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。