阿里發實時語音交互模型!毫秒級響應不降智,還能邊聽邊打斷

重點摘要
阿里雲推出即時語音互動模型Qwen-Audio-3.0-Realtime,具備毫秒級回應、自主工具呼叫、情感表達及可打斷對話等能力。該模型透過在線策略蒸餾與多教師蒸餾技術,在語音問答、指令遵循等多項基準測試中表現領先,並支援口語化輸入與上下文連貫對話。
阿里雲今日正式發布新一代實時語音交互對話模型 Qwen-Audio-3.0-Realtime,同步推出 Plus 與 Flash 兩個版本。這款模型不僅維持毫秒級的低延遲響應,還強化了工具調用、多輪對話、情感表達與即時互動能力,讓語音助手從被動聽令進化為能理解上下文、主動判斷任務的智能夥伴。在路線規劃場景中,用戶不需要說出「幫我查一下」這類明確指令,只要告知自己的時間安排與需求,Qwen-Audio-3.0-Realtime 就能自行判斷何時調用地圖工具。如果行程中包含了喝咖啡的安排,模型還會自動篩選附近評分較高的咖啡館,獲取位置資訊後繼續完成後續的路線與時間規劃。
這種無需逐一指示的互動方式,大幅降低了使用門檻。與傳統語音助手必須依賴關鍵字觸發工具不同,新模型能聽懂用戶的意圖、理解任務目標,並在恰當的時機自行調用外部工具。更重要的是,工具查詢的結果會自動融入對話記憶,後續追問時可以繼續沿用,不需要重新輸入。例如用戶先問「附近有什麼川菜館」,再追問「評分 4.5 以上的哪家最近」,模型會自動銜接地圖工具上一次的回傳資料繼續檢索。根據阿里雲官方公布的基準測試,在語音問答基準 VoiceBench 中,以書面化標準提示詞與口語化提示詞分別對 Qwen-Audio-3.0-Realtime Plus 版本提問,得分各為 92.5 與 90.5,差距僅 2.
0 分。這代表模型能夠承受真人說話的隨意性,不會因為口語化表達而大幅降低表現。在更困難的多輪音頻對話挑戰 AudioMultiChallenge 中,Flash 版本在標準提示詞與口語提示詞下的得分分別為 43.6 與 38.1,差距也只有 5.5 分。而在專門衡量語音指令遵循能力的公開基準 VStyle 上,該模型取得當前最高的 SOTA 成績。今年 5 月,Qwen-Audio-3.0-Realtime 的 Preview 版本 Fun-Realtime-Audiochat 曾在「語音推理能力」與「對話流暢度」兩項指標上分別以 97.6% 與 97.
8% 登頂 Artificial Analysis,超越 GPT-Realtime-2 (High)。這顯示其在正式推出前就具備了領先實力。在價格方面,新模型採用 token 計費,無論是輸入音訊、輸出文字還是輸出語音,都統一折算為 token。輸入價格為 Plus 版每百萬 token 5 元、Flash 版每百萬 token 3 元;輸出價格為 Plus 版每百萬 token 40 元、Flash 版每百萬 token 30 元。目前可透過阿里雲百鍊平台呼叫 API 進行體驗。技術層面,千問團隊表示,Qwen-Audio-3.
0-Realtime 能在壓低延遲的同時維持高智商,主要得益於兩項核心策略。第一是在線策略蒸餾(On-Policy Distillation),團隊將文本大模型的完整推理能力蒸餾至語音模型,讓語音模型在生成回答時,還能被文本大模型即時糾正,持續提升品質。第二是多教師蒸餾策略,團隊同時使用了四位專攻不同方向的教師模型:口語多輪偏好教師負責口語化表達與指令遵循;通用教師負責基礎問答與推理;Agentic 教師負責工具調用與複雜任務;音頻理解教師負責副語言與音頻語義資訊。這樣的設計確保模型在口語、問答與推理、工具調用、音頻理解四條主線上都不偏科。
在情感交互方面,新模型擺脫了傳統語音助手的機械感,能根據對話語境動態調整語氣、節奏、音調與情感。無論用戶分享開心或難過的事,模型都可以配合使用者的語氣與心情做出適當回應。同時,模型的溝通流暢度也大幅提升;在官方測評中,即使用戶中途打斷,模型也能立即跟上新的問題,而不需要等它輸出完畢。例如讓它安排旅遊攻略時,用戶可以隨時轉換話題,模型會連貫地接著對話。為了實現順暢的即時互動,Qwen-Audio-3.0-Realtime 內建了「多模態感知的雙工控制」子模型。這個子模型會分析音頻信號、語義內容與說話人聲紋特徵,判斷交談節奏。
即使在餐廳或開放工區等嘈雜環境中,也不會被背景噪聲誤打斷;在多人討論場景中,它能鎖定主要對話對象;而在切換說話人時,能根據語義線索自然過渡。API 還預留了 audio_prompt 欄位,讓用戶可以上傳音頻樣本鎖定特定聲紋,進一步提升辨識準確度。從整個產業來看,實時語音模型的競爭已從「誰說得快」轉向「誰聊得像真人」。毫秒級響應只是基礎,能否自行調用工具、邊聽邊說、隨語境調整語氣,才是下一階段的關鍵。Qwen-Audio-3.0-Realtime 透過在線策略蒸餾與多教師蒸餾,成功在速度與智慧之間取得平衡,為語音助手的發展樹立了新標竿。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。