又快又聰明,阿里發佈Qwen-Audio-3.0-Realtime:實時語音大模型四項功能升級

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 又快又聰明,阿里發佈Qwen-Audio-3.
阿里巴巴於今日正式推出新一代實時語音交互對話模型Qwen-Audio-3.0-Realtime,這次升級鎖定智商、工具調用、共情能力與對話流暢度四個方向,同步提升,目標是讓語音模型既「聽得懂」又「夠聰明」。新模型推出了兩個版本:強調推理能力的Plus版本與追求更低延遲的Flash版本,分別對應不同使用場景,涵蓋智能客服、教育培訓、娛樂互動與情感陪伴等領域。今年5月,該模型的Preview版本曾在全球第三方評測平台Artificial Analysis拿下兩項冠軍,表現超越當時的GPT-Realtime-2,為這次正式版本打下強勢基礎。
為了降低時延,過去許多實時語音模型往往必須犧牲推理深度,導致智商出現明顯衰減。Qwen-Audio-3.0-Realtime在這方面做了針對性處理,對於日常對話與簡單問答等對時間敏感的應用,模型可以直接生成回覆,在毫秒級內作出響應。在語音問答基準VoiceBench的測試中,Plus版本使用標準書面提示詞時得分92.5,而在更貼近真實人類對話的口語化提示詞下仍拿到90.5,只下滑2分,顯示模型能有效應對真人發言的隨意性和不完整表達。在更高難度的多輪音頻對話基準AudioMultiChallenge中,Flash版本的標準提示詞與口語化提示詞得分分別為43.6與38.1,差距同樣控制在5.
5分內,證明模型在口語環境下仍有穩定表現。除了智商層面的突破,這次新模型在工具調用能力上也有明顯進展。過去不少語音模型只能聊天,無法順暢處理需要調用外部工具的任務,往往必須等用戶說出清晰的指令,例如「幫我打開XX」,才會觸發動作,而一旦回到閒聊模式,對話容易出現上下文斷裂。Qwen-Audio-3.0-Realtime則不需要明確的關鍵字開頭,就能自行判斷何時應該調用工具,且調用結果會自動融入後續的對話記憶中。舉例來說,用戶先問「附近有什麼川菜館」,再追問「評分4.5以上的哪家最近」,模型會自動銜接上一次地圖工具的查詢結果,繼續檢索,而不是需要重新啟動流程。
這套能力是基於標準的FunctionCall協議完成,因此可以順暢引入MCP、API與知識庫等外部資源。在用戶體驗層面,共情對話能力是這次版本升級中最能改變主觀感受的部分。Qwen-Audio-3.0-Realtime打破了傳統語音助手給人的機械感,能根據對話情境動態調整語氣、節奏、音調與情感。例如在辯論場景中,模型能精準抓住對方的論點之後快速組織反駁,且語氣強度維持得恰到好處。在情感陪伴這類應用中,模型則可透過語調變化與笑聲、嘆息、猶豫等副語言信號,展現出更具人性化的共情回應。在專門測試「AI說得是否像真人」的S2S語音指令遵循公開基準VStyle上,這款模型取得了當前最佳的成績。
為了讓對話更像真人互動,Qwen-Audio-3.0-Realtime也強化了雙工交互流暢度,意味著模型能夠邊說邊聽,具備像人類一樣隨時打斷與插話的能力,而非傳統一問一答的對講機模式。新模型內建「多模態感知的雙工控制」子模型,可以透過分析音頻信號、語義內容與說話人的聲紋特徵,判斷何時該接話、何時該保持沉默。在餐廳、開放的辦公區等背景雜訊較高的環境中,模型不會因為背景噪聲而被誤觸發;在多人同時說話的場合,它能鎖定主要對話對象,忽略旁聽者的交談;而當說話人切換時,模型也能依據語義線索自然過渡。
今年5月推出的Preview版本在對話流暢度指標上曾登頂Artificial Analysis,正是這套技術的實力展現。此外,API中還預留了audio_prompt字段,允許用戶上傳預先錄製的音頻樣本來鎖定特定聲紋,讓模型更加專注於某個特定的說話者。這些全面的能力提升,來自於模型底層採用的On-Policy Distillation(在線策略蒸餾)框架。研究團隊將文本大模型的完整推理能力透過即時互動的方式蒸餾給語音模型:語音模型一邊自己生成回答,同時由文本大模型從旁即時修正。
在此基礎上,研究團隊還導入了「多教師蒸餾策略」,根據不同面向的需求啟用多個教師模型各自把關:口語多輪偏好教師負責確保模型在口語化表達與指令遵循上不出錯,通用教師維持基礎問答與推理能力,Agentic教師專注於工具調用與複雜任務,而音頻理解教師則處理副語言與音頻語義的細膩辨識,確保四個升級主線都能均衡發展,不偏科。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。