雷峰網生成式AI

又快又聰明,阿里發佈 Qwen-Audio-3.0-Realtime:實時語音大模型四項功能升級

2026年7月15日 03:25

重點摘要

7月15日,阿里巴巴發佈實時語音交互對話模型Qwen-Audio-3.0-Realtime,在智商、Agent 工具調用、共情對話和雙工交互流暢度四條主線上同步升級,力求“又快又聰明”。模型包括推理更強的Plus 版本和速度更快的Flash 版本,適用於智能客服、教育培訓、娛樂互動與情感陪伴等場景。

站內 AI 整理稿

# 阿里发布Qwen-Audio-3.0-Realtime:实时语音大模型四大能力全面升级

7月15日,阿里巴巴正式推出实时语音交互对话模型 **Qwen-Audio-3.0-Realtime**,在智商(推理能力)、Agent工具调用、共情对话与双工交互流畅度四条主线上同步迭代,目标实现“又快又聪明”的语音AI体验。模型分为推理能力更强的 **Plus 版本**与响应速度更快的 **Flash 版本**,适配智能客服、教育培训、娱乐互动及情感陪伴等场景。此前,该模型的Preview版本(Fun-Realtime-Audiochat)已于今年5月在全球权威第三方评测平台 **Artificial Analysis** 斩获“语音推理能力”“对话流畅度”两项冠军,分别达到97.

6%,超越同期GPT-Realtime-2。此次正式版在Preview基础上做进一步工程优化与能力拓展。## 推理能力不减配:直出回复毫秒级响应,扛住口语随意性

传统实时语音模型为了压低时延,往往牺牲推理深度,导致“智商下降”。Qwen-Audio-3.0-Realtime 针对日常对话、简单问答等时延敏感场景,采用直接生成回复(无需外部重写或延迟验证)的架构,实现毫秒级响应,同时保持高水准理解力。在考验“AI会不会答”的语音问答基准 **VoiceBench** 上,测试团队分别使用书面化标准 prompt 和口语化 prompt 提问。Plus 版本得分分别为 **92.5** 与 **90.5**,仅下降 2.0 分,说明模型能够扛住真人说话时的随意性与省略。

面对更难的多轮音频对话挑战 **AudioMultiChallenge**,Flash 版本在标准和口语化 prompt 下得分分别为 **43.6** 与 **38.1**,下降仅 5.5 分,同样展现出稳健的口语适配能力。## Agent能力从被动到主动:无需指令即可调工具,结果能融入多轮记忆

文本大模型的Agent工具调用已相当成熟,但传统语音模型往往“能聊天不能办事”——用户必须明确说出“帮我打开XX”才能触发工具,且切回闲聊后上下文易断裂。Qwen-Audio-3.0-Realtime 改变了这一局面:模型能够边听边判断何时需要调用外部工具,即便用户未发出明确指令,也能主动推测并执行。 更重要的是,工具调用结果会自动融入对话记忆,一次检索的结果可以被后续多轮追问持续利用。例如用户先问“附近有什么川菜馆”,再追“评分4.5以上的哪家最近”,模型会自动衔接地图工具的上一次返回结果继续检索,无需重复调用。该能力基于 **FunctionCall** 标准协议,可无缝对接 MCP、外部 API 及企业知识库,为行业落地提供统一接口。 ## 共情对话告别机械感:动态调整语气与副语言信号

本版本最直接提升用户主观体验的部分是共情对话。Qwen-Audio-3.0-Realtime 摆脱了传统语音助手的僵硬机械感,能够根据对话语境动态调整语气、节奏、音调与情感色彩。在辩论类场景中,模型能准确抓取对方论点并快速组织反驳,同时保持恰如其分的语气强度;在情感陪伴中,则主动运用笑声、叹息、犹豫等副语言信号进行共情式回应,使交互更趋自然。 在专门评估“AI说话像不像人”的 **S2S 语音指令遵循公开基准 VStyle** 上,模型的共情与自然度指标取得 **SOTA(业内最佳)** 成绩,验证了其副语言建模的有效性。 ## 双工流畅度再进阶:边说边听能打断,复杂环境不误判

双工交互能力决定了语音模型能否像真人那样“边说边听”,随时允许用户打断、插话,而非一問一答的對講機模式。Qwen-Audio-3.0-Realtime 内置了 **多模态感知的双工控制子模型**,通过同步分析音频信号、语义内容与说话人声纹特征,智能判断交谈节奏。在餐厅、开放工区等嘈杂环境中,模型不会被背景噪声误打断;在多人讨论中能锁定主对话对象,忽略旁听者的闲谈;在多说话人切换场景下,则通过语义线索自然过渡。此外,API 预留了 **audio_prompt** 字段,用户可上传提前录制的音频样本锁定声纹,使模型聚焦特定说话人,提升隐私与专注度。

今年5月的Preview版本在对话流畅度指标上曾以97.6%登顶Artificial Analysis,正式版在此基础进一步优化。## 技术核心:On-Policy蒸馏框架与多教师协同

上述四大能力的提升源自模型所采用的 **On-Policy Distillation(在線策略蒸餾)** 框架。研究团队将文本大模型的完整推理能力“蒸馏”至语音模型——语音模型一边自行生成回答,一边由文本大模型实时纠正,确保推理深度不下滑。与此同时,引入 **多教师蒸馏策略**:**口語多輪偏好教師** 保障模型在口语化表达与指令遵循上的自然度;**通用教師** 负责基础问答与推理;**Agentic教師** 锁定工具调用与复杂业务逻辑;**音頻理解教師** 则专门处理副语言信号与音频语义信息。

四位教师各司其职,确保模型在智商、工具、共情与双工四条主线上“不偏科”,最终实现“又快又聪明”的实时交互体验。随着Qwen-Audio-3.0-Realtime正式发布,阿里在语音AI赛道上的产品矩阵更加完整。未来,该模型有望在更多要求低时延、高自然度与强工具协同的垂直场景中落地,推动人与机器的语音交互从“能听会说”向“会听懂做”迈出关键一步。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

37 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前