阿里千問發佈 Qwen-Audio-3.1 系列語音大模型,並下調全線產品價格

作者:遠洋 責編:遠洋 評論: 感謝網友 Domado、衝吧lzl 的線索投遞!9 月 23 日消息,今天,千問正式發佈 Qwen-Audio-3.1 系列語音大模型。本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型進行了全面進化,更重磅推出了全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 和音頻理解模型 Qwen-Audio-3.1-ASR-Next。官方稱,五款全新的語音模型同時推出,形成了一套覆蓋“理解-生成-交互-創作”的完整音頻能力棧。
為進一步降低用戶使用成本,Qwen-Audio 全線語音模型價格均下調,其中 TTS 降價約 70%,Realtime 降幅約 85%,ASR 降幅達 95%。附官方詳細介紹如下:Qwen-Audio-3.1-ASR:更強的上下文理解和潤色Qwen-Audio-3.1-ASR 是新一代語音識別大模型,進一步增強多語種、方言識別與上下文理解能力,並新增原生轉寫潤色能力,可自動去除語氣詞與重複表達並重組語義,讓轉寫的文字更順暢、更有邏輯。此外,全新方案的分角色轉寫,完整呈現“誰在什麼時候說了什麼”,為會議、訪談和對話分析提供可追溯的結構化記錄。
核心能力亮點: 結構化:端到端方案,把說話人標籤、時間戳和文本聯合輸出。模型既能處理輪流發言,也能保留短插話和重疊語音,把每個人說的話轉寫清楚。聽得廣:一套模型支持 30 種語言和 16 種中文方言,覆蓋多語言交流、方言對話等複雜語音場景。聽得準:支持行業詞、專業實體和分級熱詞識別,並能參考長音頻歷史上下文,讓人名、縮寫和專業術語保持一致。聽得快:支持低延遲流式識別,邊說邊轉寫,實時輸出準確文字,首字響應約 160 毫秒。聽得清:原生完成去語氣詞、去重複、自我糾正和語義重組;自動區分不同說話人,實現長音頻角色一致、時間對齊與結構化輸出。
性能表現開源方言 ASR / AST:通過 KeSpeech 和 WSYue 的 11 個子集,評測模型在公開數據上的方言轉寫與翻譯能力。Qwen-Audio-3.1-ASR 平均 CER 為 4.55%,並在 6 個子集上取得最優結果。中文方言內部自建測試集 ASR:評測模型對 16 種中文方言的原文轉寫能力,以字錯誤率(CER)衡量。Qwen-Audio-3.1-ASR 在 11 個方言子集上取得最優結果,平均 CER 為 10.38%,其中溫州話等較難方言的提升尤為明顯。中文方言內部自建測試集 AST:評測模型將方言語音翻譯為普通話、準確保留原意的能力,以語義句準率衡量。
Qwen-Audio-3.1-ASR 在 11 個方言子集中的 10 個上表現最優,平均語義句準率達到 82.10%。Qwen-Audio-3.1-ASR-Next:更好地理解人物情緒與場景基於下代架構的音頻理解模型 Qwen-Audio-3.1-ASR-Next 全新發布,它能夠理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位、音頻問答與推理。例如,面對一段同時包含人物對話、背景音樂和環境聲的音頻,模型不僅可以輸出對話文本,還可以進一步描述音頻中包含哪些聲音、相關事件在何時發生,並回答與整段內容有關的問題。由此,ASR 處理的對象開始從“語音中的文字”擴展為“完整的音頻信息”。
性能表現分角色 ASR:評測多人語音中“誰在什麼時候說了什麼”的識別能力,同時考察說話人區分和轉寫準確性。在四個測試集的八項指標中,Qwen-Audio-3.1-ASR-Flash-Next 和 Qwen-Audio-3.1-ASR-Flash 版本分別取得五項和三項最優結果,均全面優於此前的 Fun-ASR 級聯繫統。Qwen-Audio-3.1-TTS:更自然的跨語言音色合成Qwen-Audio-3.1-TTS 是新一代語音合成大模型,支持多語種及方言合成,支持模型在同一音色跨語言合成時的自然遷移,讓你秒講數種語言。
相比只關注字音正確的傳統方式,它更強調真實表達:通過指令控制情緒、語速和表達方式,讓聲音貼近具體內容與使用場景。Qwen-Audio-3.1-TTS-Next:更高效的音頻創作方式基於下代架構的音頻創作模型 Qwen-Audio-3.1-TTS-Next 全新發布。過去,製作一段完整音頻通常需要主播、音效師、混音師和剪輯師分工合作,分別製作人物對白、音效和背景聲,再進行後期剪輯與合成。它不再侷限於單一語音合成,而是圍繞文本、時間戳和參考音頻等輸入,統一生成人聲、音效和環境音,創作完整的音頻內容。
核心能力亮點: 一個模型統一生成多類音頻:支持生成包含語音及完整環境聲場的音頻,如一段播客可以同時包含多位說話人的對話與背景音效,一段影視或遊戲音頻可以包含臺詞、環境聲、動作音和配樂。保持多角色音色與情緒一致:支持多人音色復刻與多輪對話生成,在連續內容中保持各角色音色特徵,並按腳本演繹情緒與節奏,避免多輪生成中角色“變聲”,呈現停頓、接話、附和、情緒轉折等自然表達。融合人聲、音效與環境聲:多類聲音融合生成,並呈現聲音材質、遠近變化與空間層次。例如有聲書場景中,模型可以同時處理旁白、兩位角色的對話,也能生成城市低鳴、晚風和易拉罐碰撞聲等音效與環境聲,讓對話聽起來就發生在故事場景裡。
使用自然語言控制生成過程:通過自然語言指定說話人的語氣、語速和音量,描述音樂風格、配器方式以及聲音事件的先後順序。模型還支持細粒度時間戳控制、聲音復刻和 48kHz 輸出,可對對白起止、聲音事件和內容節奏做更具體的安排,滿足播客、有聲書、影視劇、遊戲、廣告等專業音頻創作需求。Qwen-Audio-3.1-Realtime:更自然的實時互動體驗實時語音交互,並不是把語音識別、語言模型和語音合成簡單串起來。人與人的交流中,說與聽常常同時發生:用戶可能沒說完就補充,也可能在對方回覆時插話;同一句話,隨情緒、關係和語氣不同,含義也不同。全新升級的 Qwen-Audio-3.
1-Realtime 聽得更懂,更會接話,更會共情,甚至可以主動調用 Agent 工具完成任務。全雙工實時交互告別了過去模型只能聽或只能說的現狀,可以做到同時說和聽,讓用戶可以隨時插話、打斷,交流體驗更接近真人通話。核心能力亮點:從識別文字,到理解情緒與交流意圖:模型理解的不僅是語音中的文字,還有聲音背後的情緒與意圖。識別到用戶語氣低落時,它不會機械地回一句“我理解你的感受”,而是放慢語速、調整措辭;面對緊張、開心、失落或猶豫,也能結合上下文選擇合適的表達。角色扮演場景中,角色設定不只留在 Prompt 裡,也體現在連續的聲音表達中。
支持多語言實時交流與自然切換:對話中切換語言時,模型繼續保持此前的上下文、語氣和交流節奏,跨語言對話不必因語言變化而重新開始。強化安全邊界與事實可靠性:面對不確定信息,減少缺乏事實依據的回答;面對敏感或高風險內容,更準確地識別邊界並給出安全回應。它關注的不僅是“能不能回答”,還有何時該謹慎、何時不該給出未經確認的結論。在實時對話中調用工具:當需求涉及外部信息或業務系統時,模型可在對話中調用工具,連接 API、知識庫和業務系統完成搜索、查詢或任務執行,並把結果自然帶回對話。
基於多教師蒸餾架構,模型在保持低延遲的同時,提升了理解、推理、表達與安全能力,所解決的問題也從“如何實時回答用戶”擴展為“如何在持續對話中理解變化的需求並完成任務”。Qwen-Audio 進入 Agent 與智能硬件Qwen-Audio-3.1-Realtime 正在與 Qoder、千問辦公等 Agent,以及 QwenNote、A2、Eva、千問 AI 眼鏡、樂奇 AI 眼鏡等智能硬件結合。在這些硬件場景中,用戶不必始終打開電腦或手機,可以直接通過語音發起任務,並在實時對話中繼續新增條件、修改需求或瞭解執行情況。總結Qwen-Audio 3.
1 系列的升級,並不是對單一語音指標的局部優化,而是沿著五條明確的技術路徑繼續向前:Qwen-Audio-3.1-ASR新增了語音轉寫在多語種、方言識別與上下文理解能力,還支持原生轉寫潤色能力。Qwen-Audio-3.1-ASR-Next將音頻理解進一步擴展至泛音頻理解,更好地理解人物情緒、環境聲、機械聲這些聲音元素。Qwen-Audio-3.1-TTS讓同一聲色在跨語言合成時依然能保持自然感,讓你秒講數種語言。Qwen-Audio-3.1-TTS-Next從單一的人聲合成擴展為通用音頻生成系統,一次生成人聲、音效與環境音共同構成的完整音頻內容。Qwen-Audio-3.
1-Realtime聽得更懂,更會接話,更會共情,有更接近真人通話的交流體驗,還能主動調用 Agent 工具完成任務。能聽懂、能創作、能聊天,Qwen-Audio 3.1 正在讓語音成為連接人、內容與 AI 的自然入口。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:千問,語音大模型,QwenAudio3.
1阿里千問辦公首款桌面機器人 QwenNote Eva 發佈:集辦公助理、情緒陪伴、桌面充電於一體,售價 899 元阿里千問辦公發佈企業上下文、數字員工及 Agent 硬件 QwenNote A2阿里千問平板 QwenBook 演示真機首秀:搭載小背屏,鍵盤有千問專屬鍵曝阿里試水千問平板 QwenBook:定位原生智能體電腦,主打辦公、打通 WPS千問 AI 眼鏡 N1 系列亮相阿里雲棲大會:支持眼動追蹤與虹膜支付,10 月 13 日發售阿里 Qwen4 和下代視頻模型訓練中,Qwen4.5 後模型將擴展至 5-10T 參數
Related
相關文章

斑馬智能發佈端模型AutoOmni2.0,讓元神AI更懂“我的世界”
斑馬智能在雲棲大會發表新一代全模態端側大模型AutoOmni 2.0,任務處理能力堪比10倍參數量的雲模型,並推出AutoClaw 2.0智艙協作實車方案。元神AI強調理解用戶的「表世界」與「裡世界」,透過「三個連通」朝Personal AI演進,已覆蓋主流車企68%的服務。AutoOmni與10家晶片廠合作,實現低延遲、隱私保護及高效能推理,並展示免喚醒與主動智能等場景,未來將從單體智能擴展至群體智能。

科大訊飛發佈全新語音識別大模型 Spark-ASR-2.0,明日上線訊飛輸入法
作者:遠洋 責編:遠洋 評論: 9 月 23 日消息,今日,科大訊飛正式發佈最新一代語音識別大模型 Spark-ASR-2.0。據官方介紹,Spark-ASR-2.0 通過非自迴歸與 LLM 增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,整體的語音識別效果大幅提升,尤其在通用識別(中英文混合、方言、專業術語)、複雜聲學場景識別(高噪、小音量、快語速、兒童)、上下文識別和文本流暢規範性等方面改善明顯。

別急著找“中國版Muse”,先看看股價的臉色
來咖智庫2026.09.23 16:33 · 來自重慶全文1557字00:00 / 04:25Muse火不火,是真問題;“中國版Muse”炒不炒,是假問題。文 | 來咖智庫9月8日,Meta上線個人AI智能體Muse。上線5天,下載量突破73萬次;13天累計超250萬次,登頂美國蘋果應用商店免費榜,把ChatGPT、Claude、Grok統統壓在身下。Apptopia的數據更狠:Muse美國移動端日活已達64.2萬,是ChatGPT上線同期23.1萬的近三倍。

適用榮耀、小米、階躍手機,網信部門發佈 3 款提供手機端側生成式 AI 服務已備案信息
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 榮耀 YOYO Claw、小米 miclaw、階躍終端 AI 三款手機端側生成式 AI 服務通過網信部門備案 2026/9/23 16:33:24 作者:清源 責編:清源 評論: 感謝網友 Autumn_Dream、xxy171070、補藥吖 的線索投遞!

全新深藍 S07 正式官宣接入豆包大模型,9 月 28 日震撼上市
深藍汽車董事長鄧承浩於今日正式對外宣佈,全新深藍 S07將全面接入字節跳動旗下的豆包大模型,並同步搭載 AI 激光智駕系統,新車已定於9月28日正式推向市場。在談及智能座艙的發展演變時,鄧承浩指出,過去的汽車座艙競爭主要停留在“堆料”層面,用戶不得不去適應機器繁瑣的交互邏輯。

阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%
本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。