阿里千問發佈 Qwen-Audio-3.1 系列語音大模型,並下調全線產品價格

作者:遠洋 責編:遠洋 評論: 感謝網友 Domado、衝吧lzl 的線索投遞!9 月 23 日消息,今天,千問正式發佈 Qwen-Audio-3.1 系列語音大模型。本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型進行了全面進化,更重磅推出了全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 和音頻理解模型 Qwen-Audio-3.1-ASR-Next。官方稱,五款全新的語音模型同時推出,形成了一套覆蓋“理解-生成-交互-創作”的完整音頻能力棧。
為進一步降低用戶使用成本,Qwen-Audio 全線語音模型價格均下調,其中 TTS 降價約 70%,Realtime 降幅約 85%,ASR 降幅達 95%。附官方詳細介紹如下:Qwen-Audio-3.1-ASR:更強的上下文理解和潤色Qwen-Audio-3.1-ASR 是新一代語音識別大模型,進一步增強多語種、方言識別與上下文理解能力,並新增原生轉寫潤色能力,可自動去除語氣詞與重複表達並重組語義,讓轉寫的文字更順暢、更有邏輯。此外,全新方案的分角色轉寫,完整呈現“誰在什麼時候說了什麼”,為會議、訪談和對話分析提供可追溯的結構化記錄。
核心能力亮點: 結構化:端到端方案,把說話人標籤、時間戳和文本聯合輸出。模型既能處理輪流發言,也能保留短插話和重疊語音,把每個人說的話轉寫清楚。聽得廣:一套模型支持 30 種語言和 16 種中文方言,覆蓋多語言交流、方言對話等複雜語音場景。聽得準:支持行業詞、專業實體和分級熱詞識別,並能參考長音頻歷史上下文,讓人名、縮寫和專業術語保持一致。聽得快:支持低延遲流式識別,邊說邊轉寫,實時輸出準確文字,首字響應約 160 毫秒。聽得清:原生完成去語氣詞、去重複、自我糾正和語義重組;自動區分不同說話人,實現長音頻角色一致、時間對齊與結構化輸出。
性能表現開源方言 ASR / AST:通過 KeSpeech 和 WSYue 的 11 個子集,評測模型在公開數據上的方言轉寫與翻譯能力。Qwen-Audio-3.1-ASR 平均 CER 為 4.55%,並在 6 個子集上取得最優結果。中文方言內部自建測試集 ASR:評測模型對 16 種中文方言的原文轉寫能力,以字錯誤率(CER)衡量。Qwen-Audio-3.1-ASR 在 11 個方言子集上取得最優結果,平均 CER 為 10.38%,其中溫州話等較難方言的提升尤為明顯。中文方言內部自建測試集 AST:評測模型將方言語音翻譯為普通話、準確保留原意的能力,以語義句準率衡量。
Qwen-Audio-3.1-ASR 在 11 個方言子集中的 10 個上表現最優,平均語義句準率達到 82.10%。Qwen-Audio-3.1-ASR-Next:更好地理解人物情緒與場景基於下代架構的音頻理解模型 Qwen-Audio-3.1-ASR-Next 全新發布,它能夠理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位、音頻問答與推理。例如,面對一段同時包含人物對話、背景音樂和環境聲的音頻,模型不僅可以輸出對話文本,還可以進一步描述音頻中包含哪些聲音、相關事件在何時發生,並回答與整段內容有關的問題。由此,ASR 處理的對象開始從“語音中的文字”擴展為“完整的音頻信息”。
性能表現分角色 ASR:評測多人語音中“誰在什麼時候說了什麼”的識別能力,同時考察說話人區分和轉寫準確性。在四個測試集的八項指標中,Qwen-Audio-3.1-ASR-Flash-Next 和 Qwen-Audio-3.1-ASR-Flash 版本分別取得五項和三項最優結果,均全面優於此前的 Fun-ASR 級聯繫統。Qwen-Audio-3.1-TTS:更自然的跨語言音色合成Qwen-Audio-3.1-TTS 是新一代語音合成大模型,支持多語種及方言合成,支持模型在同一音色跨語言合成時的自然遷移,讓你秒講數種語言。
相比只關注字音正確的傳統方式,它更強調真實表達:通過指令控制情緒、語速和表達方式,讓聲音貼近具體內容與使用場景。Qwen-Audio-3.1-TTS-Next:更高效的音頻創作方式基於下代架構的音頻創作模型 Qwen-Audio-3.1-TTS-Next 全新發布。過去,製作一段完整音頻通常需要主播、音效師、混音師和剪輯師分工合作,分別製作人物對白、音效和背景聲,再進行後期剪輯與合成。它不再侷限於單一語音合成,而是圍繞文本、時間戳和參考音頻等輸入,統一生成人聲、音效和環境音,創作完整的音頻內容。
核心能力亮點: 一個模型統一生成多類音頻:支持生成包含語音及完整環境聲場的音頻,如一段播客可以同時包含多位說話人的對話與背景音效,一段影視或遊戲音頻可以包含臺詞、環境聲、動作音和配樂。保持多角色音色與情緒一致:支持多人音色復刻與多輪對話生成,在連續內容中保持各角色音色特徵,並按腳本演繹情緒與節奏,避免多輪生成中角色“變聲”,呈現停頓、接話、附和、情緒轉折等自然表達。融合人聲、音效與環境聲:多類聲音融合生成,並呈現聲音材質、遠近變化與空間層次。例如有聲書場景中,模型可以同時處理旁白、兩位角色的對話,也能生成城市低鳴、晚風和易拉罐碰撞聲等音效與環境聲,讓對話聽起來就發生在故事場景裡。
使用自然語言控制生成過程:通過自然語言指定說話人的語氣、語速和音量,描述音樂風格、配器方式以及聲音事件的先後順序。模型還支持細粒度時間戳控制、聲音復刻和 48kHz 輸出,可對對白起止、聲音事件和內容節奏做更具體的安排,滿足播客、有聲書、影視劇、遊戲、廣告等專業音頻創作需求。Qwen-Audio-3.1-Realtime:更自然的實時互動體驗實時語音交互,並不是把語音識別、語言模型和語音合成簡單串起來。人與人的交流中,說與聽常常同時發生:用戶可能沒說完就補充,也可能在對方回覆時插話;同一句話,隨情緒、關係和語氣不同,含義也不同。全新升級的 Qwen-Audio-3.
1-Realtime 聽得更懂,更會接話,更會共情,甚至可以主動調用 Agent 工具完成任務。全雙工實時交互告別了過去模型只能聽或只能說的現狀,可以做到同時說和聽,讓用戶可以隨時插話、打斷,交流體驗更接近真人通話。核心能力亮點:從識別文字,到理解情緒與交流意圖:模型理解的不僅是語音中的文字,還有聲音背後的情緒與意圖。識別到用戶語氣低落時,它不會機械地回一句“我理解你的感受”,而是放慢語速、調整措辭;面對緊張、開心、失落或猶豫,也能結合上下文選擇合適的表達。角色扮演場景中,角色設定不只留在 Prompt 裡,也體現在連續的聲音表達中。
支持多語言實時交流與自然切換:對話中切換語言時,模型繼續保持此前的上下文、語氣和交流節奏,跨語言對話不必因語言變化而重新開始。強化安全邊界與事實可靠性:面對不確定信息,減少缺乏事實依據的回答;面對敏感或高風險內容,更準確地識別邊界並給出安全回應。它關注的不僅是“能不能回答”,還有何時該謹慎、何時不該給出未經確認的結論。在實時對話中調用工具:當需求涉及外部信息或業務系統時,模型可在對話中調用工具,連接 API、知識庫和業務系統完成搜索、查詢或任務執行,並把結果自然帶回對話。
基於多教師蒸餾架構,模型在保持低延遲的同時,提升了理解、推理、表達與安全能力,所解決的問題也從“如何實時回答用戶”擴展為“如何在持續對話中理解變化的需求並完成任務”。Qwen-Audio 進入 Agent 與智能硬件Qwen-Audio-3.1-Realtime 正在與 Qoder、千問辦公等 Agent,以及 QwenNote、A2、Eva、千問 AI 眼鏡、樂奇 AI 眼鏡等智能硬件結合。在這些硬件場景中,用戶不必始終打開電腦或手機,可以直接通過語音發起任務,並在實時對話中繼續新增條件、修改需求或瞭解執行情況。總結Qwen-Audio 3.
1 系列的升級,並不是對單一語音指標的局部優化,而是沿著五條明確的技術路徑繼續向前:Qwen-Audio-3.1-ASR新增了語音轉寫在多語種、方言識別與上下文理解能力,還支持原生轉寫潤色能力。Qwen-Audio-3.1-ASR-Next將音頻理解進一步擴展至泛音頻理解,更好地理解人物情緒、環境聲、機械聲這些聲音元素。Qwen-Audio-3.1-TTS讓同一聲色在跨語言合成時依然能保持自然感,讓你秒講數種語言。Qwen-Audio-3.1-TTS-Next從單一的人聲合成擴展為通用音頻生成系統,一次生成人聲、音效與環境音共同構成的完整音頻內容。Qwen-Audio-3.
1-Realtime聽得更懂,更會接話,更會共情,有更接近真人通話的交流體驗,還能主動調用 Agent 工具完成任務。能聽懂、能創作、能聊天,Qwen-Audio 3.1 正在讓語音成為連接人、內容與 AI 的自然入口。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:千問,語音大模型,QwenAudio3.
1阿里千問辦公首款桌面機器人 QwenNote Eva 發佈:集辦公助理、情緒陪伴、桌面充電於一體,售價 899 元阿里千問辦公發佈企業上下文、數字員工及 Agent 硬件 QwenNote A2阿里千問平板 QwenBook 演示真機首秀:搭載小背屏,鍵盤有千問專屬鍵曝阿里試水千問平板 QwenBook:定位原生智能體電腦,主打辦公、打通 WPS千問 AI 眼鏡 N1 系列亮相阿里雲棲大會:支持眼動追蹤與虹膜支付,10 月 13 日發售阿里 Qwen4 和下代視頻模型訓練中,Qwen4.5 後模型將擴展至 5-10T 參數
Related
相關文章

全新深藍 S07 正式官宣接入豆包大模型,9 月 28 日震撼上市
深藍汽車董事長鄧承浩於今日正式對外宣佈,全新深藍 S07將全面接入字節跳動旗下的豆包大模型,並同步搭載 AI 激光智駕系統,新車已定於9月28日正式推向市場。在談及智能座艙的發展演變時,鄧承浩指出,過去的汽車座艙競爭主要停留在“堆料”層面,用戶不得不去適應機器繁瑣的交互邏輯。

阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%
本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。

AI沒有失控,是硅谷在裝瘋
硅基降臨2026.09.23 16:08 · 來自海外全文3053字00:00 / 08:36造AI的專家,正在集體高喊:“AI將要殺死全人類。”文 | 硅基降臨過去幾個月,全球科技圈正在上演一場極度荒誕的奇觀。造AI的人,現在比誰都害怕AI。研究員不惜辭職爆料,高管公開預判人類滅絕概率,就連AI 本身,都能條理清晰講出毀滅人類的手段。億萬網民為人類命運惴惴不安,卻很少有人留意時間線。所有末日警報,精準踩在融資、上市、遊說政策的關鍵窗口。真正危險的,到底是AI,還是借末日敘事收割利益的資本?

Qwen新1號位首次亮相,劉大一恆能否頂住壓力?
字母AI2026.09.23 16:06 · 來自北京全文4820字00:00 / 13:15林俊暘之後,為何阿里選擇了劉大一恆?文 | 字母AI論國內AI圈誰的壓力最大,梁文鋒、楊植麟、姚順雨、唐傑都是榜上有名,不過從現在開始,劉大一恆身上所揹負的,恐怕也不小。3月4日,隨著林俊暘留下的一句“再見了,我摯愛的Qwen”,Qwen在這半年之間進入了一段沒有1號位的日子。

DeepSeek新論文公開Agent訓練!梁文鋒署名
DeepSeek發表新論文,公開了名為DSec的Agent訓練基礎設施細節,該系統每秒可產生5000多個沙盒,每天達300萬個,並採用多層級隔離與鏡像按需加載等技術。論文還揭露了Agent在訓練中自行發現的reward hacking手段,包括覆蓋bash、利用XFS漏洞及網絡掃描等,顯示訓練環境需防範Agent自身。該論文由梁文鋒署名,已於arXiv公開。
