阿里一口氣上新5款千問模型!價格最高降95%
作者 | 畢偉豪 編輯|李水青 9月23日報道,千問今日正式發佈Qwen-Audio-3.1系列語音大模型,一次性推出5款模型,對語音識別(ASR)、語音合成(TTS)和實時語音交互(Realtime)三大核心模型進行了升級,還發布了基於下一代架構的音頻理解模型ASR-Next與音頻創作模型TTS-Next。其中,新一代語音識別大模型Qwen-Audio-3.1-ASR 通過公開方言測試集KeSpeech和WSYue進行了測試,在11個子集其中的6個裡,相比Doubao-ASR和Tencent Hy-ASR-3.0-preview兩款開源模型成績更好,平均字錯誤率(CER)僅為4.55%。
▲公開方言測試成績(來源:千問大模型) 此外,Qwen-Audio全線語音模型價格下調,其中TTS降價約70%、Realtime降幅約85%、ASR降幅達95%。價格方面,Qwen-Audio-3.1-ASR-Flash輸入0.8元、輸出2.7元/百萬tokens;Qwen-Audio-3.1-TTS-Flash輸入1.5元、輸出12元/百萬tokens;Qwen-Audio-3.1-TTS-Next輸入6元、輸出12元/百萬tokens;Qwen-Audio-3.1-Realtime-Plus根據檔位不同,輸入5~40元、輸出40~150元/百萬tokens。▲Qwen-Audio-3.
1系列語音模型價格一覽表(製圖) 該系列中,大部分模型的API已上架千問AI平臺,其中ASR-Next的API還未上線。在9月22日開幕的2026雲棲大會上,阿里就已預告了這次發佈的幾款模型,首次登場的同聲傳譯模型Qwen3.8-LiveTranslate並不再此次發佈列表之中。除此之外,千問辦公今天還發布了兩款智能硬件,分別是首款Agent硬件QwenNote A2和桌面機器人Eva,Qwen-Audio-3.1-Realtime會逐步接入這些硬件。其中,QwenNote A2是一款磁吸在手機背面的AI助理設備,自帶4G網絡,能脫離手機獨立錄音轉寫、翻譯,支持AI對話、總結會議和撰寫方案。
桌面機器人Eva內置千問辦公,能夠與用戶進行實時語音交互,完成用戶下達的任務,並支持多端聯動。體驗地址: Qwen-Audio-3.1-ASR: https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash Qwen-Audio-3.1-TTS: https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash Qwen-Audio-3.1-TTS-Next: https://www.qianwenai.com/models/qwen-audio-3.
1-tts-next Qwen-Audio-3.1-Realtime: https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus 一、三大核心模型升級:16種方言、跨語言合成、全雙工 Qwen-Audio-3.1-ASR具備結構化、聽得廣、聽得準、聽得快、聽得清五項核心能力。其中,Qwen-Audio-3.1-ASR採用端到端方案,把說話人標籤、時間戳和文本聯合輸出,既能處理輪流發言,也能保留短插話和重疊語音,可以為會議、訪談和對話分析提供可追溯的結構化記錄。語言覆蓋面上,一套模型支持30種語言和16種中文方言。
詞彙覆蓋率方面,該模型支持行業詞、專業實體和分級熱詞識別,能參考長音頻歷史上下文,保持人名、縮寫和術語一致。延遲方面,該模型在低延遲流式識別下,首字響應約160毫秒。同時,Qwen-Audio-3.1-ASR在轉寫完成後自帶潤色功能,可以自動去除語氣詞與重複表達並僅需語義重組,能夠自動區分不同說話人,實現長音頻角色一致、時間對齊與結構化輸出。除公開測試外,在阿里內部自建的中文方言測試集評測ASR中,Qwen-Audio-3.1-ASR在對16種中文方言的原文轉寫測試中,平均CER為10.38%,溫州話和蘇州話識別能力斷層領先。
▲阿里內部自建中文方言測試集評測ASR成績(來源:千問大模型) 內部自建的中文方言測試集評測AST,用於評測將方言語音翻譯為普通話、準確保留原意的能力,Qwen-Audio-3.1-ASR在11個方言子集中的10個上表現最優,平均語義句準率達到82.10%。▲阿里內部自建中文方言測試集評測AST成績(來源:千問大模型) Qwen-Audio-3.1-TTS升級重點是跨語言音色合成能力,同一個音色能跨語種自然遷移,官方演示中,Qwen-Audio-3.1-TTS能夠用一種音色分別說出普通話、廣東話、河南話、英語和日語。
此外,模型合成語音的情緒、語速和表達方式可以通過指令控制,同一句話可以表現出開心、傷心等不同狀態,更強調真實表達,使聲音貼近具體內容與使用場景。實時語音交互模型Qwen-Audio-3.1-Realtime進一步強化了對情緒、交流意圖和上下文的理解,同時支持多語言實時切換、工具調用,並強化了安全與事實可靠性。在實際多人對話場景中,全雙工實時交互讓Qwen-Audio-3.1-Realtime能夠根據對話進程適時等待、插入和回應,面對多人連續交流,可以結合上下文判斷何時應該參與對話、何時繼續等待。Qwen-Audio-3.
1-Realtime可以根據用戶的語氣和情緒調整回應方式,在對話中切換語言後繼續保持上下文和交流節奏。當用戶提出查詢、搜索等需求時,Qwen-Audio-3.1-Realtime還能調用API、知識庫等外部工具完成任務,再將結果帶回對話。據發佈的技術報告,Qwen-Audio-3.1-Realtime在τ-Voice半雙工語音轉文字適配版上的整體任務成功率從78.4%提升至82.0%;在Full-Duplex-Bench v1.5上,對背景語音的響應率從73.0%降至13.0%,意味著模型更少受到無關背景語音的干擾。▲Qwen-Audio-3.
1-Realtime技術報告(來源:arXiv) 此外,Qwen-Audio-3.1-Realtime正在與Qoder、千問辦公等Agent,以及QwenNote、A2、Eva、千問AI眼鏡、樂奇AI眼鏡等智能硬件結合。官方稱,在這些場景下,用戶不必始終打開電腦或手機,可以直接通過語音發起任務,並在實時對話中繼續添加條件、修改需求或瞭解執行情況。二、兩款Next新模型:一個拓寬音頻理解,一個打通音頻創作 本次阿里還發布了兩款音頻方向的新模型Qwen-Audio-3.1-ASR-Next和Qwen-Audio-3.1-TTS-Next,分別用於補充ASR和TTS在語音之外的音頻理解空缺。
Qwen-Audio-3.1-ASR-Next把聲音處理範圍從語音中的文字擴展到完整音頻信息,能理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位、音頻問答與推理。官方舉例,面對一段同時包含人物對話、背景音樂和環境聲的音頻,模型會輸出對話文本,還會描述裡面有哪些聲音、相關事件在何時發生,並回答與整段內容有關的問題。在分角色ASR的評測中,Qwen-Audio-3.1-ASR-Flash-Next與Qwen-Audio-3.1-ASR-Flash版本分別拿下五項和三項最優結果,均優於此前的Fun-ASR級聯繫統。Qwen-Audio-3.1-TTS-Next則將能力從語音合成拓展到音頻創作。
基於文本、時間戳和參考音頻等輸入,模型可以統一生成人聲、音效和環境音,組合成完整的音頻內容。在多輪生成中,模型能夠保持不同角色的音色一致,並呈現停頓、接話、情緒轉折等自然表達。同時Qwen-Audio-3.1-TTS-Next支持細粒度時間戳控制、聲音復刻和48kHz輸出,可以對對話、音效和內容節奏進行更精細的編排,覆蓋播客、有聲書、影視、遊戲、廣告等場景。結語:能力拓展、價格下探,軟硬件提供流量入口 Qwen-Audio-3.1系列語音模型在語音識別、語音合成和實時交互能力等方面持續優化,價格也進一步下探。與此同時,ASR-Next、TTS-Next也將能力覆蓋範圍向音頻理解和音頻創作延伸。
阿里方面將語音定位為連接人、內容與AI的自然入口。接下來,AI眼鏡、桌面機器人等新終端的普及,也將帶來更多語音調用需求。
Related
相關文章

千問創作上線 7 天會員:200 積分 + 快速通道,瞄準旅行出片等即時創作
用戶購買後,可獲得 200 積分、專享快速生成通道,以及新模型與新功能的優先體驗權益。短週期降低嚐鮮門檻相較於包月訂閱,7 天會員以更短的使用週期,明顯降低了用戶的嘗試與決策門檻。對那些只想在一段旅行、一場活動或一輪社媒運營中集中用 AI 出圖、寫文案的用戶來說,不必為長期訂閱買單,也能解鎖快速生成與搶先體驗等核心權益。

千問APP支持中國移動算力套餐,用戶可在工作助理中啟用
已訂閱中國移動該服務的用戶,可在千問APP或PC端的「工作助理」中,使用中國移動賬戶中的Token額度完成複雜工作任務,相關Token將從本人對應賬戶中扣除。同時,雙方還推出了“千問X中國移動聯名版”,用戶辦理指定套餐,即可獲得千問會員權益。

從端側推理到物理AI,芯片行業正面臨新考題
Leo張ToB雜談2026.09.28 10:54 · 來自北京全文4241字00:00 / 12:35物理AI的時代,比拼的將是誰的落地更穩。過去兩年,幾乎所有關於AI的討論都圍繞一個詞展開:規模。更大的模型、更多的參數、更貴的訓練集群。

Muse 登頂、Meta 股價漲 11%,國內大模型卻擠在辦公內卷裡
ICT解讀者一老解2026.09.28 10:33 · 來自北京全文3748字00:00 / 10:50當所有玩家擠在辦公賽道內卷時,C 端場景仍有值得挖的空間。文 | ICT解讀者—老解9月8日,Meta 推出個人 AI 智能體 Muse。上線約 5 天,美國下載量突破73 萬次;上週五(9月18日)它把 ChatGPT 拉下馬,登頂美國 iOS 免費應用榜,並一直佔著第一。受此帶動,Meta 股價週一大漲超過11%,引領美股算力板塊集體走強。

Claude Sonnet 5.5 配置標識符現身並開啟灰度測試,性能直逼 GPT-6 Astra
從多位內測用戶的實測數據來看,Sonnet5.5的綜合表現極為驚豔。在純前端 UI 動畫生成及日常編碼測試中,它展現出了超強的代碼直覺和自然的人機互動質感,其實測表現不僅全面超越了 OpenAI 近期發佈的 GPT-6Sol,甚至在部分高級編碼與智能體能力上直逼 OpenAI 的旗艦大杯 GPT-6Astra。

自信心暴漲但正確率暴跌?最新研究揭示AI輔助下的人類決策悖論
研究團隊專門挑選了極易引發模型幻覺的精細冷門問題進行測試,結果顯示,在無AI輔助的對照組中,參與者對36%至44%的問題選擇放棄作答;而在獲取AI建議後,這一不作答比例驟降至3%至6%。更為矛盾的是,在AI輔助下,參與者的答題自信心從29.