千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者
AI資訊AI新閒資訊正文千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者發布於AI新閒資訊時間 :Sep 23, 2026閱讀 :1分鐘阿里千問在9月23日把自家語音棧整體翻了個新。Qwen-Audio-3.1系列一口氣放出五款模型,從識別、合成到實時交互再到音頻創作與理解,湊齊了一套覆蓋"理解—生成—交互—創作"的完整音頻能力矩陣,順手還把全線價格狠狠往下拽了一把:TTS直降約70%,Realtime降幅約85%,ASR更是砍掉95%。這套組合拳的潛臺詞很直白——語音能力不再藏著掖著,直接把使用門檻砸到地板上。
識別這條線,Qwen-Audio-3.1-ASR成了新一代語音識別大模型。它最見功夫的是"聽得懂上下文",新增的原生轉寫潤色能自動剝掉語氣詞、刪掉重複表達、重組語義,讓吐出來的文字更順、更有邏輯,而不是一堆 raw 轉錄。分角色轉寫則把"誰在什麼時候說了什麼"完整還原,給會議、訪談和對話分析留下可追溯的結構化記錄。這套端到端方案把說話人標籤、時間戳和文本聯合輸出,既能處理輪流發言,也能留住短插話和重疊語音,把每個人說的話掰清楚。耳朵的覆蓋廣度也誇張:一套模型吃下30種語言和16種中文方言,行業詞、專業實體和分級熱詞都能識別,還會參考長音頻歷史上下文讓人名和術語保持一致。
延遲上首字響應壓到約160毫秒,邊說邊轉寫不卡頓。成績單同樣硬:公開方言數據集KeSpeech和WSYue的11個子集上平均字錯誤率4.55%,中文16種方言內部測試平均字錯誤率10.38%、溫州話這類難啃的方言提升尤其明顯,方言翻普通話的平均語義句準率衝到82.10%。更野的一步來自基於下代架構的Qwen-Audio-3.1-ASR-Next。它把識別對象從"語音裡的文字"擴成了"完整的音頻信息"——能聽懂人物情緒、環境聲和機械聲,完成聲音描述、事件定位和音頻問答推理。
給一段混著對話、背景音樂和環境聲的音頻,它不光輸出字幕,還能告訴你裡面有哪些聲音、相關事件何時發生,並回答關於整段內容的提問。分角色ASR測試裡,ASR-Flash-Next和ASR-Flash版本分別在八項指標裡拿下五項和三項最優,全面壓過此前的Fun-ASR級聯繫統。合成這邊,Qwen-Audio-3.1-TTS強調真實表達而非只求字音正確。它支持多語種與方言合成,同一音色跨語言時能自然遷移,讓你秒講數種語言,還能靠指令控制情緒、語速和表達方式,讓聲音貼合具體內容與場景。真正的驚喜是下代架構的Qwen-Audio-3.
1-TTS-Next,它把音頻創作從"單一人聲合成"升格成了"通用音頻生成系統"。過去做一段完整音頻,得主播、音效師、混音師、剪輯師分頭幹活再後期縫合;現在圍繞文本、時間戳和參考音頻,一個模型就能統一生成人聲、音效和環境音。它支持多人音色復刻與多輪對話,連續內容裡各角色音色不"變聲",還會演繹停頓、接話、附和和情緒轉折;多類聲音融合生成,呈現材質、遠近與空間層次——有聲書裡能同時處理旁白、兩角色對話,再補上城市低鳴、晚風和易拉罐碰撞聲,讓對話像真發生在故事場景裡。
更專業的是它吃自然語言控制,能指定語氣、語速、音量、音樂風格與配器,支持細粒度時間戳、聲音復刻和48kHz輸出,對白起止和聲音事件節奏都能精準排布,餵飽播客、有聲書、影視、遊戲和廣告的需求。實時交互這條線,Qwen-Audio-3.1-Realtime不再把識別、模型和合成簡單串糖葫蘆。它走全雙工,能同時說和聽,用戶隨時插話、打斷,體驗貼近真人通話。模型理解的不再只是文字,還有聲音背後的情緒與意圖——察覺你語氣低落,它不會機械回一句"我理解",而是放慢語速、調整措辭;對話裡切語言,上下文、語氣和節奏不斷檔;面對不確定信息少編、面對高風險內容守邊界。
它還基於多教師蒸餾架構在保持低延遲的同時提升推理與安全,並能在實時對話裡直接調用Agent工具,連API、知識庫和業務系統去查、去執行,把結果自然帶回對話。落地已經在路上。Qwen-Audio-3.1-Realtime正和Qoder、千問辦公等Agent,以及QwenNote、A2、Eva、千問AI眼鏡、樂奇AI眼鏡等硬件結合,讓用戶不必開電腦手機,直接動嘴發起任務、在對話裡追加條件或修改需求。
從ASR的潤色與方言、到ASR-Next的泛音頻理解、TTS的跨語言音色、TTS-Next的完整音頻創作、再到Realtime的擬人共情與工具調用,千問這五款模型沿著五條清晰技術路徑同時推進,把"能聽懂、能創作、能聊天"打包成語音這一連接人、內容與AI的自然入口,而九成五的ASR降價,則把這道入口的門檻幾乎拆到了地平線以下。相關推薦千問發佈 Qwen-Audio-3.1系列語音大模型,五款模型全線降價最高95%千問9月23日發佈Qwen-Audio-3.1系列語音大模型,形成覆蓋理解、生成、交互與創作的完整音頻能力棧,含ASR、ASR-Next、TTS、TTS-Next及Realtime。
API已上架千問AI平臺,ASR-Next即將上線。同步全線降價:TTS約70%、Realtime約85%、ASR達95%。ASR增強多語種、方言識別與上下文理解,新增原生轉寫潤色。Sep 23, 202682.3k千問發佈 Qwen3.8-LiveTranslate 同聲傳譯大模型:原文譯文同屏出,字均延遲壓到 2.3 秒阿里千問發佈同聲傳譯大模型Qwen3.8-LiveTranslate,基於Interleave架構重構,提升準確度、流暢度與簡潔度,字均延遲由2.8秒降至2.3秒,改善同傳聽感。模型已支持60種語言,並新增實時說話人分離等落地能力,補齊同傳實用拼圖。
Sep 20, 2026197.6k一個創意,一支AI團隊:千問創作Agent Teams上線,編劇導演美術全承包阿里千問創作8月31日上線Agent Teams,將AI視頻創作從寫提示詞升級為多智能體協作:用戶提創意,Agent主動拆解執行。功能同步登陸PC端與APP,支持多設備協同。模型上首發Wan3.0視頻生成模型,並上線更快更強的Wan3.0 Prime滿血版,彙集Qwen-Image-3.0等阿里模型,由Agent Teams按需調度。Aug 31, 2026284.9k阿里Qwen-Audio-3.
0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”阿里巴巴在千問AI平臺全面上線Qwen-Audio-3.0系列語音模型,涵蓋語音識別、語音合成和實時語音交互三款。官方稱,該系列在權威評測平臺Artificial Analysis今年7月語音排行榜中表現卓越,包攬語音識別、實時交互和語音合成三項第一。Aug 17, 2026280.0k阿里重磅開源2.4萬億參數大模型,多項性能比肩Fable 5阿里千問首次全面開源Max旗艦模型Qwen3.8-2.4T-A95B權重。該模型總參數2.4萬億,單Token激活950億,原生支持26萬Token上下文,可擴展至101萬;架構延續Qwen3.
5優勢,擅長編程、辦公、科研及長週期智能等任務。Aug 13, 2026226.7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

全新深藍 S07 正式官宣接入豆包大模型,9 月 28 日震撼上市
深藍汽車董事長鄧承浩於今日正式對外宣佈,全新深藍 S07將全面接入字節跳動旗下的豆包大模型,並同步搭載 AI 激光智駕系統,新車已定於9月28日正式推向市場。在談及智能座艙的發展演變時,鄧承浩指出,過去的汽車座艙競爭主要停留在“堆料”層面,用戶不得不去適應機器繁瑣的交互邏輯。

阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%
本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。

AI沒有失控,是硅谷在裝瘋
硅基降臨2026.09.23 16:08 · 來自海外全文3053字00:00 / 08:36造AI的專家,正在集體高喊:“AI將要殺死全人類。”文 | 硅基降臨過去幾個月,全球科技圈正在上演一場極度荒誕的奇觀。造AI的人,現在比誰都害怕AI。研究員不惜辭職爆料,高管公開預判人類滅絕概率,就連AI 本身,都能條理清晰講出毀滅人類的手段。億萬網民為人類命運惴惴不安,卻很少有人留意時間線。所有末日警報,精準踩在融資、上市、遊說政策的關鍵窗口。真正危險的,到底是AI,還是借末日敘事收割利益的資本?

Qwen新1號位首次亮相,劉大一恆能否頂住壓力?
字母AI2026.09.23 16:06 · 來自北京全文4820字00:00 / 13:15林俊暘之後,為何阿里選擇了劉大一恆?文 | 字母AI論國內AI圈誰的壓力最大,梁文鋒、楊植麟、姚順雨、唐傑都是榜上有名,不過從現在開始,劉大一恆身上所揹負的,恐怕也不小。3月4日,隨著林俊暘留下的一句“再見了,我摯愛的Qwen”,Qwen在這半年之間進入了一段沒有1號位的日子。

DeepSeek新論文公開Agent訓練!梁文鋒署名
DeepSeek發表新論文,公開了名為DSec的Agent訓練基礎設施細節,該系統每秒可產生5000多個沙盒,每天達300萬個,並採用多層級隔離與鏡像按需加載等技術。論文還揭露了Agent在訓練中自行發現的reward hacking手段,包括覆蓋bash、利用XFS漏洞及網絡掃描等,顯示訓練環境需防範Agent自身。該論文由梁文鋒署名,已於arXiv公開。
