千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者

2026年9月23日 08:004700 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者發布於AI新閒資訊時間 :Sep 23, 2026閱讀 :1分鐘阿里千問在9月23日把自家語音棧整體翻了個新。Qwen-Audio-3.1系列一口氣放出五款模型,從識別、合成到實時交互再到音頻創作與理解,湊齊了一套覆蓋"理解—生成—交互—創作"的完整音頻能力矩陣,順手還把全線價格狠狠往下拽了一把:TTS直降約70%,Realtime降幅約85%,ASR更是砍掉95%。這套組合拳的潛臺詞很直白——語音能力不再藏著掖著,直接把使用門檻砸到地板上。

識別這條線,Qwen-Audio-3.1-ASR成了新一代語音識別大模型。它最見功夫的是"聽得懂上下文",新增的原生轉寫潤色能自動剝掉語氣詞、刪掉重複表達、重組語義,讓吐出來的文字更順、更有邏輯,而不是一堆 raw 轉錄。分角色轉寫則把"誰在什麼時候說了什麼"完整還原,給會議、訪談和對話分析留下可追溯的結構化記錄。這套端到端方案把說話人標籤、時間戳和文本聯合輸出,既能處理輪流發言,也能留住短插話和重疊語音,把每個人說的話掰清楚。耳朵的覆蓋廣度也誇張:一套模型吃下30種語言和16種中文方言,行業詞、專業實體和分級熱詞都能識別,還會參考長音頻歷史上下文讓人名和術語保持一致。

延遲上首字響應壓到約160毫秒,邊說邊轉寫不卡頓。成績單同樣硬:公開方言數據集KeSpeech和WSYue的11個子集上平均字錯誤率4.55%,中文16種方言內部測試平均字錯誤率10.38%、溫州話這類難啃的方言提升尤其明顯,方言翻普通話的平均語義句準率衝到82.10%。更野的一步來自基於下代架構的Qwen-Audio-3.1-ASR-Next。它把識別對象從"語音裡的文字"擴成了"完整的音頻信息"——能聽懂人物情緒、環境聲和機械聲,完成聲音描述、事件定位和音頻問答推理。

給一段混著對話、背景音樂和環境聲的音頻,它不光輸出字幕,還能告訴你裡面有哪些聲音、相關事件何時發生,並回答關於整段內容的提問。分角色ASR測試裡,ASR-Flash-Next和ASR-Flash版本分別在八項指標裡拿下五項和三項最優,全面壓過此前的Fun-ASR級聯繫統。合成這邊,Qwen-Audio-3.1-TTS強調真實表達而非只求字音正確。它支持多語種與方言合成,同一音色跨語言時能自然遷移,讓你秒講數種語言,還能靠指令控制情緒、語速和表達方式,讓聲音貼合具體內容與場景。真正的驚喜是下代架構的Qwen-Audio-3.

1-TTS-Next,它把音頻創作從"單一人聲合成"升格成了"通用音頻生成系統"。過去做一段完整音頻,得主播、音效師、混音師、剪輯師分頭幹活再後期縫合;現在圍繞文本、時間戳和參考音頻,一個模型就能統一生成人聲、音效和環境音。它支持多人音色復刻與多輪對話,連續內容裡各角色音色不"變聲",還會演繹停頓、接話、附和和情緒轉折;多類聲音融合生成,呈現材質、遠近與空間層次——有聲書裡能同時處理旁白、兩角色對話,再補上城市低鳴、晚風和易拉罐碰撞聲,讓對話像真發生在故事場景裡。

更專業的是它吃自然語言控制,能指定語氣、語速、音量、音樂風格與配器,支持細粒度時間戳、聲音復刻和48kHz輸出,對白起止和聲音事件節奏都能精準排布,餵飽播客、有聲書、影視、遊戲和廣告的需求。實時交互這條線,Qwen-Audio-3.1-Realtime不再把識別、模型和合成簡單串糖葫蘆。它走全雙工,能同時說和聽,用戶隨時插話、打斷,體驗貼近真人通話。模型理解的不再只是文字,還有聲音背後的情緒與意圖——察覺你語氣低落,它不會機械回一句"我理解",而是放慢語速、調整措辭;對話裡切語言,上下文、語氣和節奏不斷檔;面對不確定信息少編、面對高風險內容守邊界。

它還基於多教師蒸餾架構在保持低延遲的同時提升推理與安全,並能在實時對話裡直接調用Agent工具,連API、知識庫和業務系統去查、去執行,把結果自然帶回對話。落地已經在路上。Qwen-Audio-3.1-Realtime正和Qoder、千問辦公等Agent,以及QwenNote、A2、Eva、千問AI眼鏡、樂奇AI眼鏡等硬件結合,讓用戶不必開電腦手機,直接動嘴發起任務、在對話裡追加條件或修改需求。

從ASR的潤色與方言、到ASR-Next的泛音頻理解、TTS的跨語言音色、TTS-Next的完整音頻創作、再到Realtime的擬人共情與工具調用,千問這五款模型沿著五條清晰技術路徑同時推進,把"能聽懂、能創作、能聊天"打包成語音這一連接人、內容與AI的自然入口,而九成五的ASR降價,則把這道入口的門檻幾乎拆到了地平線以下。相關推薦千問發佈 Qwen-Audio-3.1系列語音大模型,五款模型全線降價最高95%千問9月23日發佈Qwen-Audio-3.1系列語音大模型,形成覆蓋理解、生成、交互與創作的完整音頻能力棧,含ASR、ASR-Next、TTS、TTS-Next及Realtime。

API已上架千問AI平臺,ASR-Next即將上線。同步全線降價:TTS約70%、Realtime約85%、ASR達95%。ASR增強多語種、方言識別與上下文理解,新增原生轉寫潤色。Sep 23, 202682.3k千問發佈 Qwen3.8-LiveTranslate 同聲傳譯大模型:原文譯文同屏出,字均延遲壓到 2.3 秒阿里千問發佈同聲傳譯大模型Qwen3.8-LiveTranslate,基於Interleave架構重構,提升準確度、流暢度與簡潔度,字均延遲由2.8秒降至2.3秒,改善同傳聽感。模型已支持60種語言,並新增實時說話人分離等落地能力,補齊同傳實用拼圖。

Sep 20, 2026197.6k一個創意,一支AI團隊:千問創作Agent Teams上線,編劇導演美術全承包阿里千問創作8月31日上線Agent Teams,將AI視頻創作從寫提示詞升級為多智能體協作:用戶提創意,Agent主動拆解執行。功能同步登陸PC端與APP,支持多設備協同。模型上首發Wan3.0視頻生成模型,並上線更快更強的Wan3.0 Prime滿血版,彙集Qwen-Image-3.0等阿里模型,由Agent Teams按需調度。Aug 31, 2026284.9k阿里Qwen-Audio-3.

0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”阿里巴巴在千問AI平臺全面上線Qwen-Audio-3.0系列語音模型,涵蓋語音識別、語音合成和實時語音交互三款。官方稱,該系列在權威評測平臺Artificial Analysis今年7月語音排行榜中表現卓越,包攬語音識別、實時交互和語音合成三項第一。Aug 17, 2026280.0k阿里重磅開源2.4萬億參數大模型,多項性能比肩Fable 5阿里千問首次全面開源Max旗艦模型Qwen3.8-2.4T-A95B權重。該模型總參數2.4萬億,單Token激活950億,原生支持26萬Token上下文,可擴展至101萬;架構延續Qwen3.

5優勢,擅長編程、辦公、科研及長週期智能等任務。Aug 13, 2026226.7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

斑馬智能發佈端模型AutoOmni2.0,讓元神AI更懂“我的世界”

斑馬智能在雲棲大會發表新一代全模態端側大模型AutoOmni 2.0,任務處理能力堪比10倍參數量的雲模型,並推出AutoClaw 2.0智艙協作實車方案。元神AI強調理解用戶的「表世界」與「裡世界」,透過「三個連通」朝Personal AI演進,已覆蓋主流車企68%的服務。AutoOmni與10家晶片廠合作,實現低延遲、隱私保護及高效能推理,並展示免喚醒與主動智能等場景,未來將從單體智能擴展至群體智能。

剛剛
量子位生成式AI

它石智航頂尖團隊引領中國具身智能率先邁入規模化落地階段

它石智航創辦人陳亦倫於上海跨國企業推介會中,強調具身智能須經真實產線驗證,並指出中國憑藉豐富製造業場景,率先進入規模化落地階段。該公司已透過自研AWE基座大模型與自製機器人硬件,完成從模型突破到規模化應用的三級躍遷,並計畫擴大研發團隊與生產基地,提升交付能力。未來將以中國為研發核心,面向全球推動工業智能化轉型。

剛剛
IT之家生成式AI

科大訊飛發佈全新語音識別大模型 Spark-ASR-2.0,明日上線訊飛輸入法

作者:遠洋 責編:遠洋 評論: 9 月 23 日消息,今日,科大訊飛正式發佈最新一代語音識別大模型 Spark-ASR-2.0。據官方介紹,Spark-ASR-2.0 通過非自迴歸與 LLM 增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,整體的語音識別效果大幅提升,尤其在通用識別(中英文混合、方言、專業術語)、複雜聲學場景識別(高噪、小音量、快語速、兒童)、上下文識別和文本流暢規範性等方面改善明顯。

剛剛
鈦媒體生成式AI

別急著找“中國版Muse”,先看看股價的臉色

來咖智庫2026.09.23 16:33 · 來自重慶全文1557字00:00 / 04:25Muse火不火,是真問題;“中國版Muse”炒不炒,是假問題。文 | 來咖智庫9月8日,Meta上線個人AI智能體Muse。上線5天,下載量突破73萬次;13天累計超250萬次,登頂美國蘋果應用商店免費榜,把ChatGPT、Claude、Grok統統壓在身下。Apptopia的數據更狠:Muse美國移動端日活已達64.2萬,是ChatGPT上線同期23.1萬的近三倍。

剛剛
IT之家生成式AI

適用榮耀、小米、階躍手機,網信部門發佈 3 款提供手機端側生成式 AI 服務已備案信息

首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 榮耀 YOYO Claw、小米 miclaw、階躍終端 AI 三款手機端側生成式 AI 服務通過網信部門備案 2026/9/23 16:33:24 作者:清源 責編:清源 評論: 感謝網友 Autumn_Dream、xxy171070、補藥吖 的線索投遞!

剛剛

​全新深藍 S07 正式官宣接入豆包大模型,9 月 28 日震撼上市

深藍汽車董事長鄧承浩於今日正式對外宣佈,全新深藍 S07將全面接入字節跳動旗下的豆包大模型,並同步搭載 AI 激光智駕系統,新車已定於9月28日正式推向市場。在談及智能座艙的發展演變時,鄧承浩指出,過去的汽車座艙競爭主要停留在“堆料”層面,用戶不得不去適應機器繁瑣的交互邏輯。

剛剛