阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%

AI資訊AI新聞資訊正文阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%發佈於AI新聞資訊發佈時間 :2026年9月23號 16:10閱讀 :1分鐘千問當日正式發佈 Qwen-Audio-3.1 系列語音大模型。本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。
為進一步降低使用門檻,Qwen-Audio 全線語音模型價格均下調,其中 TTS 降約 70%、Realtime 降約 85%、ASR 降幅達 95%。五款模型同發,ASR 價格直降 95%Qwen-Audio-3.1-ASR 是新一代語音識別模型,新增原生轉寫潤色能力,可自動去除語氣詞與重複表達並重組語義;其分角色轉寫能完整呈現“誰在什麼時候說了什麼”,為會議、訪談提供可追溯的結構化記錄。該模型一套支持 30 種語言與 16 種中文方言,支持行業詞與分級熱詞識別,並提供低延遲流式識別,首字響應約 160 毫秒。
性能上,其在 KeSpeech 與 WSYue 的 11 個子集平均字錯誤率(CER)4.55%,中文方言內部測試集平均 CER 10.38%,AST 平均語義句準率 82.10%。基於下代架構的 ASR-Next 則把處理對象從“語音中的文字”擴展為“完整音頻信息”,可理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位與音頻問答推理。在分角色 ASR 評測中,其 Flash-Next 與 Flash 版本分別取得五項和三項最優,全面優於此前的 Fun-ASR 級聯繫統。語音合成方面,Qwen-Audio-3.
1-TTS 支持多語種及方言合成,並讓同一音色在跨語言時自然遷移,可通過指令控制情緒、語速與表達方式。新一代 TTS-Next 更進一步,圍繞文本、時間戳與參考音頻統一生成人聲、音效與環境音,一次創作完整音頻內容,並支持 48kHz 輸出與細粒度時間戳控制,滿足播客、有聲書、影視和遊戲等需求。從聽懂到創作,語音成 AI 自然入口實時交互模型 Qwen-Audio-3.1-Realtime 採用全雙工架構,可同時說和聽、支持隨時插話打斷,並從識別文字升級為理解情緒與交流意圖——識別到用戶語氣低落時會放慢語速、調整措辭。
它還支持多語言實時切換,並在對話中調用 API、知識庫與業務系統工具完成任務;基於多教師蒸餾架構,在保持低延遲的同時強化了事實可靠性與安全邊界。目前,Qwen-Audio-3.1-Realtime 正與 Qoder、千問辦公等 Agent,以及 QwenNote、A2、Eva、千問 AI 眼鏡、樂奇 AI 眼鏡等智能硬件結合。在這些場景中,用戶無需始終打開電腦或手機,即可通過語音直接發起任務,並在實時對話中追加條件、修改需求或瞭解執行情況。千問表示,Qwen-Audio 3.
1 的升級並非單點指標優化,而是沿五條技術路徑推進,讓“能聽懂、能創作、能聊天”的語音成為連接人、內容與 AI 的自然入口。相關推薦千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者阿里千問9月23日升級語音棧,推出Qwen-Audio-3.1系列五款模型,覆蓋識別、合成、實時交互、音頻創作與理解,形成“理解—生成—交互—創作”完整矩陣。價格大幅下調:TTS降約70%、Realtime降約85%、ASR降95%,大幅降低語音使用門檻。2026年9月23號 15:49102.0k千問發佈 Qwen-Audio-3.
1系列語音大模型,五款模型全線降價最高95%千問9月23日發佈Qwen-Audio-3.1系列語音大模型,形成覆蓋理解、生成、交互與創作的完整音頻能力棧,含ASR、ASR-Next、TTS、TTS-Next及Realtime。API已上架千問AI平臺,ASR-Next即將上線。同步全線降價:TTS約70%、Realtime約85%、ASR達95%。ASR增強多語種、方言識別與上下文理解,新增原生轉寫潤色。2026年9月23號 15:2882.4k阿里Qwen-Audio-3.0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”阿里巴巴在千問AI平臺全面上線Qwen-Audio-3.
0系列語音模型,涵蓋語音識別、語音合成和實時語音交互三款。官方稱,該系列在權威評測平臺Artificial Analysis今年7月語音排行榜中表現卓越,包攬語音識別、實時交互和語音合成三項第一。2026年8月17號 16:26280.0k騰訊混元 Hy ASR3.0 預覽版發佈:從"聽清"到"聽懂",方言詞錯率壓到 3%騰訊混元發佈語音識別模型Hy ASR3.0 Preview,基於大語言模型Hy3,融合高精度識別與深度語義理解,實現從“逐字轉寫”到“理解語境”的質變。模型覆蓋十大方言片區,長音頻場景優勢突出,不依賴標準普通話,讓AI不僅能聽清字,更能真正聽懂話。
2026年8月5號 16:35266.9k騰訊混元發佈Hy ASR3.0preview:語音識別邁入“懂語境”新階段騰訊混元發佈語音識別模型Hy ASR3.0preview,首次將大語言模型Hy3的語義理解融入識別,實現從逐字轉寫向“理解語境、一鍵直出”跨越。在開源評測集上,中文普通話、英語、粵語詞錯誤率分別為3.34%、2.62%、3.12%,整體約3%,多維度表現亮眼。2026年8月4號 16:41309.1k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

斑馬智能發佈端模型AutoOmni2.0,讓元神AI更懂“我的世界”
斑馬智能在雲棲大會發表新一代全模態端側大模型AutoOmni 2.0,任務處理能力堪比10倍參數量的雲模型,並推出AutoClaw 2.0智艙協作實車方案。元神AI強調理解用戶的「表世界」與「裡世界」,透過「三個連通」朝Personal AI演進,已覆蓋主流車企68%的服務。AutoOmni與10家晶片廠合作,實現低延遲、隱私保護及高效能推理,並展示免喚醒與主動智能等場景,未來將從單體智能擴展至群體智能。

科大訊飛發佈全新語音識別大模型 Spark-ASR-2.0,明日上線訊飛輸入法
作者:遠洋 責編:遠洋 評論: 9 月 23 日消息,今日,科大訊飛正式發佈最新一代語音識別大模型 Spark-ASR-2.0。據官方介紹,Spark-ASR-2.0 通過非自迴歸與 LLM 增強自迴歸協同、中英文混合文本與聲學聯合增強、動態上下文注入等關鍵技術創新,整體的語音識別效果大幅提升,尤其在通用識別(中英文混合、方言、專業術語)、複雜聲學場景識別(高噪、小音量、快語速、兒童)、上下文識別和文本流暢規範性等方面改善明顯。

別急著找“中國版Muse”,先看看股價的臉色
來咖智庫2026.09.23 16:33 · 來自重慶全文1557字00:00 / 04:25Muse火不火,是真問題;“中國版Muse”炒不炒,是假問題。文 | 來咖智庫9月8日,Meta上線個人AI智能體Muse。上線5天,下載量突破73萬次;13天累計超250萬次,登頂美國蘋果應用商店免費榜,把ChatGPT、Claude、Grok統統壓在身下。Apptopia的數據更狠:Muse美國移動端日活已達64.2萬,是ChatGPT上線同期23.1萬的近三倍。

適用榮耀、小米、階躍手機,網信部門發佈 3 款提供手機端側生成式 AI 服務已備案信息
首頁 IT圈 最會買 設置 日夜間 隨系統 淺色 深色 主題色 黑色 投稿 訂閱 RSS訂閱 收藏 軟媒應用 App客戶端 要知App 軟媒魔方 業界 手機 電腦 測評 視頻 AI 蘋果 iPhone 鴻蒙 軟件 智車 數碼 學院 遊戲 直播 5G 微軟 Win10 Win11 專題 搜索 首頁 > 智能時代>人工智能 榮耀 YOYO Claw、小米 miclaw、階躍終端 AI 三款手機端側生成式 AI 服務通過網信部門備案 2026/9/23 16:33:24 作者:清源 責編:清源 評論: 感謝網友 Autumn_Dream、xxy171070、補藥吖 的線索投遞!

全新深藍 S07 正式官宣接入豆包大模型,9 月 28 日震撼上市
深藍汽車董事長鄧承浩於今日正式對外宣佈,全新深藍 S07將全面接入字節跳動旗下的豆包大模型,並同步搭載 AI 激光智駕系統,新車已定於9月28日正式推向市場。在談及智能座艙的發展演變時,鄧承浩指出,過去的汽車座艙競爭主要停留在“堆料”層面,用戶不得不去適應機器繁瑣的交互邏輯。

AI沒有失控,是硅谷在裝瘋
硅基降臨2026.09.23 16:08 · 來自海外全文3053字00:00 / 08:36造AI的專家,正在集體高喊:“AI將要殺死全人類。”文 | 硅基降臨過去幾個月,全球科技圈正在上演一場極度荒誕的奇觀。造AI的人,現在比誰都害怕AI。研究員不惜辭職爆料,高管公開預判人類滅絕概率,就連AI 本身,都能條理清晰講出毀滅人類的手段。億萬網民為人類命運惴惴不安,卻很少有人留意時間線。所有末日警報,精準踩在融資、上市、遊說政策的關鍵窗口。真正危險的,到底是AI,還是借末日敘事收割利益的資本?