阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%
AI資訊AI新閒資訊正文阿里千問發佈 Qwen-Audio-3.1:五款語音模型同發,ASR 價格直降 95%發布於AI新閒資訊時間 :Sep 23, 2026閱讀 :1分鐘千問當日正式發佈 Qwen-Audio-3.1 系列語音大模型。本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。
為進一步降低使用門檻,Qwen-Audio 全線語音模型價格均下調,其中 TTS 降約 70%、Realtime 降約 85%、ASR 降幅達 95%。五款模型同發,ASR 價格直降 95%Qwen-Audio-3.1-ASR 是新一代語音識別模型,新增原生轉寫潤色能力,可自動去除語氣詞與重複表達並重組語義;其分角色轉寫能完整呈現“誰在什麼時候說了什麼”,為會議、訪談提供可追溯的結構化記錄。該模型一套支持 30 種語言與 16 種中文方言,支持行業詞與分級熱詞識別,並提供低延遲流式識別,首字響應約 160 毫秒。
性能上,其在 KeSpeech 與 WSYue 的 11 個子集平均字錯誤率(CER)4.55%,中文方言內部測試集平均 CER 10.38%,AST 平均語義句準率 82.10%。基於下代架構的 ASR-Next 則把處理對象從“語音中的文字”擴展為“完整音頻信息”,可理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位與音頻問答推理。在分角色 ASR 評測中,其 Flash-Next 與 Flash 版本分別取得五項和三項最優,全面優於此前的 Fun-ASR 級聯繫統。語音合成方面,Qwen-Audio-3.
1-TTS 支持多語種及方言合成,並讓同一音色在跨語言時自然遷移,可通過指令控制情緒、語速與表達方式。新一代 TTS-Next 更進一步,圍繞文本、時間戳與參考音頻統一生成人聲、音效與環境音,一次創作完整音頻內容,並支持 48kHz 輸出與細粒度時間戳控制,滿足播客、有聲書、影視和遊戲等需求。從聽懂到創作,語音成 AI 自然入口實時交互模型 Qwen-Audio-3.1-Realtime 採用全雙工架構,可同時說和聽、支持隨時插話打斷,並從識別文字升級為理解情緒與交流意圖——識別到用戶語氣低落時會放慢語速、調整措辭。
它還支持多語言實時切換,並在對話中調用 API、知識庫與業務系統工具完成任務;基於多教師蒸餾架構,在保持低延遲的同時強化了事實可靠性與安全邊界。目前,Qwen-Audio-3.1-Realtime 正與 Qoder、千問辦公等 Agent,以及 QwenNote、A2、Eva、千問 AI 眼鏡、樂奇 AI 眼鏡等智能硬件結合。在這些場景中,用戶無需始終打開電腦或手機,即可通過語音直接發起任務,並在實時對話中追加條件、修改需求或瞭解執行情況。千問表示,Qwen-Audio 3.
1 的升級並非單點指標優化,而是沿五條技術路徑推進,讓“能聽懂、能創作、能聊天”的語音成為連接人、內容與 AI 的自然入口。相關推薦千問一口氣端出五款語音大模型,TTS價格腰斬七成、ASR砍掉九成五,把耳朵和嗓子全打包給了開發者阿里千問9月23日升級語音棧,推出Qwen-Audio-3.1系列五款模型,覆蓋識別、合成、實時交互、音頻創作與理解,形成“理解—生成—交互—創作”完整矩陣。價格大幅下調:TTS降約70%、Realtime降約85%、ASR降95%,大幅降低語音使用門檻。Sep 23, 2026102.0k千問發佈 Qwen-Audio-3.
1系列語音大模型,五款模型全線降價最高95%千問9月23日發佈Qwen-Audio-3.1系列語音大模型,形成覆蓋理解、生成、交互與創作的完整音頻能力棧,含ASR、ASR-Next、TTS、TTS-Next及Realtime。API已上架千問AI平臺,ASR-Next即將上線。同步全線降價:TTS約70%、Realtime約85%、ASR達95%。ASR增強多語種、方言識別與上下文理解,新增原生轉寫潤色。Sep 23, 202682.4k阿里Qwen-Audio-3.0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”阿里巴巴在千問AI平臺全面上線Qwen-Audio-3.
0系列語音模型,涵蓋語音識別、語音合成和實時語音交互三款。官方稱,該系列在權威評測平臺Artificial Analysis今年7月語音排行榜中表現卓越,包攬語音識別、實時交互和語音合成三項第一。Aug 17, 2026280.0k騰訊混元 Hy ASR3.0 預覽版發佈:從"聽清"到"聽懂",方言詞錯率壓到 3%騰訊混元發佈語音識別模型Hy ASR3.0 Preview,基於大語言模型Hy3,融合高精度識別與深度語義理解,實現從“逐字轉寫”到“理解語境”的質變。模型覆蓋十大方言片區,長音頻場景優勢突出,不依賴標準普通話,讓AI不僅能聽清字,更能真正聽懂話。Aug 5, 2026266.
9k騰訊混元發佈Hy ASR3.0preview:語音識別邁入“懂語境”新階段騰訊混元發佈語音識別模型Hy ASR3.0preview,首次將大語言模型Hy3的語義理解融入識別,實現從逐字轉寫向“理解語境、一鍵直出”跨越。在開源評測集上,中文普通話、英語、粵語詞錯誤率分別為3.34%、2.62%、3.12%,整體約3%,多維度表現亮眼。Aug 4, 2026309.1k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

科大訊飛正式發佈 Spark-ASR-2.0,全面賦能硬件與開放生態
9月23日,科大訊飛官方正式發佈了全新一代語音識別大模型 Spark-ASR-2.0,標誌著其在語音交互與智能硬件落地方面邁出了關鍵一步。在具體的上線與落地節奏方面,該模型將於次日(9月24日)起在訊飛輸入法中逐步上線,同時通過訊飛開放平臺面向開發者與企業客戶全面提供 API 服務。

達卯科技完成新一輪融資,算電協同核心軟件層“稀缺標的”
達卯科技近期完成約2億元新一輪融資,該公司專注於算電協同AI能源運營作業系統,是賽道內少數已實現商業落地的軟體層企業。其核心產品算電協同2.0平台已具備GW級智算中心綠電直連的全週期營運能力,股東陣容包含寧德時代、商湯科技等龍頭。隨著算電協同獲國家政策支持並寫入政府工作報告,公司透過「技術賦能+營運落地」模式持續拓展市場。

國內開發者如何穩定使用 Claude Code、Codex 和 Gemini CLI:從配置接入到團隊協作
對於個人開發者、獨立開發者和企業研發團隊來說,AI 編程工具已經成為提高開發效率的重要組成部分。不過,在實際使用過程中,很多國內開發者遇到的問題並不只是模型能力本身,還包括網絡連接、支付方式、配置流程、額度管理和售後支持等。一、使用 AI 編程工具時,開發者常見的問題網絡連接不穩定在使用 AI 編程 Agent 處理複雜任務時,一次任務可能需要持續運行幾分鐘,甚至更長時間。

Anthropic 擬租賃最高 1 吉瓦算力,減少對雲廠商依賴
這被視為這家 AI 公司降低對雲廠商依賴的重大舉措之一。若交易達成,Anthropic 將直接掌握相當體量的算力供給,而不再單純依賴第三方雲平臺按量分配。目前談判仍處早期,最終租賃規模、期限與具體開發商尚未敲定,但“最高 1 吉瓦”的目標已顯示出 Anthropic 對自有算力底盤的強烈訴求。

螞蟻百靈開源 Ming-Image-0.1-Design 系列模型,UI 設計專項評測位列開源第一
作者:遠洋 責編:遠洋 評論: 9 月 23 日消息,今日,螞蟻百靈大模型正式開源 Ming-Image-0.1-Design 系列,包含兩個參數量均為 6B 的模型:Ming-Image-0.1-Design,從文字需求生成 UI、信息圖、海報和完整視覺設計;Ming-Image-0.

斑馬智能發佈端模型AutoOmni2.0,讓元神AI更懂“我的世界”
斑馬智能在雲棲大會發表新一代全模態端側大模型AutoOmni 2.0,任務處理能力堪比10倍參數量的雲模型,並推出AutoClaw 2.0智艙協作實車方案。元神AI強調理解用戶的「表世界」與「裡世界」,透過「三個連通」朝Personal AI演進,已覆蓋主流車企68%的服務。AutoOmni與10家晶片廠合作,實現低延遲、隱私保護及高效能推理,並展示免喚醒與主動智能等場景,未來將從單體智能擴展至群體智能。