阿里Qwen-Audio-3.0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”

2026年8月17日 08:334700 次瀏覽
站內 AI 整理稿

AI資訊AI新閒資訊正文阿里Qwen-Audio-3.0系列語音模型上線千問AI平臺,斬獲國際評測“大滿貫”發布於AI新閒資訊時間 :Aug 17, 2026閱讀 :1分鐘近日,阿里巴巴正式宣佈Qwen-Audio-3.0系列語音模型在千問AI平臺全面上線。此次發佈的系列模型包括語音識別大模型Qwen-Audio-3.0-ASR、語音合成大模型Qwen-Audio-3.0-TTS以及實時語音交互對話模型Qwen-Audio-3.0-Realtime。

據官方介紹,該系列模型在全球權威AI評測平臺Artificial Analysis今年7月的語音排行榜中表現卓越,一舉奪得語音識別(ASR)、實時交互(RealTime)和語音合成(TTS)三個核心賽道的全球第一,實現“大滿貫”。在能力方面,Qwen-Audio-3.0-ASR支持複雜語境與專業領域識別;Qwen-Audio-3.0-TTS支持多語種、多方言,並能精準控制情緒、語氣與節奏;Qwen-Audio-3.0-Realtime則實現了端到端語音理解與對話,支持隨時打斷追問及工具調用,目前已應用於千問App、千問辦公及Qoder等產品。

此外,千問AI平臺近期密集更新了多款主力模型,包括Qwen3.8-Max、Qwen-image3.0pro及Wan3.0等,形成了覆蓋文本、代碼、語音、圖像和視頻的全模態模型矩陣。平臺同步推出Token Plan訂閱服務限時優惠,個人版最低39元/月起,團隊版最高可享7.6折,旨在降低開發者調用門檻,打造“為Agent而生”的AI生產力平臺。相關推薦騰訊混元 Hy ASR3.0 預覽版發佈:從"聽清"到"聽懂",方言詞錯率壓到 3%騰訊混元發佈語音識別模型Hy ASR3.0 Preview,基於大語言模型Hy3,融合高精度識別與深度語義理解,實現從“逐字轉寫”到“理解語境”的質變。

模型覆蓋十大方言片區,長音頻場景優勢突出,不依賴標準普通話,讓AI不僅能聽清字,更能真正聽懂話。Aug 5, 2026234.3k騰訊混元發佈Hy ASR3.0preview:語音識別邁入“懂語境”新階段騰訊混元發佈語音識別模型Hy ASR3.0preview,首次將大語言模型Hy3的語義理解融入識別,實現從逐字轉寫向“理解語境、一鍵直出”跨越。在開源評測集上,中文普通話、英語、粵語詞錯誤率分別為3.34%、2.62%、3.12%,整體約3%,多維度表現亮眼。Aug 4, 2026272.5k聚焦語音Agent可靠性:xAI正式發佈Grok Voice Think Fast 2.

0xAI發佈新一代語音模型Grok Voice Think Fast 2.0,全面向開發者開放,在智能水平、轉錄精度、對話交互和工具調用效率上顯著提升。定價每分鐘0.08美元,在Artificial Analysis基準測試中綜合得分為82.9%,超越前代及GPT-Realtime-2.1、Gemini 3.1 Flash。Jul 31, 2026341.1k首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放阿里通義千問發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,實現從“能說話”到“會表達”的跨越。

Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。雙版本中Flash版主打低延遲實時交互(首包約300ms),Plus版專攻高質量自然度與音色還原。Jul 20, 2026282.9k通義千問重磅升級:實時語音識別模型 Fun-ASR-Realtime 正式發佈通義千問推出實時語音識別模型Fun-ASR-Realtime,首字延遲降至百毫秒級,實現“即說即反饋”的流暢交互。其識別準確度接近離線模型,在保證高精度同時突破實時性瓶頸,標誌語音交互體驗邁向新高度。Jul 6, 2026238.

9k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛