Alibaba’s Tongyi Lab Releases Qwen-Audio-3.0-TTS, a Hosted Text-to-Speech Model in Flash and Plus Tiers Across 16 Languages
重點摘要
Alibaba’s Tongyi Lab has released Qwen-Audio-3.0-TTS, a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation.
阿里巴巴通義實驗室正式推出新一代文字轉語音模型 Qwen-Audio-3.0-TTS,這是一款專為生產環境設計的語音合成系統,提供 Flash 與 Plus 兩種版本,支援多達 16 種語言,涵蓋全球主要市場的溝通需求。該模型延續了通義實驗室在語音與語言模型領域的技術積累,目標是讓文字轉語音技術在即時互動與高品質內容生成兩個場景中都能發揮作用。 Qwen-Audio-3.0-TTS 的兩個版本源自同一技術架構,但針對不同應用場景進行了差異化調校。Flash 版本主打低延遲、高響應速度,適合需要即時反饋的環境,例如語音助手、客服機器人、即時廣播等。這類場景對語音輸出的速度要求極高,使用者往往無法接受明顯的等待時間,Flash 版本透過簡化計算流程與優化推理效率,在毫秒級別內完成語音合成,並維持一定的自然度與清晰度。 另一版本 Plus 則以高品質語音生成為核心,適合內容創作、有聲書製作、語音播報、影視配音等需要細膩情感與豐富語調的場景。Plus 版本在語音的自然流暢度、韻律變化、發音準確性以及多風格適配能力上進行了強化,能夠根據文本內容自動調整語速、語調與停頓,使合成語音更接近真人朗讀的質感。這對於需要長時間聆聽或高沉浸感的應用來說尤為關鍵。 支援 16 種語言是 Qwen-Audio-3.0-TTS 的一大亮點。這 16 種語言涵蓋了英語、中文、日語、韓語、法語、德語、西班牙語、阿拉伯語等主要使用人口較多的語言,同時也納入部分區域性語言,以滿足跨國企業、全球化平台以及多語內容生產者的需求。通義實驗室在訓練過程中採用了大規模多語語料,並針對不同語言的發音規則與口音差異進行了專門調校,以期減少語音合成中的「機器感」與腔調偏誤。 值得注意的是,Qwen-Audio-3.0-TTS 並非一個單純的研究模型,而是以「生產導向」為設計目標。這意味著該模型在開發初期就考慮了部署的便捷性、運算資源的適配性以及與現有系統的整合能力。通義實驗室提供了標準化的 API 介面與容器化部署方案,企業用戶可以根據自身需求選擇將模型部署在本地伺服器或雲端環境,並根據流量動態調整計算資源。 從技術路線來看,Qwen-Audio-3.0-TTS 屬於基於神經網路的端到端語音合成模型,避免了傳統拼接合成或參數合成中常見的語音不連貫問題。透過大規模預訓練與微調技術,模型能夠在少量樣本下快速適應新語者或新風格,降低了客製化語音模型的門檻。這對於需要為特定品牌、角色或應用打造專屬語音的團隊來說,具有實際的商業價值。 在語音合成領域,即時性與品質往往是一對矛盾。追求極致速度通常會犧牲音質,而追求高品質則需要更長的計算時間。Qwen-Audio-3.0-TTS 透過推出兩個獨立版本,讓用戶可以根據實際場景權衡取捨,無需在同一模型上進行折衷。這種雙版本策略在業界並不少見,但能夠同時在兩個方向上達到生產級水準的產品仍屬少數。 阿里巴巴通義實驗室在語音技術上已有多年積累,此前推出的 Qwen-Audio 系列模型在語音辨識、語音理解等任務上表現出色。此次推出的 TTS 模型補齊了從語音輸入到語音輸出的完整閉環,使得開發者能夠基於同一技術生態建構更完整的語音互動應用。例如,結合語音辨識模型與 TTS 模型,可以打造出支援語音對話、語音指令、語音朗讀等功能的智慧助手。 對於企業用戶而言,選擇一個成熟的 TTS 模型需要考慮的多個面向:語言覆蓋範圍、合成品質、延遲表現、部署靈活性以及成本。Qwen-Audio-3.0-TTS 在這些方面都做出了針對性的設計。Flash 版本適合高頻互動場景,能有效降低用戶等待時間;Plus 版本則適合內容生產,能提升最終產品的聽覺體驗。兩種版本均可透過雲端服務或本地部署使用,收費模式預計將根據請求量或運行時長計算。 隨著 AI 語音技術的不斷成熟,文字轉語音已從單純的輔助功能逐漸演變為核心使用者體驗的一部分。無論是導航語音、新聞播報、有聲書朗讀,還是虛擬角色的對白,使用者對語音的自然度與情感表達的要求越來越高。Qwen-Audio-3.0-TTS 的推出,反映了阿里巴巴在這一趨勢下的技術投入,也為開發者與內容創作者提供了一個新的工具選擇。 目前該模型已開放部分測試,有興趣的開發者可以透過阿里巴巴雲的官方平台或通義實驗室的技術文件了解詳細規格與接入方式。未來通義實驗室還計畫持續更新模型,擴充更多語言與方言,並針對特定行業如醫療、教育、娛樂等推出專屬優化版本。
Related
相關文章

沿用DeepSeek架構,美國大模型開始抄中國作業
沿用DeepSeek架構,美國大模型開始抄中國作業字母AI2026.07.21 13:37 · 來自北京全文5310字00:00 / 14:20貴在美國製造。文 | 字母AIOpenAI前首席技術官穆拉蒂,做出了一款中國模型的“貴替”。Thinking Machines發佈的首款模型Inkling,混合專家架構主要沿用DeepSeek-V3,後訓練冷啟動還使用了Kimi K2.5等開放模型生成的數據。

當AI給出標準答案,人如何“不同凡想”?一場WAIC UP! 思享會撕開的全球追問
好的,這是一篇根據您提供的資料重新撰寫的新聞稿,力求完整、深入,並滿足字數與段落要求。 --- ## AI給出標準答案,人如何「不同凡想」?一場WAIC思享會直擊全球青年的集體困惑 2026年7月,上海世博展覽館,世界人工智慧大會(WAIC)的主會場內,算力、演算法與資本的碰撞激盪著空氣。然而,在幾百米外的一個下沉廣場,一場名為「WAIC UP!」的思享會卻刻意避開了喧囂,沒有權威的致辭,沒有炫目的技術發佈,更沒有動輒數億的合作協議。
從追趕走向引領:Kimi K3登頂前端開發榜,國產模型實現關鍵性跨越
本週最大亮點是國產模型Kimi K3以1486分的ELO分數排名第9位,首次闖入綜合榜Top 10。國產模型Kimi K3同樣首次進入代碼榜Top 10,排名第10位,ELO 1529分,與第9名模型僅差1分,表現已十分接近第一梯隊。前端開發榜:Kimi K3強勢登頂,國產能力領跑全球前端開發榜呈現出前所未有的格局。

AI 公司,集體走進視頻播客
AI公司正越来越多地走出传统的发布会现场,走入视频播客的镜头前。这一趋势在今年的世界人工智能大会(WAIC)上表现得尤为明显。过去,行业讨论的焦点往往集中在模型参数、榜单排名和代码生成能力上;而今年,人们更关心AI能否帮助销售寻找线索、替代法务审核合同,或者让Agent自动为团队打分。这些具体而复杂的问题,很难被压缩进发布会的几页PPT中,于是视频播客成为了新的沟通阵地。

更多Token、更多芯片,Kimi K3體現“傑文斯悖論”,效率提升反而增加資源消耗
這篇消息聚焦「更多Token、更多芯片,Kimi K3體現“傑文斯悖論”,效率提升反而增加資源消耗」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
