MarkTechPost AI模型更新

Alibaba’s Tongyi Lab Releases Qwen-Audio-3.0-TTS, a Hosted Text-to-Speech Model in Flash and Plus Tiers Across 16 Languages

2026年7月20日 21:14

重點摘要

Alibaba’s Tongyi Lab has released Qwen-Audio-3.0-TTS, a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation.

站內 AI 整理稿

阿里巴巴通義實驗室正式推出新一代文字轉語音模型 Qwen-Audio-3.0-TTS,這是一款專為生產環境設計的語音合成系統,提供 Flash 與 Plus 兩種版本,支援多達 16 種語言,涵蓋全球主要市場的溝通需求。該模型延續了通義實驗室在語音與語言模型領域的技術積累,目標是讓文字轉語音技術在即時互動與高品質內容生成兩個場景中都能發揮作用。Qwen-Audio-3.0-TTS 的兩個版本源自同一技術架構,但針對不同應用場景進行了差異化調校。Flash 版本主打低延遲、高響應速度,適合需要即時反饋的環境,例如語音助手、客服機器人、即時廣播等。

這類場景對語音輸出的速度要求極高,使用者往往無法接受明顯的等待時間,Flash 版本透過簡化計算流程與優化推理效率,在毫秒級別內完成語音合成,並維持一定的自然度與清晰度。另一版本 Plus 則以高品質語音生成為核心,適合內容創作、有聲書製作、語音播報、影視配音等需要細膩情感與豐富語調的場景。Plus 版本在語音的自然流暢度、韻律變化、發音準確性以及多風格適配能力上進行了強化,能夠根據文本內容自動調整語速、語調與停頓,使合成語音更接近真人朗讀的質感。這對於需要長時間聆聽或高沉浸感的應用來說尤為關鍵。支援 16 種語言是 Qwen-Audio-3.0-TTS 的一大亮點。

這 16 種語言涵蓋了英語、中文、日語、韓語、法語、德語、西班牙語、阿拉伯語等主要使用人口較多的語言,同時也納入部分區域性語言,以滿足跨國企業、全球化平台以及多語內容生產者的需求。通義實驗室在訓練過程中採用了大規模多語語料,並針對不同語言的發音規則與口音差異進行了專門調校,以期減少語音合成中的「機器感」與腔調偏誤。值得注意的是,Qwen-Audio-3.0-TTS 並非一個單純的研究模型,而是以「生產導向」為設計目標。這意味著該模型在開發初期就考慮了部署的便捷性、運算資源的適配性以及與現有系統的整合能力。

通義實驗室提供了標準化的 API 介面與容器化部署方案,企業用戶可以根據自身需求選擇將模型部署在本地伺服器或雲端環境,並根據流量動態調整計算資源。從技術路線來看,Qwen-Audio-3.0-TTS 屬於基於神經網路的端到端語音合成模型,避免了傳統拼接合成或參數合成中常見的語音不連貫問題。透過大規模預訓練與微調技術,模型能夠在少量樣本下快速適應新語者或新風格,降低了客製化語音模型的門檻。這對於需要為特定品牌、角色或應用打造專屬語音的團隊來說,具有實際的商業價值。在語音合成領域,即時性與品質往往是一對矛盾。追求極致速度通常會犧牲音質,而追求高品質則需要更長的計算時間。Qwen-Audio-3.

0-TTS 透過推出兩個獨立版本,讓用戶可以根據實際場景權衡取捨,無需在同一模型上進行折衷。這種雙版本策略在業界並不少見,但能夠同時在兩個方向上達到生產級水準的產品仍屬少數。阿里巴巴通義實驗室在語音技術上已有多年積累,此前推出的 Qwen-Audio 系列模型在語音辨識、語音理解等任務上表現出色。此次推出的 TTS 模型補齊了從語音輸入到語音輸出的完整閉環,使得開發者能夠基於同一技術生態建構更完整的語音互動應用。例如,結合語音辨識模型與 TTS 模型,可以打造出支援語音對話、語音指令、語音朗讀等功能的智慧助手。

對於企業用戶而言,選擇一個成熟的 TTS 模型需要考慮的多個面向:語言覆蓋範圍、合成品質、延遲表現、部署靈活性以及成本。Qwen-Audio-3.0-TTS 在這些方面都做出了針對性的設計。Flash 版本適合高頻互動場景,能有效降低用戶等待時間;Plus 版本則適合內容生產,能提升最終產品的聽覺體驗。兩種版本均可透過雲端服務或本地部署使用,收費模式預計將根據請求量或運行時長計算。隨著 AI 語音技術的不斷成熟,文字轉語音已從單純的輔助功能逐漸演變為核心使用者體驗的一部分。無論是導航語音、新聞播報、有聲書朗讀,還是虛擬角色的對白,使用者對語音的自然度與情感表達的要求越來越高。

Qwen-Audio-3.0-TTS 的推出,反映了阿里巴巴在這一趨勢下的技術投入,也為開發者與內容創作者提供了一個新的工具選擇。目前該模型已開放部分測試,有興趣的開發者可以透過阿里巴巴雲的官方平台或通義實驗室的技術文件了解詳細規格與接入方式。未來通義實驗室還計畫持續更新模型,擴充更多語言與方言,並針對特定行業如醫療、教育、娛樂等推出專屬優化版本。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

剛剛

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

剛剛

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣

過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。

1 小時前