阿里甩出“配音”神器:能調整情緒,還會說方言

重點摘要
阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。
阿里推出全新語音合成模型,可調整語氣情緒還能說方言
千問大模型團隊於7月20日正式發布語音合成大模型Qwen-Audio-3.0-TTS,並同步推出兩個版本:專注即時互動的Flash版本,首包延遲僅在300毫秒等級;以及專注高品質生成的Plus版本。這次升級在細粒度標籤控制、自然語言指令遵循、多語種與方言覆蓋,以及複雜聲學環境的魯棒性等方面,都有顯著進步。根據第三方評測機構Artificial Analysis公布的Speech Arena語音合成榜單,Qwen-Audio-3.0-TTS-Plus目前位居全球第一,Elo評分達到1237分。這項成績顯示該模型在語音合成的自然度與品質上,已獲得國際評測機構的肯定。
在輸出規格方面,Qwen-Audio-3.0-TTS將音頻採樣率從以往的24kHz提升至48kHz,單次語音合成最長可達3分鐘。目前,Plus與Flash兩個版本皆已在阿里雲百鍊平台上線,開發者可直接取用測試。細粒度標籤控制是此次升級的核心亮點之一。用戶可以在合成文本中插入結構化標籤,例如[gasp]代表抽氣、[giggles]代表輕笑、[angry]代表憤怒等,藉此精準調節語氣、情緒與呼吸等細微表現。官方公布的案例顯示,在一段飛船事故相關的臺詞前加入[angry]標籤後,模型會以憤怒語氣合成後續內容,角色的質問感與緊迫感隨著臺詞逐步增強,效果相當自然。
除了結構化標籤,Qwen-Audio-3.0-TTS也支援Free-style自然語言指令控制。用戶不需調整專業音頻參數,直接用自然語言描述角色、情緒、場景與語速即可。例如,輸入「你是一位年輕女性小學老師,正在課堂上耐心地給一年級學生複述拼音規則,語速很慢,每一個發音都示範一遍,語調上揚帶笑意」,模型便能合成出符合描述的課堂講解錄音。這種方式同樣適用於旁白、角色配音、有聲內容與語音助手等場景,大幅降低語音合成的使用門檻。官方也展示了懸疑劇旁白的案例:輸入「你是懸疑劇旁白,屏住呼吸把緊張感一層層疊上去」,模型合成的旁白語速顯得急促,營造出明顯的緊張感,讓聽眾彷彿置身故事場景之中。
這項功能對於有聲小說、廣播劇等內容製作來說,能夠隨情節調整節奏與情緒,進一步提升聽眾的沉浸感與代入感。在多語種支援方面,Qwen-Audio-3.0-TTS-Plus覆蓋中文、英語、日語、韓語、德語等16種語言,並新增阿拉伯語、越南語、馬來語與菲律賓語。根據官方公布的CV3-Eval多語種測試結果,Qwen-Audio-3.0-TTS系列在16種語言的詞或字錯誤率評測中,有10種語言排名第一,其中韓語與馬來語的領先幅度較大。在說話人相似度評測方面,Plus版本更是在全部16項語言中取得最優成績,Flash版本則在15項中位居第二,顯示該模型在語音還原度上表現相當出色。
中文方言方面,Qwen-Audio-3.0-TTS目前支援廣東話、重慶話、東北話、陝西話、上海話、四川話與雲南話等20種方言。千問團隊表示,新模型使用了更多方言數據,並增加方言強化訓練階段,讓模型在韻律、聲調與口語表達上更接近母語使用者,同時減少通用語音強化學習過程中可能出現的方言特徵減弱問題。用戶只需透過自然語言指令指定輸出方言,例如輸入「輸出上海話」,模型即可根據後續文本合成上海話語音。聲音復刻能力在這次升級中也獲得強化。傳統的聲音復刻通常需要較為清晰的參考錄音,但實際取得的音頻常常包含背景噪聲或混響。Qwen-Audio-3.
0-TTS加入真實聲學環境仿真訓練,將語音增強能力應用於聲音復刻流程。官方指出,即使參考音頻存在較高噪聲或混響,模型仍能過濾部分環境干擾,並有效提取說話人的音色特徵,進一步提升在複雜環境下的實用性。從整體升級方向來看,Qwen-Audio-3.0-TTS顯著提升了對於語氣、情緒、呼吸與角色風格的控制能力。結構化標籤適合調節文本中特定位置的表達效果,而自然語言指令則能對角色、場景與語速進行整體描述,兩者相輔相成。多語種、方言以及複雜聲學環境下的聲音復刻能力也獲得擴展,讓這款語音合成模型在應用場景上更加全面。
隨著Plus與Flash版本在阿里雲百鍊平台正式開放,這些技術能力將陸續進入旁白、角色配音、有聲內容與語音助手等實際應用場景,為開發者與內容創作者提供更多元的配音方案。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。