智東西生成式AI

阿里甩出“配音”神器:能調整情緒,還會說方言

2026年7月20日 21:24
阿里甩出“配音”神器:能調整情緒,還會說方言

重點摘要

阿里旗下的千問大模型推出語音合成工具Qwen-Audio-3.0-TTS,支援情緒調整、方言及多語種,並可透過自然語言指令控制語氣與場景。該模型在第三方評測中獲得語音合成榜單第一,具備高品質的聲音復刻與抗噪能力。

站內 AI 整理稿

阿里推出全新語音合成模型,可調整語氣情緒還能說方言

千問大模型團隊於7月20日正式發布語音合成大模型Qwen-Audio-3.0-TTS,並同步推出兩個版本:專注即時互動的Flash版本,首包延遲僅在300毫秒等級;以及專注高品質生成的Plus版本。這次升級在細粒度標籤控制、自然語言指令遵循、多語種與方言覆蓋,以及複雜聲學環境的魯棒性等方面,都有顯著進步。 根據第三方評測機構Artificial Analysis公布的Speech Arena語音合成榜單,Qwen-Audio-3.0-TTS-Plus目前位居全球第一,Elo評分達到1237分。這項成績顯示該模型在語音合成的自然度與品質上,已獲得國際評測機構的肯定。 在輸出規格方面,Qwen-Audio-3.0-TTS將音頻採樣率從以往的24kHz提升至48kHz,單次語音合成最長可達3分鐘。目前,Plus與Flash兩個版本皆已在阿里雲百鍊平台上線,開發者可直接取用測試。 細粒度標籤控制是此次升級的核心亮點之一。用戶可以在合成文本中插入結構化標籤,例如[gasp]代表抽氣、[giggles]代表輕笑、[angry]代表憤怒等,藉此精準調節語氣、情緒與呼吸等細微表現。官方公布的案例顯示,在一段飛船事故相關的臺詞前加入[angry]標籤後,模型會以憤怒語氣合成後續內容,角色的質問感與緊迫感隨著臺詞逐步增強,效果相當自然。 除了結構化標籤,Qwen-Audio-3.0-TTS也支援Free-style自然語言指令控制。用戶不需調整專業音頻參數,直接用自然語言描述角色、情緒、場景與語速即可。例如,輸入「你是一位年輕女性小學老師,正在課堂上耐心地給一年級學生複述拼音規則,語速很慢,每一個發音都示範一遍,語調上揚帶笑意」,模型便能合成出符合描述的課堂講解錄音。這種方式同樣適用於旁白、角色配音、有聲內容與語音助手等場景,大幅降低語音合成的使用門檻。 官方也展示了懸疑劇旁白的案例:輸入「你是懸疑劇旁白,屏住呼吸把緊張感一層層疊上去」,模型合成的旁白語速顯得急促,營造出明顯的緊張感,讓聽眾彷彿置身故事場景之中。這項功能對於有聲小說、廣播劇等內容製作來說,能夠隨情節調整節奏與情緒,進一步提升聽眾的沉浸感與代入感。 在多語種支援方面,Qwen-Audio-3.0-TTS-Plus覆蓋中文、英語、日語、韓語、德語等16種語言,並新增阿拉伯語、越南語、馬來語與菲律賓語。根據官方公布的CV3-Eval多語種測試結果,Qwen-Audio-3.0-TTS系列在16種語言的詞或字錯誤率評測中,有10種語言排名第一,其中韓語與馬來語的領先幅度較大。在說話人相似度評測方面,Plus版本更是在全部16項語言中取得最優成績,Flash版本則在15項中位居第二,顯示該模型在語音還原度上表現相當出色。 中文方言方面,Qwen-Audio-3.0-TTS目前支援廣東話、重慶話、東北話、陝西話、上海話、四川話與雲南話等20種方言。千問團隊表示,新模型使用了更多方言數據,並增加方言強化訓練階段,讓模型在韻律、聲調與口語表達上更接近母語使用者,同時減少通用語音強化學習過程中可能出現的方言特徵減弱問題。用戶只需透過自然語言指令指定輸出方言,例如輸入「輸出上海話」,模型即可根據後續文本合成上海話語音。 聲音復刻能力在這次升級中也獲得強化。傳統的聲音復刻通常需要較為清晰的參考錄音,但實際取得的音頻常常包含背景噪聲或混響。Qwen-Audio-3.0-TTS加入真實聲學環境仿真訓練,將語音增強能力應用於聲音復刻流程。官方指出,即使參考音頻存在較高噪聲或混響,模型仍能過濾部分環境干擾,並有效提取說話人的音色特徵,進一步提升在複雜環境下的實用性。 從整體升級方向來看,Qwen-Audio-3.0-TTS顯著提升了對於語氣、情緒、呼吸與角色風格的控制能力。結構化標籤適合調節文本中特定位置的表達效果,而自然語言指令則能對角色、場景與語速進行整體描述,兩者相輔相成。多語種、方言以及複雜聲學環境下的聲音復刻能力也獲得擴展,讓這款語音合成模型在應用場景上更加全面。 隨著Plus與Flash版本在阿里雲百鍊平台正式開放,這些技術能力將陸續進入旁白、角色配音、有聲內容與語音助手等實際應用場景,為開發者與內容創作者提供更多元的配音方案。

Related

相關文章

智東西生成式AI

Matrix-Game 3.5WAIC首發!開源世界模型一哥,這次要“造世界”不只是“拍視頻”

智東西(公眾號:zhidxcom) 作者 | 王涵 編輯 | 漠影 要說過去一年AI領域討論最熱的方向,世界模型必須佔有一席之地。 在過去18個月裡,世界模型企業吸納了超過100億美元的投資,圖靈獎得主楊立昆(Yann LeCun)甚至預言三到五年內它將取代大語言模型成為主流AI範式。 與此同時,世界模型的技術瓶頸正在暴露。 長期記憶能力薄弱、相機控制精度不足、實時交互能力有限,多數產品停留在“生成視頻”而非“交互世界”的階段。更重要的是,市面上的世界模型普遍缺乏對物理規則的理解,例如模型能生成一條狗跑動的畫面,卻不明白狗的四條腿為什麼按這個順序落地。 就在這種混亂中,崑崙萬維旗下Skywork團隊在7月19日世界人工智能大會WAIC 2026期間,正式發佈了世界模型Matrix-Game 3.5。 該模型能夠根據用戶動作和事件指令持續生成可交互的世界,並在長時序生成過程中保持場景結構、空間佈局、角色身份和動態內容的一致性,為遊戲、機器人、具身智能和 XR 等應用提供可持續交互的生成基礎。 一、三方面升級,實現端到端實時推理 3.5版本從模型吞吐優化、DiT推理優化和VAE解碼優化三個層面構建了完整的系統級加速方案,實現端到端實時推理。 首先,在模型吞吐優化方面,Skywork團隊通過蒸餾將採樣步數壓縮至3-step Sampling,並設計分塊因果推理(Chunked Causal Inference),結合KV Cache、Patch Latent和預測Latent,在保持生成質量的同時提高單次推理吞吐,顯著降低多步採樣帶來的整體延遲。 其次,在DiT推理優化方面,Skywork團隊還針對推理熱點進行了系統優化,包括FFN INT8量化、Memory Retrieval Optimization以及Torch.compile等推理加速技術,在幾乎不影響模型效果的情況下進

剛剛

2026 WAIC收官:滿場AI新物種背後,藏著物理 AI 的終局線索

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作2026 WAIC收官:滿場AI新物種背後,藏著物理 AI 的終局線索奇點研究社·2026年07月21日 11:58“AI一天,人間一年” WAIC像一面稜鏡,照見了當下中國 AI 產業的完整截面:模型從語言智能向空間智能與具身智能加速躍遷,底層算力正在構建從雲端超集群到端側芯片的國產閉環。沒有統一的終局答案,但所有人都朝著目標篤定前行。 每一屆WAIC,都像一場AI未來世界的預演。 過去幾年,這場盛會的主角還是大模型、多模態、智能體,今年AI開始離開屏幕,進入真實世界。 商湯現場搭了個未來實驗室,機器人“小麥”全程自主完成取貨、製作、遞送交付,未來還能自動補貨和整理貨架;他石智航把一條機器人環形線束流水線搬到了展臺,機器人集群現場展示產線自主作業;加速進化把半個展位改成了小型足球場,不到一米高的機器人自己帶球、搶斷、射門,還會做假動作晃過防守。 這些“形態各異,智商拉滿”的機器人走入消費場景、走進產線,成為我們現實生活中的“夥伴”。 諸多具象的產品落地,也讓這屆WAIC迎來空前熱度。本屆大會共計1100餘家企業參展,近4486項展品亮相,無論是參展規模還是人流量都創下歷史新高。 不過熱鬧背後,也有很多值得追問的行

剛剛

谷歌密謀「焊死」Gemini,神秘芯片曝光,能效碾壓TPU十倍

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作谷歌密謀「焊死」Gemini,神秘芯片曝光,能效碾壓TPU十倍新智元·2026年07月21日 11:47一場豪賭 一覺醒來,谷歌突然就掏出了一張王炸! 據The Information獨家爆料,谷歌正在研發一款代號「Frozen v2」的神秘服務器芯片——把Gemini模型的部分底層架構,永久蝕刻進硅片。 不是跑在芯片上,是長在芯片裡。 參與項目的谷歌員工預計,按每瓦特能處理的Token數量算,這款芯片將比谷歌最新一代TPU高效6到10倍。部署時間,最快2028年。 消息一齣,Alphabet股價週一應聲上漲3.7%,一掃前幾周的陰霾。 「凍結」一個模型 Frozen這個名字,就是字面意思:把模型「凍」進硅片。 這事有多激進?不管是英偉達GPU還是谷歌TPU,本質上都是通用芯片——什麼模型都能跑。 這聽起來很靈活,但代價也很大:芯片在運行時必須做海量的實時決策,不停地搬運數據,反覆查詢該往哪走、該怎麼算。 就像一個什麼菜都能做的後廚,每做一道菜都得現翻菜譜、現找工具、現調火候。效率可想而知。 Frozen v2則只為Gemini一個模型而生。 它把針對Gemini的關鍵決策路徑直接內建進電路——芯片不用再「想」該怎

剛剛
IT之家生成式AI

索尼音樂再次起訴 Udio:指控後者未經許可複製超 3 萬段錄音以訓練 AI

首頁 > IT資訊>業界 索尼音樂再次起訴 Udio:指控後者未經許可複製超 3 萬段錄音以訓練 AI 2026/7/21 11:26:48 來源:IT之家 作者:溯波(實習) 責編:溯波 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 7 月 21 日消息,索尼音樂 (Sony Music) 當地時間本週一向美國紐約南區聯邦地區法院提起訴訟,指控音樂生成式人工智能企業 Udio 為訓練模型未經許可複製超 3 萬段錄音。

剛剛

《2026年 AI 應用市場洞察報告》:競爭、商業與數字經濟新格局

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛
鈦媒體生成式AI

90後清華天才,幹崩了美股

90後清華天才,幹崩了美股深藍財經2026.07.21 10:49 · 來自四川全文2789字00:00 / 07:40月之暗面發佈Kimi K3,綜合能力全球第三,引發美股AI板塊72小時蒸發4700億美元。此前Kimi曾因月活暴跌陷入低谷,後放棄投流競賽,轉向技術驅動,快速迭代模型。K3的成功證明硬實力才是大模型競賽關鍵,公司估值已漲至315億美元。文丨深藍財經,作者丨符小茵7月17日凌晨,大模型圈被一顆“炸彈”驚醒。由90後清華天才楊植麟創立的月之暗面宣佈,新發布的大模型Kimi K3綜合能力全球第三,僅次於Anthropic的Claude Fable 5和OpenAI 的GPT-5.6 Sol。消息一齣,社交媒體被K3刷屏,就連馬斯克都在評論區留下一句“Impressive”(令人印象深刻)。次日,華爾街慌了,美股三大股指全線收跌,費城半導體指數跌入熊市。72小時內,美股AI板塊合計蒸發約4700億美元。誰曾想,幹崩了美股的大模型企業,不久前才因App月活暴跌被認為“掉隊”。如今,只用72小時,Kimi就證明,自己仍是牌桌上那個最具有競爭力的AI企業之一。一場酣暢淋漓的勝利K3有多厲害呢?首先它是全球首個3萬億級別規模且敢於開源的模型,排在它前面的Claude Fable 5和GPT-5.6 Sol均為閉源模型。其次,除了月之暗面披露的測評數據,另一項發佈在AI評測平臺Arena的“戰報”也顯示了K3處於全球第一梯隊——它以1679分登頂前端代碼競技榜榜首,超過了Claude Fable 5。 在前端測評中,K3在7個領域中拿下6個第一,包括數據與分析、內容創作工具、設計等。由於出色的表現,K3很快引發了大西洋彼岸科技圈的強烈震動。有美國學者在K3發佈後認為,中國的開源模型與最先進模型的時間差距可能已由6至9個月縮小到2至3個月。美國市場關於“DeepSeek時刻”

剛剛