首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放
重點摘要
AI資訊AI新閒資訊正文首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘近日,阿里通義千問團隊正式發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,推動語音合成從“能說話”邁向“會表達”。
阿里通義千問團隊近日正式推出新一代實時語音合成模型 Qwen-Audio-3.0-TTS,這項技術的問世標誌著語音合成從過去單純的「能說話」階段,正式邁入「會表達」的全新時代。該模型包含兩個版本:Flash 版與 Plus 版,分別針對不同應用場景進行優化,其中 Plus 版本已在全球權威評測榜單 Artificial Analysis 的 Speech Arena 中奪下全球第一,綜合表現超越 Gemini 3.1 TTS、ElevenLabs v3 等主流模型,展現出強大的技術實力。 Flash 版主打實時交互,首包延遲僅約 300 毫秒,極適合智能助手、語音客服、車載導航等對低延遲有嚴格要求的場景。這項特性讓使用者幾乎感受不到等待時間,能夠實現流暢自然的對話體驗。而 Plus 版則聚焦高質量生成,在自然度與音色還原度上表現更為突出,特別適合需要高保真語音輸出的內容創作、有聲書製作、影視配音等專業領域。 在核心能力方面,Qwen-Audio-3.0-TTS 實現了四大突破,其中最引人注目的是多語種與方言覆蓋的全面升級。該模型支援 16 種語言,而 Plus 版在所有 16 種語言上的平均說話人相似度達到 82.75,位列行業第一,這意味著它能更精準地還原不同語言母語者的發音習慣與語調特色。更重要的是,該模型同時支援 20 種中文方言,並在設計上刻意避免「方言特色弱化」的問題,讓生成的語音更貼近母語者真實的表達方式,無論是閩南語、粵語、客家話還是其他方言,都能呈現出濃厚的地道韻味。 另一項突破是支援 Free-style 自然語言指令。傳統語音合成模型往往需要使用者具備專業知識,透過複雜的參數調整才能改變語音風格。而 Qwen-Audio-3.0-TTS 則徹底簡化這個流程,使用者只需輸入如「溫柔客服語氣」「帶貨主播風格」「溫暖大叔聲音」等日常用語,模型就能精準理解並生成對應的語音輸出。這項創新大幅降低了語音合成的使用門檻,讓內容創作者、行銷人員、教育工作者等非技術背景的使用者也能輕鬆上手。 從技術層面來看,Qwen-Audio-3.0-TTS 的發布不僅是阿里通義千問團隊在語音領域的又一次重要里程碑,也反映出當前 AI 語音技術正朝著更人性化、更直覺的方向演進。過去的語音合成往往給人機械、生硬的印象,而新一代模型透過深度學習與大規模數據訓練,成功捕捉到人類語音中的細微情感變化與語調起伏,讓合成語音聽起來更加自然且富有感染力。 在應用場景上,這款模型擁有廣泛的潛力。例如在智能客服領域,Flash 版的高即時性能讓機器人能夠即時回應客戶問題,同時透過自然語言指令快速切換語氣,從標準的服務語調轉為更加親切友善的溝通方式,提升客戶滿意度。在內容創作領域,Plus 版則能為有聲書、 Podcast、短影音配音提供高品質的語音素材,創作者無需聘請專業聲優,就能快速生成多種風格的聲音內容。 此外,支援 20 種方言的特色也讓這項技術在中國市場具有特殊價值。許多地方性服務、方言節目、傳統文化傳承都需要保留方言的原汁原味,Qwen-Audio-3.0-TTS 的出現正好填補了這項需求。無論是地方電台的方言播報、還是鄉土題材影視作品的後期配音,都能藉助這項技術獲得高品質的方言語音輸出。 值得一提的是,Plus 版本在 Artificial Analysis 的 Speech Arena 榜單中獲得全球第一,這項評測涵蓋了多項語音合成指標,包括自然度、音色還原度、語速控制、情感表達等。能夠超越 Gemini 3.1 TTS 與 ElevenLabs v3 等國際知名模型,證明阿里通義千問團隊在語音合成技術上已達到世界領先水準。 整體而言,Qwen-Audio-3.0-TTS 的推出不僅為開發者與企業提供了更強大的語音合成工具,也讓一般使用者得以體驗到 AI 語音技術的最新成果。隨著這項技術逐步整合到各類產品與服務中,未來我們將看到更多具備情感表達能力、能流利使用多種方言、且能即時回應的語音助手與應用場景,進一步拉近人機互動的距離。阿里通義千問團隊也表示,將持續最佳化模型性能,並探索更多創新應用,讓語音合成技術真正融入日常生活。
Related
相關文章

更多Token、更多芯片,Kimi K3體現“傑文斯悖論”,效率提升反而增加資源消耗
這篇消息聚焦「更多Token、更多芯片,Kimi K3體現“傑文斯悖論”,效率提升反而增加資源消耗」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

「月泉仿生」獲數億元融資,仿生拉壓體靈巧手萬臺量產、訂單過億|36氪首發
好的,這是一篇根據您提供的資料重寫及擴充的完整新聞稿。 --- ### 「月泉仿生」獲數億元融資,仿生拉壓體靈巧手實現萬臺量產,訂單突破億元大關|36氪獨家 隨著人形機器人賽道從概念驗證階段邁向商業化的深水區,作為機器人與物理世界交互的核心執行器,靈巧手正成為資本與技術角逐的焦點戰場。然而,傳統剛性結構在追求高自由度與高負載的同時,往往犧牲了輕量化與操作的柔順性,陷入「有力就僵硬、輕巧就無力」的技術瓶頸。在此背景下,一款從底層機械結構進行顛覆性創新的產品,或許正在為行業打開新的突破口。

當開源模型逼近閉源,誰會成為 AI 世界的路由器?
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業。

月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部
首頁 > 智能時代>人工智能 月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部 2026/7/20 22:20:14 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 7 月 20 日消息,近日,月之暗面發佈的新一代開源大模型 Kimi K3 登頂全球榜單,引發廣泛關注。7 月 18 日上午,埃隆 · 馬斯克(Elon Musk)在社交平臺發文稱,旗下 2 萬億參數模型在各方面都優於當前的 1.

WAIC之夜:Token堆不出“AI原生”組織
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作WAIC之夜:Token堆不出“AI原生”組織36氪的朋友們·2026年07月20日 21:09Tokenmaxing的終局與新序章 2026年上半年,AI行業最熱的兩個詞是Agent和Tokenmaxing。前者意味著模型開始從“回答問題”走向“完成任務”,後者希望通過更長上下文、更多推理步驟和更高的Token消耗,換取更復雜的任務能力。 但Tokenmaxing很快暴露出另一面。為了讓公司成為更“AI原生”的組織,一些企業把Token消耗量當作轉型指標,甚至納入團隊KPI。調用量不斷增長,實際產出、任務完成率和商業回報卻未必同步提升。行業由此開始重新討論:Token真正的價值,究竟來自消耗規模,還是來自它所進入的產品、工作流和組織系統? 7月17日晚,在2026世界人工智能大會(WAIC)舉辦期間,由騰訊新聞、騰訊科技主辦,騰訊華東總部、騰訊雲智能特別支持的“騰訊WAIC之夜”在上海舉行。騰訊科技高級編輯、AI未來指北主理人郭曉靜主持首場圓桌,崑崙萬維董事長兼CEO方漢、出門問問創始人兼CEO李志飛、沐曦股份聯合創始人、CTO楊建,圍繞模型、產品與組織三個層面,討論了Tokenmaxing退潮後浮現出的新問題。
Alibaba’s Tongyi Lab Releases Qwen-Audio-3.0-TTS, a Hosted Text-to-Speech Model in Flash and Plus Tiers Across 16 Languages
Alibaba’s Tongyi Lab has released Qwen-Audio-3.0-TTS, a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation.