首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放

2026年7月20日 09:346600 次瀏覽

重點摘要

AI資訊AI新閒資訊正文首包延遲300ms、支持20種方言:通義千問Qwen-Audio-3.0-TTS正式開放發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘近日,阿里通義千問團隊正式發佈新一代實時語音合成模型Qwen-Audio-3.0-TTS,推動語音合成從“能說話”邁向“會表達”。

站內 AI 整理稿

阿里通義千問團隊近日正式推出新一代實時語音合成模型 Qwen-Audio-3.0-TTS,這項技術的問世標誌著語音合成從過去單純的「能說話」階段,正式邁入「會表達」的全新時代。該模型包含兩個版本:Flash 版與 Plus 版,分別針對不同應用場景進行優化,其中 Plus 版本已在全球權威評測榜單 Artificial Analysis 的 Speech Arena 中奪下全球第一,綜合表現超越 Gemini 3.1 TTS、ElevenLabs v3 等主流模型,展現出強大的技術實力。

Flash 版主打實時交互,首包延遲僅約 300 毫秒,極適合智能助手、語音客服、車載導航等對低延遲有嚴格要求的場景。這項特性讓使用者幾乎感受不到等待時間,能夠實現流暢自然的對話體驗。而 Plus 版則聚焦高質量生成,在自然度與音色還原度上表現更為突出,特別適合需要高保真語音輸出的內容創作、有聲書製作、影視配音等專業領域。在核心能力方面,Qwen-Audio-3.0-TTS 實現了四大突破,其中最引人注目的是多語種與方言覆蓋的全面升級。該模型支援 16 種語言,而 Plus 版在所有 16 種語言上的平均說話人相似度達到 82.

75,位列行業第一,這意味著它能更精準地還原不同語言母語者的發音習慣與語調特色。更重要的是,該模型同時支援 20 種中文方言,並在設計上刻意避免「方言特色弱化」的問題,讓生成的語音更貼近母語者真實的表達方式,無論是閩南語、粵語、客家話還是其他方言,都能呈現出濃厚的地道韻味。另一項突破是支援 Free-style 自然語言指令。傳統語音合成模型往往需要使用者具備專業知識,透過複雜的參數調整才能改變語音風格。而 Qwen-Audio-3.0-TTS 則徹底簡化這個流程,使用者只需輸入如「溫柔客服語氣」「帶貨主播風格」「溫暖大叔聲音」等日常用語,模型就能精準理解並生成對應的語音輸出。

這項創新大幅降低了語音合成的使用門檻,讓內容創作者、行銷人員、教育工作者等非技術背景的使用者也能輕鬆上手。從技術層面來看,Qwen-Audio-3.0-TTS 的發布不僅是阿里通義千問團隊在語音領域的又一次重要里程碑,也反映出當前 AI 語音技術正朝著更人性化、更直覺的方向演進。過去的語音合成往往給人機械、生硬的印象,而新一代模型透過深度學習與大規模數據訓練,成功捕捉到人類語音中的細微情感變化與語調起伏,讓合成語音聽起來更加自然且富有感染力。在應用場景上,這款模型擁有廣泛的潛力。

例如在智能客服領域,Flash 版的高即時性能讓機器人能夠即時回應客戶問題,同時透過自然語言指令快速切換語氣,從標準的服務語調轉為更加親切友善的溝通方式,提升客戶滿意度。在內容創作領域,Plus 版則能為有聲書、 Podcast、短影音配音提供高品質的語音素材,創作者無需聘請專業聲優,就能快速生成多種風格的聲音內容。此外,支援 20 種方言的特色也讓這項技術在中國市場具有特殊價值。許多地方性服務、方言節目、傳統文化傳承都需要保留方言的原汁原味,Qwen-Audio-3.0-TTS 的出現正好填補了這項需求。

無論是地方電台的方言播報、還是鄉土題材影視作品的後期配音,都能藉助這項技術獲得高品質的方言語音輸出。值得一提的是,Plus 版本在 Artificial Analysis 的 Speech Arena 榜單中獲得全球第一,這項評測涵蓋了多項語音合成指標,包括自然度、音色還原度、語速控制、情感表達等。能夠超越 Gemini 3.1 TTS 與 ElevenLabs v3 等國際知名模型,證明阿里通義千問團隊在語音合成技術上已達到世界領先水準。整體而言,Qwen-Audio-3.0-TTS 的推出不僅為開發者與企業提供了更強大的語音合成工具,也讓一般使用者得以體驗到 AI 語音技術的最新成果。

隨著這項技術逐步整合到各類產品與服務中,未來我們將看到更多具備情感表達能力、能流利使用多種方言、且能即時回應的語音助手與應用場景,進一步拉近人機互動的距離。阿里通義千問團隊也表示,將持續最佳化模型性能,並探索更多創新應用,讓語音合成技術真正融入日常生活。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

3 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

3 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

3 小時前