千問甩出語音合成大模型Qwen-Audio-3.0-TTS:自然語言直接指揮,實時版首包延遲壓進 300 毫秒
重點摘要
AI資訊AI新閒資訊正文千問甩出語音合成大模型Qwen-Audio-3.0-TTS:自然語言直接指揮,實時版首包延遲壓進 300 毫秒發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘大模型廠商在語音賽道的軍備賽,又多了一名重量級選手。 7 月 20 日,千問正式發佈語音合成大模型Qwen-Audio-3.0-TTS,把說話這件事的控制權,從繁瑣的參數配置交還到了一句自然語言指令手裡。
大模型廠商在語音合成領域的競賽持續升溫,如今又有重量級玩家加入戰局。7月20日,千問(Qwen)正式發表語音合成大模型Qwen-Audio-3.0-TTS,最大的亮點在於將控制語音風格的主導權從繁瑣的參數設定,回歸到一句自然語言指令上。這款新模型主打「Free-style自然語言指令控制」,用戶不再需要像過去那樣在後台調整大量工程參數來指定語氣、節奏或風格,只需用日常語言描述想要的效果,模型就能直接依照指令合成出對應的聲音,大幅降低使用門檻。 千問此次為不同應用場景準備了兩種版本。面向即時互動需求的Flash版本,將首包延遲壓縮到300毫秒等級,這個延遲水準幾乎讓人感覺不到對話中的語音回應停頓,足以支撐即時問答、語音助手等對延遲極度敏感的現場應用。而面向高品質生成的Plus版本,則將火力集中在音質與表現力上,特別適合有聲書、配音、內容創作等需要細膩聲音質感的任務。一條產品線同時涵蓋「快」與「好」這兩條原本互相拉扯的需求曲線,展現出千問對語音合成市場的全面布局。 語音合成技術近年來從基於拼接的單一音色,逐漸走向基於深度學習的多風格、多情感表達。然而,過去許多模型雖然能產出高品質語音,但要讓AI念出特定語氣或節奏,使用者往往需要熟悉複雜的標記語言或參數調整流程。Qwen-Audio-3.0-TTS的出現,正是為了打破這道藩籬。千問團隊表示,這款模型的核心創新在於讓語言模型本身理解自然語言中對聲音的描述,並直接將其映射到聲學特徵上,實現端到端的指令跟隨。 從技術架構來看,Qwen-Audio-3.0-TTS採用千問自研的語音編碼與解碼框架,結合大規模預訓練的語言理解能力。模型在訓練階段學習了大量語音資料與對應的自然語言描述,例如「用低沉、緩慢的語氣朗讀一段悲傷的故事」或「用活潑、輕快的節奏播報新聞」,從而掌握語義與聲學特徵之間的對應關係。這使得模型在推理時,可以直接將用戶輸入的自然語言指令轉化為精確的語音控制信號。 Flash版本的超低延遲是一大亮點。在即時對話場景中,300毫秒的首包延遲意味著使用者幾乎感受不到等待時間,這對於語音助理、客服機器人、即時翻譯等需要快速回應的應用至關重要。千問透露,Flash版本透過輕量化模型架構與推論優化,在保持可接受音質的同時,將延遲壓到極限。而Plus版本則採用更深的模型與更精細的聲碼器,專注於音質、自然度、情感表現力,適合對聲音品質有較高要求的專業創作者。 千問還強調,這款模型支援多種語言與口音,並且能夠在單一模型中同時處理不同語種的混合輸入。對於需要跨語言內容創作的用戶來說,這無疑提升了工作效率。此外,模型也提供對語速、停頓、重音等細微控制,但這些控制同樣可以透過自然語言來達成,例如「在句尾稍微停頓一秒」或「強調『重要』這個詞」。 市場分析人士指出,千問的入局將進一步加劇語音合成領域的競爭。目前包括OpenAI、Google、微軟、百度、字節跳動等廠商都已推出各自的語音合成模型,但多數仍需要透過參數調整或標記語言來控制風格。千問率先將自然語言指令作為主要控制方式,可能成為行業的差異化競爭優勢。對於開發者與內容創作者而言,這意味著更低的學習成本與更快的迭代速度。 在實際應用場景中,Qwen-Audio-3.0-TTS可以廣泛用於有聲書製作、影片配音、虛擬主播、教育培訓、無障礙閱讀、車載語音等領域。例如,出版社可以透過自然語言描述指定旁白的情感與節奏,快速生成不同風格的有聲版本;遊戲開發者可以為不同角色即時生成符合情境的台詞語音;企業則可用於客服系統,讓AI語音根據用戶情緒調整回應語氣。 千問同時公布了模型的開放計畫。據悉,Qwen-Audio-3.0-TTS將透過千問的API平台提供服務,開發者可以選擇Flash或Plus版本,根據實際需求進行串接。千問也將提供預訓練模型的開源版本,供學術研究與非商業用途使用,並計畫在未來陸續推出更多語音相關的基礎模型,包括語音辨識、語音情感分析等,打造完整的語音AI生態系。 從產業趨勢來看,語音合成正從「聽得懂」走向「說得自然」,再進一步邁向「說得符合心意」。千問此次推出的自然語言指令控制,正是對「說得符合心意」這一目標的直接回應。隨著大模型能力的持續提升,未來用戶或許只需要說「用像老朋友聊天一樣的語氣讀這封信」,AI就能自動完成所有細節調整,這一天似乎不再遙遠。 整體而言,Qwen-Audio-3.0-TTS的發布,不僅為千問在語音賽道上補齊了重要拼圖,也為整個行業帶來了新的控制範式。在即時性與高品質之間取得平衡的雙版本策略,更是精準切中了不同市場的需求。可以預見,語音合成技術的下一波進化,將圍繞更自然、更直覺的人機互動展開,而千問的這一步,無疑是重要的里程碑。
Related
相關文章

阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升
首頁 > 智能時代>人工智能 阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升 2026/7/21 19:29:06 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 7 月 21 日消息,據千問大模型官方消息,Qwen3.8-Max-Preview 最新版本已上線,能力又有提升,前端(WebDev)表現會更好。千問大模型稱:“Qwen3.

GPT-5.6-Sol在網絡攻防能力上,超越了Mythos,開源模型也排好了
AISI最新評估顯示,開源與閉源AI模型在網路攻擊能力上的差距已縮小至4到7個月。其中GPT-5.6-Sol在網路攻防能力上超越了Mythos,開源模型也在排行榜上展現出快速追趕的趨勢。

馬斯克槓上Kimi啟示錄:大模型哪有護城河,但模型企業有
馬斯克與中國AI模型Kimi的互動,凸顯大模型技術本身難以建立長期護城河,但模型企業可透過數據生態、品牌效應與商業模式形成競爭優勢。此事件反映產業現實:技術迭代快速,但企業的組織能力與市場基礎才是真正壁壘。

沿用DeepSeek架構,美國大模型開始抄中國作業
沿用DeepSeek架構,美國大模型開始抄中國作業字母AI2026.07.21 13:37 · 來自北京全文5310字00:00 / 14:20貴在美國製造。文 | 字母AIOpenAI前首席技術官穆拉蒂,做出了一款中國模型的“貴替”。Thinking Machines發佈的首款模型Inkling,混合專家架構主要沿用DeepSeek-V3,後訓練冷啟動還使用了Kimi K2.5等開放模型生成的數據。

當AI給出標準答案,人如何“不同凡想”?一場WAIC UP! 思享會撕開的全球追問
好的,這是一篇根據您提供的資料重新撰寫的新聞稿,力求完整、深入,並滿足字數與段落要求。 --- ## AI給出標準答案,人如何「不同凡想」?一場WAIC思享會直擊全球青年的集體困惑 2026年7月,上海世博展覽館,世界人工智慧大會(WAIC)的主會場內,算力、演算法與資本的碰撞激盪著空氣。然而,在幾百米外的一個下沉廣場,一場名為「WAIC UP!」的思享會卻刻意避開了喧囂,沒有權威的致辭,沒有炫目的技術發佈,更沒有動輒數億的合作協議。
