千問甩出語音合成大模型Qwen-Audio-3.0-TTS:自然語言直接指揮,實時版首包延遲壓進 300 毫秒
重點摘要
AI資訊AI新閒資訊正文千問甩出語音合成大模型Qwen-Audio-3.0-TTS:自然語言直接指揮,實時版首包延遲壓進 300 毫秒發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘大模型廠商在語音賽道的軍備賽,又多了一名重量級選手。 7 月 20 日,千問正式發佈語音合成大模型Qwen-Audio-3.0-TTS,把說話這件事的控制權,從繁瑣的參數配置交還到了一句自然語言指令手裡。
大模型廠商在語音合成領域的競賽持續升溫,如今又有重量級玩家加入戰局。7月20日,千問(Qwen)正式發表語音合成大模型Qwen-Audio-3.0-TTS,最大的亮點在於將控制語音風格的主導權從繁瑣的參數設定,回歸到一句自然語言指令上。這款新模型主打「Free-style自然語言指令控制」,用戶不再需要像過去那樣在後台調整大量工程參數來指定語氣、節奏或風格,只需用日常語言描述想要的效果,模型就能直接依照指令合成出對應的聲音,大幅降低使用門檻。千問此次為不同應用場景準備了兩種版本。
面向即時互動需求的Flash版本,將首包延遲壓縮到300毫秒等級,這個延遲水準幾乎讓人感覺不到對話中的語音回應停頓,足以支撐即時問答、語音助手等對延遲極度敏感的現場應用。而面向高品質生成的Plus版本,則將火力集中在音質與表現力上,特別適合有聲書、配音、內容創作等需要細膩聲音質感的任務。一條產品線同時涵蓋「快」與「好」這兩條原本互相拉扯的需求曲線,展現出千問對語音合成市場的全面布局。語音合成技術近年來從基於拼接的單一音色,逐漸走向基於深度學習的多風格、多情感表達。然而,過去許多模型雖然能產出高品質語音,但要讓AI念出特定語氣或節奏,使用者往往需要熟悉複雜的標記語言或參數調整流程。
Qwen-Audio-3.0-TTS的出現,正是為了打破這道藩籬。千問團隊表示,這款模型的核心創新在於讓語言模型本身理解自然語言中對聲音的描述,並直接將其映射到聲學特徵上,實現端到端的指令跟隨。從技術架構來看,Qwen-Audio-3.0-TTS採用千問自研的語音編碼與解碼框架,結合大規模預訓練的語言理解能力。模型在訓練階段學習了大量語音資料與對應的自然語言描述,例如「用低沉、緩慢的語氣朗讀一段悲傷的故事」或「用活潑、輕快的節奏播報新聞」,從而掌握語義與聲學特徵之間的對應關係。這使得模型在推理時,可以直接將用戶輸入的自然語言指令轉化為精確的語音控制信號。Flash版本的超低延遲是一大亮點。
在即時對話場景中,300毫秒的首包延遲意味著使用者幾乎感受不到等待時間,這對於語音助理、客服機器人、即時翻譯等需要快速回應的應用至關重要。千問透露,Flash版本透過輕量化模型架構與推論優化,在保持可接受音質的同時,將延遲壓到極限。而Plus版本則採用更深的模型與更精細的聲碼器,專注於音質、自然度、情感表現力,適合對聲音品質有較高要求的專業創作者。千問還強調,這款模型支援多種語言與口音,並且能夠在單一模型中同時處理不同語種的混合輸入。對於需要跨語言內容創作的用戶來說,這無疑提升了工作效率。
此外,模型也提供對語速、停頓、重音等細微控制,但這些控制同樣可以透過自然語言來達成,例如「在句尾稍微停頓一秒」或「強調『重要』這個詞」。市場分析人士指出,千問的入局將進一步加劇語音合成領域的競爭。目前包括OpenAI、Google、微軟、百度、字節跳動等廠商都已推出各自的語音合成模型,但多數仍需要透過參數調整或標記語言來控制風格。千問率先將自然語言指令作為主要控制方式,可能成為行業的差異化競爭優勢。對於開發者與內容創作者而言,這意味著更低的學習成本與更快的迭代速度。在實際應用場景中,Qwen-Audio-3.
0-TTS可以廣泛用於有聲書製作、影片配音、虛擬主播、教育培訓、無障礙閱讀、車載語音等領域。例如,出版社可以透過自然語言描述指定旁白的情感與節奏,快速生成不同風格的有聲版本;遊戲開發者可以為不同角色即時生成符合情境的台詞語音;企業則可用於客服系統,讓AI語音根據用戶情緒調整回應語氣。千問同時公布了模型的開放計畫。據悉,Qwen-Audio-3.0-TTS將透過千問的API平台提供服務,開發者可以選擇Flash或Plus版本,根據實際需求進行串接。
千問也將提供預訓練模型的開源版本,供學術研究與非商業用途使用,並計畫在未來陸續推出更多語音相關的基礎模型,包括語音辨識、語音情感分析等,打造完整的語音AI生態系。從產業趨勢來看,語音合成正從「聽得懂」走向「說得自然」,再進一步邁向「說得符合心意」。千問此次推出的自然語言指令控制,正是對「說得符合心意」這一目標的直接回應。隨著大模型能力的持續提升,未來用戶或許只需要說「用像老朋友聊天一樣的語氣讀這封信」,AI就能自動完成所有細節調整,這一天似乎不再遙遠。整體而言,Qwen-Audio-3.0-TTS的發布,不僅為千問在語音賽道上補齊了重要拼圖,也為整個行業帶來了新的控制範式。
在即時性與高品質之間取得平衡的雙版本策略,更是精準切中了不同市場的需求。可以預見,語音合成技術的下一波進化,將圍繞更自然、更直覺的人機互動展開,而千問的這一步,無疑是重要的里程碑。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。

內部賽馬暫停,騰訊、阿里、字節AI辦公產品“合兵”對陣
過去半年,騰訊、阿里巴巴、字節跳動等大廠在AI辦公產品領域經歷內部賽馬後,近期紛紛收攏資源,推出整合方案。騰訊將QClaw業務調整至雲產品六部,與WorkBuddy統一管理;阿里整合三款產品推出千問辦公;字節則將飛書團隊併入豆包。市場數據顯示,6月國內AI辦公智能體平臺月訪問量突破6000萬次,顯示此領域競爭日益激烈。