ElevenLabs 推出 v4 和 v4 Turbo 語音模型:支持 90 餘種語言,10 秒素材即可克隆聲音

2026年9月29日 07:29
ElevenLabs 推出 v4 和 v4 Turbo 語音模型:支持 90 餘種語言,10 秒素材即可克隆聲音
站內 AI 整理稿

作者:遠洋 責編:遠洋 評論: 9 月 29 日消息,ElevenLabs 於當地時間週一正式推出了兩款全新語音模型,分別為 ElevenLabs v4 與 v4 Turbo。新版模型強化了情緒表達控制能力,降低了語音智能體的響應延遲,同時支持 90 餘種語言。該公司去年發佈了 v3 模型,並於今年早些時候在華沙舉辦的活動上對新一代模型進行了預熱。v4 系列採用全新架構,實現了更精細的語音控制以及速度更快的聲音克隆。官方表示,藉助 v4,用戶僅需 10 秒音頻素材即可完成語音克隆。

在內容創作方面,當朗讀大段文本時,新版模型可以更好地維持說話人的音色特徵;朗讀過程中還能夠記住前後文本語境,隨之調整語氣。ElevenLabs 曾在 v3 版本當中引入內聯標籤用以設定語音情緒;到了 v4,標籤功能得到進一步擴充,用戶可以疊加多個標籤,模型將按照標籤的先後順序執行。舊版模型支持 70 種語言。經過優化之後,新版本的語言支持數量提升至 90 種。這家初創企業稱,日語、巴西葡萄牙語、普通話以及粵語的合成質量提升最為顯著。過去一年,ElevenLabs 的企業語音通話業務擴張迅速,目前超過 55% 的業務收入來自大型企業。

官方指出,新模型非常適配語音智能體場景:更低的延遲可以帶來更加流暢的對話體驗。除此之外,當後端大語言模型剛開始輸出回答時,v4 就可以同步生成語音音頻。不僅如此,該模型還能夠差異化地處理爭執對話、訴求升級以及通話等待場景,以此更好地解決業務問題。今年早些時候,ElevenLabs 從紅杉資本(Sequoia)獲得 5 億美元(注:現匯率約合 33.6 億元人民幣)融資,本輪投後估值達到 110 億美元(現匯率約合 739.14 億元人民幣)。目前已有傳聞稱該公司正在籌備新一輪融資,目標估值或將達到 220 億美元(現匯率約合 1,478.29 億元人民幣)。

ElevenLabs 的年化營收運行速率已經從年初約 3.3 億美元(現匯率約合 22.17 億元人民幣)攀升至 6 億美元(現匯率約合 40.32 億元人民幣)以上。公司還在印度、歐洲、巴西等多個市場大舉招人,員工總人數現已突破 800 人。在近期接受 TechCrunch 採訪時,聯合創始人兼首席執行官馬蒂 · 斯坦尼舍夫斯基(Mati Staniszewski)表示,公司計劃“未來幾年內”完成 IPO 上市,但並未給出確切時間節點。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:ElevenLabs,語音模型科大訊飛發佈全新語音識別大模型 Spark-ASR-2.

0,明日上線訊飛輸入法阿里千問發佈 Qwen-Audio-3.1 系列語音大模型,並下調全線產品價格基於全國產化算力訓練,訊飛星火語音基座大模型 Spark-Audio-1.0-Preview 上線谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 實時對話模型,支持 97 種語言切換階躍發佈 StepAudio 3 系列語音大模型,拿下多個全球第一小米開源工業級目標說話人語音識別大模型 Xiaomi-CocktailASR-1

Related

相關文章

Fireworks AI 推出 FireRouter with Opus:編碼任務成本降 57%,準確率僅損失 1.5 個百分點

經過一個多月的內部 A/B 測試,該方案執行編碼任務的準確率達到單獨使用 Opus 的98.1%,而成本降低了57%。FireRouter 的核心邏輯是在每次用戶輪次中,評估模型集合中每個模型對當前任務的適合程度,估算每個模型的處理成本(包括提示緩存成本),並權衡切換模型帶來的節省與丟失緩存是否值得,最終路由到質量與成本之間取得最佳平衡的模型。

剛剛