階躍發佈 StepAudio 3 系列語音大模型,拿下多個全球第一

2026年9月15日 15:45
階躍發佈 StepAudio 3 系列語音大模型,拿下多個全球第一
站內 AI 整理稿

作者:遠洋 責編:遠洋 評論: 9 月 15 日消息,今日階躍正式發佈 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜單中位列全球第一。以上五款模型,目前均已上線階躍星辰開放平臺。官方稱,StepAudio 3 系列分別面向幾類核心場景:真人級語音生成、完整音頻內容生成、實時語音交互、複雜場景語音理解和音樂創作。

附模型官方詳細介紹如下:StepAudio 3 Realtime:不僅“能打斷”,更能理解、思考和行動今天,越來越多 Realtime 語音產品已經支持全雙工、打斷和低延遲交互。真正拉開體驗差距的,不只是“能不能同時聽和說”,而是模型能否在一場持續發生的對話中,邊聽邊理解、判斷何時接話,同時完成推理和任務執行。StepAudio 3 Realtime 圍繞這一目標進一步提升實時交互能力,支持原生全雙工實時對話。在 Artificial Analysis Conversational Dynamics 榜單中,StepAudio 3 Realtime 以 98.

9% 的綜合得分排名全球第一,展現出領先的實時語音交互能力。這意味著模型不僅能夠“聽懂”和“回答”,更能夠像真實交流中的人一樣判斷對話節奏 —— 知道什麼時候該回應、什麼時候該等待,以及如何處理用戶的臨時打斷和連續反饋。與此同時,StepAudio 3 Realtime 以 99.7% 的語音推理準確率位列 Artificial Analysis Speech Reasoning 榜單全球第一。Speech Reasoning 聚焦模型直接理解音頻並完成複雜推理任務的能力,是業內評估“原生語音模型”最權威的第三方基準之一。

模型還可以同時理解語義、語氣、情緒、副語言和環境聲音,讓實時交互不只依賴文字內容,而是利用更完整的音頻信息理解用戶意圖。面對複雜問題,StepAudio 3 Realtime 支持推理與語音生成並行,在快速回應的同時繼續組織和深化後續答案。不僅如此,Tool Call 和長任務可以異步執行,不阻塞當前語音會話。任務運行期間,用戶仍然可以繼續交流,結果完成後再自然回到當前上下文。這讓 Realtime 語音模型不只是“更自然地聊天”,而是能夠在同一場持續對話中完成聽、說、想、做。

StepAudio 3 ASR:從聽清,到聽懂傳統語音識別主要解決“聽到了什麼”,但真實世界中的語音往往包含方言、口音、專業術語、同音詞和複雜上下文。真正可用的 ASR 模型,不僅需要準確轉寫聲音,也需要理解說話者表達的含義。StepAudio 3 ASR 將高精度語音識別與大語言模型的上下文理解、知識和推理能力結合,讓語音識別從“辨認聲音”進一步走向“理解語境”。它支持中文、英文、方言、中英混說、長音頻以及專業領域等多類場景識別,能夠適應不同語言環境和表達方式。

同時,依託大語言模型帶來的知識理解能力,StepAudio 3 ASR 能夠更準確識別人名、地名、專業術語等複雜內容,在醫療、法律、金融、汽車、編程等領域提升專業表達的識別效果。模型也能夠處理低聲、快語速、含糊連讀、歌聲和背景音樂等複雜輸入,讓真實聲音環境下的語音被更準確地識別和使用。這意味著,ASR 模型不再只是個聲音轉寫工具,而是能夠更準確地理解、檢索和使用每一段語音內容。在會議紀要、視頻字幕和直播理解、智能客服、車載交互、醫療記錄、金融服務與專業內容生產場景,都能精準地完成任務。

StepAudio 3 ASR 在 Artificial Analysis 非流式語音識別準確性榜單中,WER(詞錯誤率) 僅為 1.7%,並列全球第一。StepAudio 3 TTS:不止朗讀,更像真人表達聲音不僅承載文字信息,也包含語氣、節奏、停頓和情緒等豐富的表達細節。如何讓 AI 生成的語音更接近真實交流,一直是語音生成模型的重要方向。StepAudio 3 TTS 是一款面向實時交互場景的真人級語音生成模型,致力於讓 AI 語音從“準確發聲”走向“自然表達”。

模型在音色基底、語調層次、節奏律動和氣口停頓等方面高度貼合人類自然口語模式,不僅能夠生成文字對應的語音,還能還原笑聲、遲疑、結巴、重複、改口等真實交流中的副語言表現,讓合成語音更接近真人說話。同時,StepAudio 3 TTS 能夠結合語義內容理解表達意圖,自主調整情緒與語氣變化,使聲音表達更加符合具體場景。在實時交互方面,模型基於流式生成架構,實現生成與播放同步進行,可滿足實時語音應用需求。StepAudio 3 Gen:人聲、音效、環境、音樂,一次生成傳統音頻內容生產往往是一條很長的鏈路。角色配音、環境音、音效、背景音樂需要分別製作,再經過剪輯、對齊和混音,才能形成最終作品。

StepAudio 3 Gen 嘗試把這些原本分散的環節統一到一個模型裡。它可以基於自然語言描述和參考音頻,統一生成人聲、音效、環境音和背景音樂。用戶只需要描述角色、場景和劇情,無需針對特定角色或場景進行額外訓練。就可以直接生成具有完整聲音層次的音頻內容。更重要的是,這些聲音並不是簡單疊加。StepAudio 3 Gen 支持對多個角色的音色、說話方式、語氣、情緒、方言口音,以及笑聲、喘息、停頓等副語言特徵進行精細控制,也可以進一步指定對白、音效、環境聲和背景音樂出現的時間與順序。這意味著,模型不僅在“生成聲音”,也開始參與整段內容的聲音設計和時序編排。

對於影視、動畫、遊戲、廣播劇、有聲書和短視頻創作者而言,原本需要素材蒐集、多工具協作和大量後期處理的聲音製作流程,有機會被壓縮到一次生成和持續迭代中。StepAudio 3 Music:不止生成,更參與創作音樂生成模型已經越來越擅長“一句話生成一首歌”。但真正的音樂創作,並不應該是這樣“簡單抽卡”。創作者可能已經有一段歌詞、一段清唱、一句旋律、一段樂譜、或者一個 Demo,希望 AI 接著往下完成編曲、改編和製作。StepAudio 3 Music 因此不僅支持從零生成,也支持基於 ABC 記譜法控制的多輪交互創作。模型支持歌曲創作、清唱配樂、歌曲翻唱等多種功能。

用戶可以提供歌詞、清唱、參考歌曲、ABC 記譜法等多種輸入,讓模型圍繞已有創作繼續生成和完善作品。與此同時,用戶可以通過自然語言直接控制曲風、人聲、旋律、節奏、樂器、情緒、段落和製作質感。模型還對主歌、副歌、橋段、間奏等歌曲結構,以及跨段落的旋律發展、能量變化和演唱表達進行建模,讓生成目標不只是“一段好聽的音樂”,而是一首結構完整、表達連貫的作品。尤其在清唱配樂場景中,用戶只需要提供一段清唱,模型就可以理解其中的旋律、節奏和情緒,並進一步補充和聲、節奏、樂器和完整編曲。一首溫暖柔和的 City Pop 男聲歌曲,帶一點爵士和輕搖滾的感覺,氛圍朦朧浪漫。

這讓音樂大模型開始更深入地進入真實音樂生產流程,而不僅僅是一個“一鍵生成歌曲”的工具。投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:階躍,StepAudio3,AI語音,音頻模型,階躍星辰DeepSeek 開口說話了:灰度測試 AI 語音對話,支持四種音色小米開源工業級目標說話人語音識別大模型 Xiaomi-CocktailASR-1微軟最強轉錄 AI 模型:MAI-Transcribe-2 登場,60 語種平均詞錯誤率 5.2%谷歌發佈 Gemini 3.

5 Transcribe 語音轉文本模型,能自動刪除口頭禪阿里推出國內首個 AI 語音平臺 CosyVoice Studio,限時免費體驗影石產品將上線 AI 語音助手,分區域接入阿里千問和 Gemini 模型

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

1 小時前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

4 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

7 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

8 小時前