騰訊混元發佈 Hy ASR 3.0 preview:語音識別不再逐字硬轉,而是真的聽懂了語境
重點摘要
AI資訊AI新閒資訊正文騰訊混元發佈 Hy ASR 3.0 preview:語音識別不再逐字硬轉,而是真的聽懂了語境發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘騰訊混元今天正式端出了新一代語音識別模型 Hy ASR3.0preview。
騰訊混元近日正式推出新一代語音識別模型 Hy ASR 3.0 preview,這項技術不再只是單純將聲音轉成文字,而是結合深度語義理解,讓模型在轉寫過程中真正「聽懂」使用者想表達的內容。根據官方說法,這款模型從過往的「逐字轉寫、單點優化」進化到「理解語境、兼容場景、一鍵直出」,代表語音識別領域的一次重要躍進。 Hy ASR 3.0 preview 的關鍵,在於它背靠騰訊混元最新一代大語言模型 Hy3 的語言理解能力。傳統語音識別模型往往只處理聲學特徵與字詞對應,遇到同音詞、語意模糊或專業術語時容易出錯;而 Hy ASR 3.0 preview 將高精度語音識別與深度語義理解融為一體,在通用識別、上下文感知、多場景魯棒性以及方言覆蓋等核心維度上全面升級。這使得模型在更複雜的真實輸入環境中,能夠給出準確、連貫、更貼近使用者本意的轉寫結果。 在性能表現上,Hy ASR 3.0 preview 將多個語種的詞錯誤率(WER)壓低至 3% 左右。其中,中文普通話的 WER 達到 3% 以下,英文等語種也維持在相近水準。騰訊在自建評測集上進行測試,無論是通用語音識別、方言識別、上下文理解、專有名詞理解,還是高噪環境、耳語等複雜聲學場景,WER 同樣保持在低位,綜合評測集上取得最低的錯詞率。這項成果顯示模型在真實應用中的可靠性大幅提升。 從使用者實際體驗來看,這一代模型主要圍繞四個方向進行打磨。首先是通用識別更精準。在一般對話、方言、中英文夾雜等場景下,Hy ASR 3.0 preview 進一步壓低錯字與漏字的情況,同時也改善了長音頻中錯誤不斷累積的老問題。過去模型在處理長時間錄音時,容易因前段錯誤導致後段連鎖失誤,如今這項瓶頸獲得明顯緩解。 第二個重點是模型更懂使用者的意圖。Hy ASR 3.0 preview 能夠結合上下文精準捕捉語境,自動修正同音詞、消除語意歧義。例如,當使用者說出「我要去銀行」與「我要去銀行(銀杏)」,模型能根據前後文判斷正確詞彙,而非單純依賴聲學特徵。這種語境感知能力讓轉寫結果更貼近真實溝通邏輯。 第三項改進是更好適配專業場景。Hy ASR 3.0 preview 支援熱詞注入增強機制,允許使用者或企業快速加入品牌名稱、產品型號、人名、行業術語等特定詞彙,讓模型在這些領域的識別準確率大幅提升。這項設計直接降低業務端接入與後續維護的成本,對於醫療、金融、法律、科技等專業領域的應用尤為重要。 第四個面向則是針對複雜聲學環境的魯棒性。除了高噪聲與耳語這類極端情境,模型也著重強化了在吵雜街頭、多人會議、電話錄音等場景下的表現。透過多場景訓練與語義輔助,Hy ASR 3.0 preview 能夠在不利條件下仍維持穩定的轉寫品質,避免因環境干擾而產生大量誤判。 整體而言,騰訊混元 Hy ASR 3.0 preview 的推出,標誌著語音識別技術從單純的聲學轉寫,邁向結合語義理解的智慧型服務。這項模型不僅提升了識別準確率,更讓機器能夠理解人類語言中的細微差異與意圖。未來,這項技術可望廣泛應用於語音助理、會議記錄、客服系統、語音輸入法、字幕生成等場景,進一步改善人機互動的自然度與效率。 隨著大語言模型持續進化,語音識別與語義理解的界線將越來越模糊。騰訊混元此次的嘗試,為業界提供了一個新的技術方向:不再只是把聲音「翻譯」成文字,而是讓機器真正「聽懂」說話者的真實想法。
Related
相關文章

騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 騰訊混元Hy ASR 3.0 preview:讓語音識別理解上下文 允中 2026-08-04 16:58:21 來源:量子位 元寶已接入 8 月 4 日,騰訊混元正式發佈新一代語音識別模型 Hy ASR 3.

博導稱月之暗面 Kimi 創始人楊植麟有很多機會留在美國,但他毅然拒絕蘋果、堅持回國創業
月之暗面創辦人楊植麟的博士生導師透露,楊植麟在攻讀博士期間及畢業後,曾收到蘋果等美國科技巨頭的優渥工作邀約,但他最終放棄這些機會,毅然選擇回國創業。這項決定催生了月之暗面公司及其AI產品Kimi,讓他在短時間內成為中國AI領域的重要人物。
歐盟AI透明度新規生效
歐盟AI透明度新規生效。 歐盟正式實施透明度規則���️方案。詳情可以參考歐盟透明規則執行條例細則。大模型生成的內容必須帶機讀標記。深偽視頻必須向公眾進行明確告知。

近300萬人圍觀卡帕西親測Opus 5:兩小時寫完5500行代碼, 卻連自己寫的遊戲都玩不了
這篇消息聚焦「近300萬人圍觀卡帕西親測Opus 5:兩小時寫完5500行代碼, 卻連自己寫的遊戲都玩不了」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
大模型抗汙染對齊評測框架
大模型抗污染对齐评测框架近日成为关注焦点。该框架旨在系统评估大语言模型在数据污染或对抗干扰下的对齐表现,为检验模型的安全性与鲁棒性提供新的评测维度。 站内已清除先前混入的模型思考或安全判断文字,保持内容纯净,并保留来源可确认的主题供读者追踪,以确保信息准确可溯。
結構化輸出庫有效解決大模型胡言亂語
結構化輸出庫有效解決大模型胡言亂語。 開發者常為語言模型輸出不穩感到頭疼。我們可以用模型結構化輸出開源項目解決此痛點。開源庫支持 (o^^o) 強制模型生成符合模式響應。項目目前在社區已經獲得了超過一萬五千星。這對開發高可靠自動化工作流具有重要意義。