騰訊混元發佈Hy ASR3.0preview:語音識別邁入“懂語境”新階段
重點摘要
AI資訊AI新閒資訊正文騰訊混元發佈Hy ASR3.0preview:語音識別邁入“懂語境”新階段發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘今日,騰訊混元正式推出新一代語音識別模型Hy ASR3.0preview,首次將大語言模型Hy3的深度語義理解能力與高精度語音識別深度融合,推動語音識別從“逐字轉寫、單點優化”向“理解語境、兼容場景、一鍵直出”跨越。
騰訊混元今日正式推出新一代語音識別模型Hy ASR 3.0 preview,這是該團隊首度將大型語言模型Hy3的深度語義理解能力,與高精度語音識別技術進行深度融合。這項嘗試讓語音識別不再只是單純的逐字轉寫,而是進一步走向理解語境、相容多元場景、一次到位的全面升級,被視為語音技術發展歷程中的一次關鍵轉折。 過去語音識別系統大多強調單點優化,例如在安靜環境下提高準確率,或針對特定口音進行調校,但面對真實世界多變的說話方式與背景噪音,往往難以兼顧全面表現。Hy ASR 3.0 preview的設計理念,是讓模型不只知道使用者說了什麼,更能掌握當下語境與意圖,從根本上改變語音互動的體驗方式。 根據官方公開的評測數據,Hy ASR 3.0 preview在多項開源評測集上都展現出色表現。在中文普通話部分,詞錯誤率低至3.34%,英語為2.62%,粵語則達到3.12%,整體水準控制在3%左右,顯示模型在主要語言的辨識穩定度上已具備高度成熟度。 除了標準語言之外,騰訊混元也建置了自有的評測資料集,涵蓋通用語音識別、十多種方言、上下文語義理解、專業術語辨識,以及高噪音環境、耳語等複雜聲學場景。在這些更具挑戰性的條件下,Hy ASR 3.0 preview的詞錯誤率依然維持在業界領先水準,展現出應對真實應用的韌性。 技術架構方面,Hy ASR 3.0 preview的能力升級來自全鏈路的系統性優化。模型採用兼顧運算效率與辨識效能的MoE架構,並將基座模型升級為Hy3大語言模型,同時配備自主研發的無監督語音Encoder。這套Encoder在數千萬小時等級的語音資料上進行訓練,大幅強化了聲學特徵的提取能力,讓模型能更細緻地捕捉語音中的關鍵訊息。 在預訓練階段,團隊特別將語音Encoder與大語言模型進行聯合訓練,並導入涵蓋多方言、多口音、多聲學環境的海量資料。透過多階段的能力注入策略,模型逐步強化對方言的辨識力,也建立起對上下文語境的感知能力。這樣的做法讓Hy ASR 3.0 preview在理解層次上遠超過傳統語音辨識系統。 進入後訓練環節後,騰訊混元也投注大量心力在細節打磨上。團隊建構了覆蓋超過20個方言小片區的SFT資料集,並結合多階段強化學習策略,針對複雜場景下容易出現的誤識別、漏識別問題進行反覆修正。這一系列訓練流程,使得模型在面對口音混雜、語速變化或背景干擾時,仍能維持穩定的輸出品質。 目前Hy ASR 3.0 preview已經正式上架騰訊雲官網,對外開放API服務,外界開發者與企業用戶皆可申請使用。這項技術可廣泛應用於智慧客服、內容理解、語音搜尋等領域,為各類語音驅動的應用場景提供更精準的底層支援。 騰訊旗下的AI助手「元寶」也已完成首波接入,使用者現在可以透過語音輸入功能,實際體驗Hy ASR 3.0 preview帶來的多項升級,包括方言辨識、上下文智慧糾錯,以及在複雜環境下維持穩定轉寫的能力。值得注意的是,相關功能目前採免費開放策略,一般用戶也能直接感受新一代語音識別技術的進步。另一方面,WorkBuddy等企業級產品也正陸續跟進接入,預期將進一步擴大這項技術的應用觸角。 業界普遍認為,這次Hy ASR 3.0 preview的發布,代表語音識別技術正從「聽得清楚」邁向「聽得懂」的新階段。當模型能夠真正理解使用者的意圖,語音互動就不再只是指令的傳遞,而是更自然、更貼近人類溝通的橋樑。隨著後續更多產品接入與應用場景開拓,這項技術可望為智慧裝置、客戶服務、內容生產等領域,帶來更深層的體驗變革。
Related
相關文章

物理AI不是下一個風口,而是下一輪工業革命
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

開源版Claude Science來了,零依賴、MIT協議,內置30+項科研Skills
賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

首部AIGC故事片《奇譚》,究竟是怎麼做出來的?
首部AIGC故事片《奇譚》,究竟是怎麼做出來的?文娛先聲2026.08.04 17:56 · 來自北京全文4045字從製作流程到商業化路徑,《奇譚》的探索證明,AI影視的發展並非簡單替代傳統影視,而是在人工創意與AI能力結合下,重新定義影視生產方式。文 | 文娛先聲,作者 | 王燁 AI影視,迎來了首部獲得官方發行許可的長片作品。近期,《奇譚:紙刃渡荒墟》(以下簡稱《奇譚》)在愛奇藝正式上線。

斷電0.01秒燒掉幾十萬:AI最隱秘的暴利賽道,中企瘋搶
AI 的運算能力正在成為這個時代最稀缺的資源,但支撐這一切運轉的,除了那些昂貴的圖形處理器(GPU),還有一套外界幾乎看不見的電力系統。每天有無數人對著人工智慧對話框輸入指令、要求生成圖片或影片,每一次請求的背後,都是成千上萬顆GPU在瞬間進入滿載狀態。這些晶片的用電模式和傳統數據中心截然不同,過去機房的電力負載相對平穩,現在AI的GPU則像一輛在怠速與全油門之間來回切換的跑車,用電量在毫秒級別內暴起暴落。

120萬星!開發者排隊“投簡歷”,DeepSeek一條內測帖,變成了Agent開源大摸底
DeepSeek的Agent Harness團隊負責人崔添翼於8月1日發文招募內測人員,吸引769位開發者提交712個開源倉庫,合計超過120萬Stars,涵蓋長任務執行、記憶管理與安全評測等Agent基礎設施方向。社區推測DeepSeek可能基於Harness打造對標Claude Code的AI Coding Agent,但官方尚未證實。這場招募意外揭露了Agent工程化的關鍵能力版圖,包括穩定執行、上下文管理與安全控制等挑戰。

OpenAI公開62頁核心手稿,AI連破十大「菲爾茲獎級」難題
OpenAI公開一份62頁核心手稿,詳細展示下一代模型Astra如何獨立破解十大「菲爾茲獎級」數學難題,燒掉的Token成本僅約2000美元。手稿揭露了AI重構解題思路的過程,包含高維球體堆積、非sofic群等多年未解的重大問題。OpenAI強化學習負責人形容此事比任何時刻都更像「奇點前夜」。