雷峰網生成式AI

長音頻不丟詞,行業詞不用教,阿里發佈Qwen-Audio-3.0-ASR-Flash

2026年7月31日 06:48

重點摘要

阿里巴巴發佈語音識別大模型Qwen-Audio-3.0-ASR-Flash,重點強化長音頻上下文一致性、行業詞辨識與熱詞定製,並新增語音潤色功能,可直接輸出結構化文本。該模型無需人工維護詞表即可辨識專業術語,在醫療場景行業詞召回率突破95%,熱詞定製準確率多數場景超過99%。目前模型已在阿里雲百鍊平台開放使用。

站內 AI 整理稿

阿里巴巴於7月31日正式發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,這次升級鎖定長音頻轉寫、專業術語辨識與熱詞定製三大方向,同時加入語音潤色功能,能直接輸出結構化文本。新模型即日起已在阿里雲百鍊平台開放調用,企業用戶與開發者可前往體驗。 在語音識別領域,將每一個字都聽對只是基本功,真正考驗模型能耐的,是在會議、訪談、課程、直播這類長時間音頻中能否維持穩定的辨識品質。Qwen-Audio-3.0-ASR-Flash此次新增長音頻Context能力,模型在轉寫當前語音片段時,會參考近期已識別的上下文,延續同一段對話中的關鍵詞與語義線索,藉此降低同音字誤判的機率,並提升中英文夾雜表達的辨識準確率。 過去長音頻轉寫經常遇到的痛點在於,同一個發音可能對應十幾個同音詞,模型若只看當下幾秒鐘的語音,往往無法判斷該寫哪一個字。有了上下文記憶之後,在一場長達數小時的會議錄音中,同一位發言人的名字、同一個技術概念,不會因為跨越了多個語音片段就被遺忘或認錯。這項能力解決了「說過的詞不再認錯」的問題。 然而,許多專業詞彙在整場對話中可能只出現一次,模型必須在從未見過的情況下也能一次聽對。傳統方案中,行業詞識別高度依賴人工維護詞表,需要花費大量人力逐一建立與更新。Qwen-Audio-3.0-ASR-Flash將這一過程內化為模型自身的能力,無需人工逐一設置,即可在真實業務場景中持續進化。 研究團隊透過持續挖掘醫療、IT編程、股票、社會名人等領域的實體詞,構建了覆蓋多個行業的高品質詞庫,並基於這些實體詞合成相關訓練數據,強化模型對專業術語與低頻詞的辨識能力。根據最新的行業詞彙內部評測,新模型的各項行業詞召回率均有顯著提升,其中醫療場景的表現尤為突出,突破了95.36%。 行業詞庫固然涵蓋了通用場景,但各行各業仍存在大量長尾詞,例如特定人名、品牌名、產品名以及各類行業內部慣用語。這些詞語出現頻率低、更新速度快,不可能全部預先安裝進模型之中,因此熱詞定製就成為滿足客製化需求的關鍵功能。 傳統熱詞方案長期存在一個矛盾:熱詞加得越多,誤觸發的機率也越高,識別結果反而容易被帶偏。Qwen-Audio-3.0-ASR-Flash對熱詞定製能力進行了全面升級,改採模型結合聲學證據與上下文進行智能判斷的方式,而非簡單的詞彙替換。在傳入熱詞的條件下,熱詞定製化準確率在所有測試集均達到90%以上,多數場景更突破99%。 除了辨識能力本身,Qwen-Audio-3.0-ASR-Flash還具備語音潤色功能。舉例來說,口語中常見的「那個」「嗯」等填充詞會直接被去除;說話時出現的自我修正,例如「我們下週三評審,不對,是週四」,模型只會保留最終意圖;散亂的口述內容也能自動整理為結構化的表達方式。 更重要的是,這些潤色工作由ASR模型在識別環節一步完成,不需要再另外呼叫下游的文本大模型,整體鏈路更短、延遲更低,使用成本也相對節省。對於需要即時字幕、會議紀要整理等應用場景而言,這項設計能帶來更直接的使用效益。 目前Qwen-Audio-ASR系列已在會議紀要整理、實時字幕、教育錄播、智能客服等場景中獲得廣泛驗證。離線版本曾在全球權威AI評測平台Artificial Analysis上以1.7%的錯字率位居全球第一,顯示該系列模型在語音識別領域具備國際級競爭力。 從技術演進的角度來看,語音識別模型要真正走向行業落地,識準專業詞彙被視為「最後一公里」的關鍵挑戰。此次發布的3.0版本聚焦通用語音識別能力的全面提升,目標不僅是讓每個字都聽對,更要在複雜語境中持續聽對、在專業領域中精準聽對,為各行各業的語音應用提供更可靠的技術基礎。

Related

相關文章

MarkTechPost AI生成式AI

JetBrains Open-Sources KotlinLLM: Smart Macros That Generate Kotlin Source Code at Runtime and Hot-Reload It Through JDI

JetBrains Research 開源 KotlinLLM,這款 IntelliJ IDEA 外掛為 Kotlin/JVM 專案加入 Smart macros 語言功能,可在執行階段產生 Kotlin 原始碼並透過 JDI 熱重載。根據測試,在改寫的 Spring Petclinic 專案中 24 個情境全部成功,熱重載成功率 100%,編譯與重定義僅增加約 1% 執行開銷。此專案屬研究原型,採用 Apache License 2.0,需搭配 IntelliJ IDEA 2025.2.x、JDK 21 與 OpenAI API 金鑰。

6 分鐘前

微信公眾號推出 AI"一鍵排版":自動分段、生成小標題、匹配配圖三步到位

微信公眾號平台正式推出 AI「一鍵排版」功能,創作者在手機 App 或網頁版編輯文章時,系統會自動識別內容並彈出排版圖標,一鍵完成整套排版。功能涵蓋自動分段與調整間距、自動生成小標題樣式,以及智慧調整圖片大小與對齊,並支援多圖轉輪播。目前提供「標準」與「細體」兩種風格,讓創作者能快速完成從碼字到發布前的排版工作。

39 分鐘前6800

DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題

AI資訊AI新閒資訊正文DeepSeek V4 正式版疑定檔 8 月 3 日:硅基流動漲價露馬腳,API 已能答對新題發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘DeepSeek V4 正式版自 7 月中旬開啟灰度測試後一度跳票,官方至今未公佈確切發佈時間。但多個新證據指向 8 月 3 日可能成為重要節點——硅基流動率先露出馬腳。

2 小時前8400

AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線

AI資訊最新AI日報正文AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線發布於最新AI日報時間 :Jul 31, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。

2 小時前

韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型

LG AI研究院發布韓國最大AI基礎模型K-EXAONE 2.0,總參數達7500億,採用混合注意力MoE架構,並以Apache 2.0許可證完全開源。該模型在多項基準測試中表現優於初代,同時在長上下文理解與智能體工具使用等能力上直接對標智譜GLM-5.1、Qwen3.5等中國開源模型,顯示東亞開源AI競爭加劇。

2 小時前5500

顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了

字節跳動Seed團隊正式推出新一代音視頻聯合生成模型Seedance2.5,主打「一鏡成片」,單次生成時長由15秒提升至30秒,並支援多輪無縫延長。模型強化長敘事、多模態參考與後期編輯能力,並優化材質、光影與膚質,呈現更接近實拍的影視級質感。目前Seedance2.5正陸續登陸即夢AI、豆包專業版,API則將於近期上線火山方舟。

2 小時前6700