長音頻不丟詞,行業詞不用教,阿里發佈Qwen-Audio-3.0-ASR-Flash
重點摘要
阿里巴巴發佈語音識別大模型Qwen-Audio-3.0-ASR-Flash,重點強化長音頻上下文一致性、行業詞辨識與熱詞定製,並新增語音潤色功能,可直接輸出結構化文本。該模型無需人工維護詞表即可辨識專業術語,在醫療場景行業詞召回率突破95%,熱詞定製準確率多數場景超過99%。目前模型已在阿里雲百鍊平台開放使用。
阿里巴巴於7月31日正式發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,這次升級鎖定長音頻轉寫、專業術語辨識與熱詞定製三大方向,同時加入語音潤色功能,能直接輸出結構化文本。新模型即日起已在阿里雲百鍊平台開放調用,企業用戶與開發者可前往體驗。在語音識別領域,將每一個字都聽對只是基本功,真正考驗模型能耐的,是在會議、訪談、課程、直播這類長時間音頻中能否維持穩定的辨識品質。Qwen-Audio-3.
0-ASR-Flash此次新增長音頻Context能力,模型在轉寫當前語音片段時,會參考近期已識別的上下文,延續同一段對話中的關鍵詞與語義線索,藉此降低同音字誤判的機率,並提升中英文夾雜表達的辨識準確率。過去長音頻轉寫經常遇到的痛點在於,同一個發音可能對應十幾個同音詞,模型若只看當下幾秒鐘的語音,往往無法判斷該寫哪一個字。有了上下文記憶之後,在一場長達數小時的會議錄音中,同一位發言人的名字、同一個技術概念,不會因為跨越了多個語音片段就被遺忘或認錯。這項能力解決了「說過的詞不再認錯」的問題。然而,許多專業詞彙在整場對話中可能只出現一次,模型必須在從未見過的情況下也能一次聽對。
傳統方案中,行業詞識別高度依賴人工維護詞表,需要花費大量人力逐一建立與更新。Qwen-Audio-3.0-ASR-Flash將這一過程內化為模型自身的能力,無需人工逐一設置,即可在真實業務場景中持續進化。研究團隊透過持續挖掘醫療、IT編程、股票、社會名人等領域的實體詞,構建了覆蓋多個行業的高品質詞庫,並基於這些實體詞合成相關訓練數據,強化模型對專業術語與低頻詞的辨識能力。根據最新的行業詞彙內部評測,新模型的各項行業詞召回率均有顯著提升,其中醫療場景的表現尤為突出,突破了95.36%。行業詞庫固然涵蓋了通用場景,但各行各業仍存在大量長尾詞,例如特定人名、品牌名、產品名以及各類行業內部慣用語。
這些詞語出現頻率低、更新速度快,不可能全部預先安裝進模型之中,因此熱詞定製就成為滿足客製化需求的關鍵功能。傳統熱詞方案長期存在一個矛盾:熱詞加得越多,誤觸發的機率也越高,識別結果反而容易被帶偏。Qwen-Audio-3.0-ASR-Flash對熱詞定製能力進行了全面升級,改採模型結合聲學證據與上下文進行智能判斷的方式,而非簡單的詞彙替換。在傳入熱詞的條件下,熱詞定製化準確率在所有測試集均達到90%以上,多數場景更突破99%。除了辨識能力本身,Qwen-Audio-3.0-ASR-Flash還具備語音潤色功能。
舉例來說,口語中常見的「那個」「嗯」等填充詞會直接被去除;說話時出現的自我修正,例如「我們下週三評審,不對,是週四」,模型只會保留最終意圖;散亂的口述內容也能自動整理為結構化的表達方式。更重要的是,這些潤色工作由ASR模型在識別環節一步完成,不需要再另外呼叫下游的文本大模型,整體鏈路更短、延遲更低,使用成本也相對節省。對於需要即時字幕、會議紀要整理等應用場景而言,這項設計能帶來更直接的使用效益。目前Qwen-Audio-ASR系列已在會議紀要整理、實時字幕、教育錄播、智能客服等場景中獲得廣泛驗證。離線版本曾在全球權威AI評測平台Artificial Analysis上以1.
7%的錯字率位居全球第一,顯示該系列模型在語音識別領域具備國際級競爭力。從技術演進的角度來看,語音識別模型要真正走向行業落地,識準專業詞彙被視為「最後一公里」的關鍵挑戰。此次發布的3.0版本聚焦通用語音識別能力的全面提升,目標不僅是讓每個字都聽對,更要在複雜語境中持續聽對、在專業領域中精準聽對,為各行各業的語音應用提供更可靠的技術基礎。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。