阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景"最後一公里"

2026年7月31日 06:003600 次瀏覽

重點摘要

阿里通義千問發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打長音頻上下文記憶與內建多行業詞庫,醫療、IT等專業術語無需配置即可精準識別。該模型支援30餘種語言,並整合語音潤色功能,已在阿里雲百鍊平台開放調用。同步推出的Streaming版本鎖定即時場景,延遲僅300毫秒,系列先前於評測拿下全球第一。

站內 AI 整理稿

阿里通義千問於7月31日正式推出新一代語音識別大模型Qwen-Audio-3.0-ASR-Flash,這款模型主打「長音頻不丟詞、行業詞不用教」,目前已於阿里雲百鍊平台開放API調用,鎖定專業場景中語音轉寫的「最後一公里」難題。 此次發佈的Qwen-Audio-3.0-ASR-Flash在五大核心維度上進行了全面升級。首先是長音頻上下文記憶能力,模型在轉寫過程中能夠參考前文語義,確保長達數小時會議中提及的人名、技術概念等關鍵資訊從頭到尾保持一致,徹底告別跨片段時常見的「斷片」問題。 其次,模型內建了多行業專業詞庫,涵蓋醫療、IT編程等領域。在醫療場景中,專業詞彙的召回率達到95.36%,而在IT編程場景中則為91.87%,無須人工額外配置即可精準識別各類冷門術語,大幅降低企業導入門檻。 第三,Qwen-Audio-3.0-ASR-Flash支援分級熱詞定製功能,企業可即時將專屬詞彙加入模型,多數場景下召回率可突破99%,且不會因熱詞數量增加而導致誤觸發,提供更穩定的識別表現。 第四項升級是整合語音潤色功能,模型能夠在單一步驟中完成去除口頭禪、清理重複語句、處理自我糾正以及語義重組,輸出結果的可讀性已接近傳統「ASR加上大模型潤色」的兩步方案,有效降低後續處理成本。 第五,該模型以一組架構覆蓋超過30種語言,在七種主要語言的測試中,平均語義錯誤率僅為17.09%,表現優於Azure、Gemini等國際同業模型,特別適合跨國會議與出海客服等場景使用。 同步推出的還有Qwen-Audio-3.0-ASR-Streaming,這款針對即時場景設計的模型理論出字延遲僅300毫秒。在中文工業場景中,其錯字率為7.80%,英文場景則為11.52%,整體表現領先業界。該系列模型此前已在Artificial Analysis評測中,以1.7%的錯字率拿下全球第一,技術實力備受肯定。 Qwen-Audio-3.0-ASR-Flash的應用場景相當廣泛,包括會議紀要生成、即時字幕、教育錄播以及智慧客服等領域。透過內建行業詞庫與長上下文記憶能力,企業在處理專業領域語音內容時,不再需要額外訓練專屬模型或手動調整詞庫,即可獲得高品質的轉寫結果。 阿里通義實驗室在語音辨識領域已有長期布局,例如先前推出的Fun-ASR系列模型,同樣支援全球30種語言與漢語七大方言,並在演算法架構上持續迭代。此次Qwen-Audio-3.0-ASR-Flash的發佈,進一步強化了阿里在語音AI領域的技術深度與產品完整性。 從市場角度來看,隨著企業數位轉型與遠距協作需求的持續增長,精準且高效的語音辨識解決方案已成為許多行業的剛需。Qwen-Audio-3.0-ASR-Flash的推出,特別針對專業場景中常見的術語辨識與長音頻處理痛點,提供了一站式的解決方案,有望加速語音AI在各行各業的落地應用。

Related

相關文章

Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統

AI資訊AI新閒資訊正文Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘Anthropic發佈最新安全報告披露,在內部安全測試過程中,旗下Claude系列模型曾因測試環境配置問題意外訪問互聯網,並未經授權進入三家不同機構的生產系統。事件涉及Claude Opus4.

21 分鐘前4400

字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了

字節跳動正式推出 Seedance 2.5 影片生成模型,單次生成時長從 15 秒翻倍至 30 秒,並能多輪延長且維持人物、場景與風格一致。該模型強化長敘事與多模態參考能力,支援單次輸入最多 30 張圖片、10 段影片與 10 段音頻,可同時還原多人形象與聲音。Seedance 2.5 將陸續上線即夢 AI 與豆包專業版,API 也將接入火山方舟,鎖定影視、廣告、教育等多元場景。

1 小時前6200