智東西生成式AI

阿里語音模型再進化!專有名詞一鍵拿捏,口頭禪實時潤色

2026年7月31日 09:39

重點摘要

阿里千問大模型團隊發布語音識別模型Qwen-Audio-3.0-ASR-Flash,強化上下文一致性、行業詞識別與熱詞定製,醫療場景專業詞聽中率達95.36%。該模型還能即時去除口頭禪、重組語意不清的內容,輸出結構化文本,並支援多語言混合識別。

站內 AI 整理稿

阿里千問大模型團隊於7月31日推出新一代語音識別大模型Qwen-Audio-3.0-ASR-Flash,這次改版聚焦於三個核心方向:長語音上下文理解、行業專業詞彙識別,以及企業級熱詞定製。官方公布的數據顯示,這款模型在醫療場景下對專業術語的「聽中率」達到95.36%,工業、IT編程、畜牧業等領域的識別準確率也都超過90%。在熱詞機制方面,所有測試集上的熱詞「聽中率」都維持在90%以上,多數應用場景甚至突破99%。針對長音頻處理,新模型導入長音頻Context能力,讓系統在轉寫當前語音時,能夠回顧近期已辨識出的內容,沿著同一話題的關鍵詞與語義脈絡持續往下聽。

這項設計特別有助於應對同音字詞的判斷,尤其是專業術語、中英文夾雜等容易出錯的片段。模型的「記憶」直接來自音頻本身的對話內容,並會隨著對話推進自動更新,不需要額外手動設定。對於動輒數十分鐘的會議記錄或訪談內容,這項功能可有效降低因語境斷裂而產生的誤判。在專業術語的掌握上,Qwen-Audio-3.0-ASR-Flash將行業詞彙辨識內化為模型自身的能力。過去處理醫療、法律、工程等領域的特殊用語,往往需要人工維護詞表,遇到只在對話中出現一次的冷門詞彙更是考驗系統的即時反應。

研究團隊從醫療、IT編程、股票金融、社會名人等領域挖掘專業詞彙,建構覆蓋多行業的高品質詞庫,讓模型即使面對未曾配置過的專有名詞,也能依靠內建知識進行正確辨識。官方內部評測顯示,醫療場景的專業詞「聽中率」突破95.36%,其他垂直領域也有明顯提升。熱詞定製方面,新模型採用分級熱詞機制,讓企業可以依照自身需求配置專屬詞彙並即時生效。過往熱詞的痛點在於,當企業加入大量自定義詞後,誤觸發的機率會隨之上升,反而拖累整體識別效果。Qwen-Audio-3.0-ASR-Flash透過分級管理的方式,在保有客製化彈性的同時,避免熱詞過載對辨識品質造成負面影響。

官方數據指出,在傳入熱詞的條件下,各測試集的熱詞「聽中率」皆達到90%以上,多數場景甚至超過99%。除了辨識能力的提升,語音潤色功能也是這次改版的一大亮點。模型能夠在轉寫過程中直接去除口頭禪和語氣詞,並對重複、口吃或語意不清的片段進行重組,輸出條理分明的書面文本。根據千問團隊公布的評測結果,去口頭禪與去重複後的可讀性和忠實度,已與「先識別再用Qwen3.6-Plus潤色」的兩步走方案相當。所有子集的可讀性平均分從未潤色時的2.55提升至3.43,優秀可讀率也從30.75%上升到59.27%。從實際案例來看,模型能有效處理多種類型的口語問題。

例如去除無意義的語氣詞,「那同時因為其實您日常我們再去用一些AI的AI的一個產品和模型的話」會被整理為「同時,因為日常使用AI產品和模型時」;面對口吃與重複,「就是就電動車的一些,就是它的一些產品手冊」則會精簡為「把電動車的產品手冊」;自我糾正的語句也能被準確理解,像是「搜一下那個遇果香源的紅富士蘋果,啊不是,是煙臺棲霞紅富士」會直接輸出「搜一下煙臺棲霞紅富士」。這些能力大幅減輕了後續人工整理逐字稿的負擔。多語言混合識別同樣是此次升級的重點之一。Qwen-Audio-3.

0-ASR-Flash支援的語言涵蓋中文、日語、韓語,延伸至泰語、越南語、印尼語、馬來語等東南亞語言,以及印地語、阿拉伯語,並包含英語、法語、德語、西班牙語、葡萄牙語、俄語等歐洲主流語言。使用者只需在辨識前告知模型會議可能使用的語種,系統便會自動啟動多語言混合識別模式。官方在七個語種的評測中顯示,平均語義錯誤率為17.09%,優於Azure、ElevenLabs Scribe v2、Gemini 3.0 Flash以及上一代模型。在識別速度方面,模型維持理論出字延遲300毫秒的表現,同時提升了複雜工業場景下的準確率。中文工業場景的平均錯字率僅7.8%,英文工業場景則為11.52%。

值得一提的是,Qwen-Audio-ASR-Flash系列過往曾在全球權威AI評測平臺Artificial Analysis上,以1.7%的錯字率拿下全球第一的成績,此次新版在既有基礎上進一步強化垂直領域的適用性。目前Qwen-Audio-3.0-ASR已透過阿里雲百鍊平台開放API調用,提供三個版本供開發者選擇:語音識別(最長5分鐘)、離線文件轉寫,以及即時語音識別。三個版本分別對應不同使用情境,涵蓋短語音即時辨識、大量音檔批次處理,以及需要串流回應的互動場景。整體而言,語音識別市場的競爭正從標準普通話的錯字率比拼,逐步轉向真實商業落地場景的適配能力。

過去企業導入語音辨識系統時,最大的痛點在於醫療術語、程式碼變數、工業設備型號、金融標的等小眾詞彙容易出現同音混淆,且需要投入人力持續維護詞表。熱詞擴充又可能反向影響通用識別精度,形成兩難。Qwen-Audio-3.0-ASR-Flash的出現,顯示新一代語音模型正從通用工具朝向真正的生產力工具轉型,藉由內建行業知識與智能化潤色能力,解決過往專業場景難以規模化落地的瓶頸。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

9 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

10 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

14 分鐘前