智東西生成式AI

阿里語音模型再進化!專有名詞一鍵拿捏,口頭禪實時潤色

2026年7月31日 09:39

重點摘要

阿里千問大模型團隊發布語音識別模型Qwen-Audio-3.0-ASR-Flash,強化上下文一致性、行業詞識別與熱詞定製,醫療場景專業詞聽中率達95.36%。該模型還能即時去除口頭禪、重組語意不清的內容,輸出結構化文本,並支援多語言混合識別。

站內 AI 整理稿

阿里千問大模型團隊於7月31日推出新一代語音識別大模型Qwen-Audio-3.0-ASR-Flash,這次改版聚焦於三個核心方向:長語音上下文理解、行業專業詞彙識別,以及企業級熱詞定製。官方公布的數據顯示,這款模型在醫療場景下對專業術語的「聽中率」達到95.36%,工業、IT編程、畜牧業等領域的識別準確率也都超過90%。在熱詞機制方面,所有測試集上的熱詞「聽中率」都維持在90%以上,多數應用場景甚至突破99%。 針對長音頻處理,新模型導入長音頻Context能力,讓系統在轉寫當前語音時,能夠回顧近期已辨識出的內容,沿著同一話題的關鍵詞與語義脈絡持續往下聽。這項設計特別有助於應對同音字詞的判斷,尤其是專業術語、中英文夾雜等容易出錯的片段。模型的「記憶」直接來自音頻本身的對話內容,並會隨著對話推進自動更新,不需要額外手動設定。對於動輒數十分鐘的會議記錄或訪談內容,這項功能可有效降低因語境斷裂而產生的誤判。 在專業術語的掌握上,Qwen-Audio-3.0-ASR-Flash將行業詞彙辨識內化為模型自身的能力。過去處理醫療、法律、工程等領域的特殊用語,往往需要人工維護詞表,遇到只在對話中出現一次的冷門詞彙更是考驗系統的即時反應。研究團隊從醫療、IT編程、股票金融、社會名人等領域挖掘專業詞彙,建構覆蓋多行業的高品質詞庫,讓模型即使面對未曾配置過的專有名詞,也能依靠內建知識進行正確辨識。官方內部評測顯示,醫療場景的專業詞「聽中率」突破95.36%,其他垂直領域也有明顯提升。 熱詞定製方面,新模型採用分級熱詞機制,讓企業可以依照自身需求配置專屬詞彙並即時生效。過往熱詞的痛點在於,當企業加入大量自定義詞後,誤觸發的機率會隨之上升,反而拖累整體識別效果。Qwen-Audio-3.0-ASR-Flash透過分級管理的方式,在保有客製化彈性的同時,避免熱詞過載對辨識品質造成負面影響。官方數據指出,在傳入熱詞的條件下,各測試集的熱詞「聽中率」皆達到90%以上,多數場景甚至超過99%。 除了辨識能力的提升,語音潤色功能也是這次改版的一大亮點。模型能夠在轉寫過程中直接去除口頭禪和語氣詞,並對重複、口吃或語意不清的片段進行重組,輸出條理分明的書面文本。根據千問團隊公布的評測結果,去口頭禪與去重複後的可讀性和忠實度,已與「先識別再用Qwen3.6-Plus潤色」的兩步走方案相當。所有子集的可讀性平均分從未潤色時的2.55提升至3.43,優秀可讀率也從30.75%上升到59.27%。 從實際案例來看,模型能有效處理多種類型的口語問題。例如去除無意義的語氣詞,「那同時因為其實您日常我們再去用一些AI的AI的一個產品和模型的話」會被整理為「同時,因為日常使用AI產品和模型時」;面對口吃與重複,「就是就電動車的一些,就是它的一些產品手冊」則會精簡為「把電動車的產品手冊」;自我糾正的語句也能被準確理解,像是「搜一下那個遇果香源的紅富士蘋果,啊不是,是煙臺棲霞紅富士」會直接輸出「搜一下煙臺棲霞紅富士」。這些能力大幅減輕了後續人工整理逐字稿的負擔。 多語言混合識別同樣是此次升級的重點之一。Qwen-Audio-3.0-ASR-Flash支援的語言涵蓋中文、日語、韓語,延伸至泰語、越南語、印尼語、馬來語等東南亞語言,以及印地語、阿拉伯語,並包含英語、法語、德語、西班牙語、葡萄牙語、俄語等歐洲主流語言。使用者只需在辨識前告知模型會議可能使用的語種,系統便會自動啟動多語言混合識別模式。官方在七個語種的評測中顯示,平均語義錯誤率為17.09%,優於Azure、ElevenLabs Scribe v2、Gemini 3.0 Flash以及上一代模型。 在識別速度方面,模型維持理論出字延遲300毫秒的表現,同時提升了複雜工業場景下的準確率。中文工業場景的平均錯字率僅7.8%,英文工業場景則為11.52%。值得一提的是,Qwen-Audio-ASR-Flash系列過往曾在全球權威AI評測平臺Artificial Analysis上,以1.7%的錯字率拿下全球第一的成績,此次新版在既有基礎上進一步強化垂直領域的適用性。 目前Qwen-Audio-3.0-ASR已透過阿里雲百鍊平台開放API調用,提供三個版本供開發者選擇:語音識別(最長5分鐘)、離線文件轉寫,以及即時語音識別。三個版本分別對應不同使用情境,涵蓋短語音即時辨識、大量音檔批次處理,以及需要串流回應的互動場景。 整體而言,語音識別市場的競爭正從標準普通話的錯字率比拼,逐步轉向真實商業落地場景的適配能力。過去企業導入語音辨識系統時,最大的痛點在於醫療術語、程式碼變數、工業設備型號、金融標的等小眾詞彙容易出現同音混淆,且需要投入人力持續維護詞表。熱詞擴充又可能反向影響通用識別精度,形成兩難。Qwen-Audio-3.0-ASR-Flash的出現,顯示新一代語音模型正從通用工具朝向真正的生產力工具轉型,藉由內建行業知識與智能化潤色能力,解決過往專業場景難以規模化落地的瓶頸。

Related

相關文章

李飛飛教機器人摸麻將擠牙膏,AI終於有“手感”了

李飛飛團隊發布機器人研究T-Rex,透過高頻觸覺反饋讓機器人完成翻書頁、擠牙膏、摸麻將等精細任務。研究發現,視覺負責規劃「要做什麼」,而觸覺則以更高頻率即時修正動作,避免物體滑落或損壞。這項技術突破讓AI從單純的圖片識別,邁向理解物理世界中物體互動與空間關係的關鍵一步。

剛剛
IT之家生成式AI

國家超算互聯網上線 DeepSeek-V4-Flash 正式版 API,一鍵接入即可快速調用

國家超算互聯網正式上線 DeepSeek-V4-Flash 正式版模型 API 調用服務及模型文件,企業與開發者可一鍵接入快速使用。該模型經大量後訓練,智慧體與指令遵循能力大幅增強,效能可媲美當前最強閉源模型。目前超算互聯網 AI 社區已彙集超過 1700 款開源大模型,並成為全國首個十萬卡級超智融合算力資源池。

剛剛
IT之家生成式AI

首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道

首頁 > 智能時代>人工智能 首屆全國青少年人工智能大賽決賽上海開賽,設 5 大前沿賽道 2026/8/2 15:31:40 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 2 日消息,據新華社今日報道,首屆全國青少年人工智能大賽決賽 8 月 1 日在上海開賽。來自全國 31 個省(自治區、直轄市)和新疆生產建設兵團以及香港、澳門特別行政區的 850 餘名選手,從 4.

剛剛

谷歌機器人整了波大活兒,要攻克「最後幾釐米」的行業難題?

Google DeepMind推出Gemini Robotics 2,主打「全身智能」的機器人通用模型,強調同時協調雙腿、軀幹、雙臂與手指,並搭配負責高層規劃的ER 2與可快速適應新本體的On-Device 2。官方展示機器人能自主彎腰撿水壺、從貨架取物及使用五指靈巧手執行擰燈泡、封自封袋等精細操作,但地面取物與多指靈巧任務成功率仍偏低。整體而言,谷歌試圖讓機器人模型跨越過去只控制上半身的限制,但距離穩定進入家庭與工廠仍有距離。

剛剛
IT之家生成式AI

中國 AI 大模型領跑全球榜單,央視詳解背後的優勢所在

OpenRouter 最新一週 AI 大模型調用量榜單中,前五名全由中國企業包辦,小米 MiMo-V2.5 以單週 10.5 萬億 Tokens 居冠,DeepSeek 與騰訊混元也上榜。中國開源模型在 Hugging Face 累計下載量全球第一,專家指出開源策略能降低應用門檻並換取長期生態影響力。榜單未納入企業私有化部署與美國封閉 API 流量,但國產開源模型已在市場化第三方渠道取得領先。

剛剛

貝索斯用 AI 尋找下一塊硅

亞馬遜創辦人貝索斯旗下投資機構參與英國AI材料公司CuspAI的4.5億美元B輪融資,該公司估值達26億美元,成立不到兩年。CuspAI主打以「逆向設計」用AI生成候選材料結構,並成立AI Materials Foundry,串聯輝達、Meta等超過45家夥伴,企圖打造跨產業的材料研發平台。目前該公司尚無重大商業化成果,但資本看好AI加速新材料發現的潛力。

剛剛