阿里發佈語音識別新模型,醫療詞彙"聽中率"破 95%,曾拿全球最低錯字率
重點摘要
阿里巴巴發布語音識別大模型 Qwen-Audio-3.0-ASR-Flash,主打精準辨識專業詞彙,醫療場景「聽中率」突破 95.36%,並曾以 1.7% 錯字率拿下全球第一。模型提供三個版本,涵蓋實時語音、離線轉寫等場景,已透過阿里雲百鍊平台開放使用。
阿里巴巴近日正式推出語音識別大模型 Qwen-Audio-3.0-ASR-Flash,這款新模型的核心目標非常明確:讓人工智慧能夠精準聽懂各行業的專業術語,尤其在醫療場景中,詞彙辨識準確率已突破 95%,達到 95.36% 的水準。這項技術的進展,被視為語音交互在專業領域「最後一公里」的關鍵突破。根據官方資訊,Qwen-Audio-3.0-ASR-Flash 在三個面向進行了系統性優化:上下文一致性、行業詞識別能力以及熱詞定製化功能。模型不僅能將語音轉為文字,還具備語音潤色能力,可直接輸出結構化文本,大幅提升會議記錄、直播字幕等場景的可用性。
研究團隊持續從醫療、IT 程式設計、股票金融、社會名人等領域挖掘專業詞彙,建構出覆蓋多行業的高品質詞庫,讓模型不必仰賴使用者手動設定就能辨識艱澀術語。在最新內部評測中,該模型對各行業專業詞的「聽中率」均有顯著提升,其中醫療場景表現最為突出,達到 95.36%。這意味著在臨床診斷紀錄、醫囑轉寫、藥品名稱辨識等高度專業的應用中,AI 語音辨識已能達到接近實用的精準度。此外,在 IT 與程式設計領域,專業詞彙召回率也達到 91.87%,顯示出模型在跨領域的適應能力。值得注意的是,Qwen-Audio-ASR-Flash 系列並非首次在國際評測中嶄露頭角。
此前,該模型曾在 AI 評測平臺 Artificial Analysis 上以 1.7% 的錯字率拿下全球第一,展現出在真實辦公與教育環境中,語音轉文字準確度已觸及可用性的高標。這項成績也為阿里在語音辨識領域的技術實力提供了有力背書。目前,該模型已透過阿里雲百鍊平臺開放調用,提供三個版本以滿足不同場景需求:Flash 版支援最長 5 分鐘的即時語音辨識,適合快速會議記錄或即時字幕;Filetrans 版則針對離線檔案轉寫,可處理較長音頻檔案;Streaming 版則提供持續性的即時語音辨識串流,適用於直播、客服等需要即時回饋的應用。
三個版本共同覆蓋會議紀要整理、即時字幕、教育錄播、智慧客服等五大典型場景。阿里此次推出的語音辨識模型,不僅強化了長音頻的上下文記憶能力,確保在長時間會議中不會出現前後不一致的「丟詞」現象,更內建了醫療、IT 等領域的專業詞庫,讓企業用戶無需額外人工配置即可直接使用。這項特色大幅降低了導入門檻,尤其對於醫療機構、科技公司等經常接觸專業術語的組織,更具實用價值。從技術發展脈絡來看,阿里通義實驗室在語音辨識領域持續深耕。去年推出的 Fun-ASR1.5 模型已支援全球 30 種主流語言,並深度適配漢語七大方言及 20 多種地方口音,展現出多語種與多方言的通用能力。而這次的 Qwen-Audio-3.
0-ASR-Flash 則進一步聚焦於專業場景的深度優化,補足了過去語音模型在行業術語處理上的短板。業界分析指出,當 AI 不再只是「能聽」,而是能聽懂那些拗口、冷僻的專業詞彙時,語音交互的可用性將迎來質變。從醫療病歷數位化、IT 開發會議記錄,到金融分析師的語音筆記,這些過去需要人工反覆校對的場景,如今可望靠 AI 一次性完成,大幅提升工作效率。隨著模型在阿里雲百鍊平臺上線,開發者與企業用戶可以立即透過 API 串接,將這項能力整合到自家產品或服務中。阿里也同步釋出相關技術文件與最佳實踐指南,協助用戶快速上手。
未來,這系列模型預計將持續擴充行業詞庫,並針對更多垂直領域進行精調,讓語音辨識不再只是通用工具,而是真正融入產業運作的核心能力。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。