阿里發佈語音識別新模型,醫療詞彙"聽中率"破 95%,曾拿全球最低錯字率

2026年7月31日 07:007400 次瀏覽

重點摘要

阿里巴巴發布語音識別大模型 Qwen-Audio-3.0-ASR-Flash,主打精準辨識專業詞彙,醫療場景「聽中率」突破 95.36%,並曾以 1.7% 錯字率拿下全球第一。模型提供三個版本,涵蓋實時語音、離線轉寫等場景,已透過阿里雲百鍊平台開放使用。

站內 AI 整理稿

阿里巴巴近日正式推出語音識別大模型 Qwen-Audio-3.0-ASR-Flash,這款新模型的核心目標非常明確:讓人工智慧能夠精準聽懂各行業的專業術語,尤其在醫療場景中,詞彙辨識準確率已突破 95%,達到 95.36% 的水準。這項技術的進展,被視為語音交互在專業領域「最後一公里」的關鍵突破。 根據官方資訊,Qwen-Audio-3.0-ASR-Flash 在三個面向進行了系統性優化:上下文一致性、行業詞識別能力以及熱詞定製化功能。模型不僅能將語音轉為文字,還具備語音潤色能力,可直接輸出結構化文本,大幅提升會議記錄、直播字幕等場景的可用性。研究團隊持續從醫療、IT 程式設計、股票金融、社會名人等領域挖掘專業詞彙,建構出覆蓋多行業的高品質詞庫,讓模型不必仰賴使用者手動設定就能辨識艱澀術語。 在最新內部評測中,該模型對各行業專業詞的「聽中率」均有顯著提升,其中醫療場景表現最為突出,達到 95.36%。這意味著在臨床診斷紀錄、醫囑轉寫、藥品名稱辨識等高度專業的應用中,AI 語音辨識已能達到接近實用的精準度。此外,在 IT 與程式設計領域,專業詞彙召回率也達到 91.87%,顯示出模型在跨領域的適應能力。 值得注意的是,Qwen-Audio-ASR-Flash 系列並非首次在國際評測中嶄露頭角。此前,該模型曾在 AI 評測平臺 Artificial Analysis 上以 1.7% 的錯字率拿下全球第一,展現出在真實辦公與教育環境中,語音轉文字準確度已觸及可用性的高標。這項成績也為阿里在語音辨識領域的技術實力提供了有力背書。 目前,該模型已透過阿里雲百鍊平臺開放調用,提供三個版本以滿足不同場景需求:Flash 版支援最長 5 分鐘的即時語音辨識,適合快速會議記錄或即時字幕;Filetrans 版則針對離線檔案轉寫,可處理較長音頻檔案;Streaming 版則提供持續性的即時語音辨識串流,適用於直播、客服等需要即時回饋的應用。三個版本共同覆蓋會議紀要整理、即時字幕、教育錄播、智慧客服等五大典型場景。 阿里此次推出的語音辨識模型,不僅強化了長音頻的上下文記憶能力,確保在長時間會議中不會出現前後不一致的「丟詞」現象,更內建了醫療、IT 等領域的專業詞庫,讓企業用戶無需額外人工配置即可直接使用。這項特色大幅降低了導入門檻,尤其對於醫療機構、科技公司等經常接觸專業術語的組織,更具實用價值。 從技術發展脈絡來看,阿里通義實驗室在語音辨識領域持續深耕。去年推出的 Fun-ASR1.5 模型已支援全球 30 種主流語言,並深度適配漢語七大方言及 20 多種地方口音,展現出多語種與多方言的通用能力。而這次的 Qwen-Audio-3.0-ASR-Flash 則進一步聚焦於專業場景的深度優化,補足了過去語音模型在行業術語處理上的短板。 業界分析指出,當 AI 不再只是「能聽」,而是能聽懂那些拗口、冷僻的專業詞彙時,語音交互的可用性將迎來質變。從醫療病歷數位化、IT 開發會議記錄,到金融分析師的語音筆記,這些過去需要人工反覆校對的場景,如今可望靠 AI 一次性完成,大幅提升工作效率。 隨著模型在阿里雲百鍊平臺上線,開發者與企業用戶可以立即透過 API 串接,將這項能力整合到自家產品或服務中。阿里也同步釋出相關技術文件與最佳實踐指南,協助用戶快速上手。未來,這系列模型預計將持續擴充行業詞庫,並針對更多垂直領域進行精調,讓語音辨識不再只是通用工具,而是真正融入產業運作的核心能力。

Related

相關文章

AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線

AI資訊最新AI日報正文AI日報:MiniMax發佈全模態模型H3;Seedance 2.5發佈,30秒一鏡到底;DeepSeek-V4-Flash正式版上線發布於最新AI日報時間 :Jul 31, 2026閱讀 :2分鐘歡迎來到【AI日報】欄目!這裡是你每天探索人工智能世界的指南,每天我們為你呈現AI領域的熱點內容,聚焦開發者,助你洞悉技術趨勢、瞭解創新AI產品應用。新鮮AI產品點擊瞭解:https://app.aibase.com/zh1、MiniMax發佈通用全模態模型H3,15秒2K音視頻生成價格不到主流模型三分之一MiniMax發佈通用全模態模型H3,實現了文本、圖像、視頻、音頻的統一理解與生成,標誌著多模態生成模型從專用專家向通用助手邁出關鍵一步。H3在指令遵循、品牌信息呈現、V2V動作遷移等場景下表現出商用級穩定性,已可應用於廣告、電商、遊戲、UI設計等多個商業領域。同時,H3在設計初期就考慮了多款國產芯片的兼容性,其開源將進一步降低國內企業在多模態AI應用上的技術門檻。【AiBase提要:】📹 H3支持原生雙聲道音視頻輸出,最高可生成15秒2K分辨率內容。🧠 引入Contextual Omni Representation技術,使自然語言成為連接各類模態的通用橋樑。📦 MiniMax宣佈將在符合相關法律法規的前提下開源H3模型權重,推動開源生態建設。2、字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了字節跳動發佈 Seedance 2.5 視頻生成模型,將單次視頻生成時長提升至 30 秒,並具備長敘事能力、多模態參考和編輯能力,可完成完整創作。【AiBase提要:】🎥 Seedance 2.5 提升視頻生成時長至 30 秒,支持多鏡頭敘事和邏輯關聯的鏡頭組織。🔄 支持多輪延長能力,保持人物主體、場景、畫面風格及音

剛剛

韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型

AI資訊AI新閒資訊正文韓國最大 AI 模型問世:LG 發佈 7500 億參數 K-EXAONE 2.0,Apache 開源直面中國模型發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘LG AI 研究院 7 月 31 日在 Hugging Face 上正式發佈 K-EXAONE 2.0 模型,這是韓國科技信息通信部主權人工智能基金會模型項目下開發的第二代產品。新模型採用混合注意力 MoE 架構,擁有 7500 億總參數和 370 億激活參數,規模是初代的 3 倍以上,也是韓國迄今為止開發的最大人工智能基礎模型。值得一提的是,K-EXAONE 2.0 以 Apache 2.0 許可證完全開源,這在韓國 AI 發展史上頗為罕見。性能全面提升,正面叫板中國開源模型縱向對比,K-EXAONE 2.0 在 24 項基準測試中平均得分 70.1 分,比初代的 63.3 分提升超過 10%,三大編碼和智能體編碼基準測試中性能改進約 30%。橫向來看更是野心勃勃——在長上下文理解方面優於智譜 GLM-5.1,在智能體工具使用能力上同樣超越 GLM-5.1 和 Qwen3.5,在指令執行評估中則與 GLM-5.1、DeepSeek V4 Pro Max、Qwen3.5 等處於同一水平。從初代到 2.0,LG AI 研究院僅用一代就將模型參數規模翻了三倍多,且在多項關鍵指標上直接對標中國頭部開源模型。在 Kimi K3 引發的全球開源模型競賽尚未降溫之際,韓國以主權 AI 之名加入戰局,意味著東亞 AI 開源生態的三角競爭格局正在成型。相關推薦我國人工智能迎來全產業鏈突破,將加快《人工智能法》立法國產大模型全球下載量破100億次,萬億級開源模型頻出,人工智能產業鏈整體突破。國家發改委表示,上半年我國AI自主創新加速,深度求索、月之暗面等發佈萬億參數開源大模型,下一步將統籌高質量

1 分鐘前5500

顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了

AI資訊AI新閒資訊正文顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘近日,字節跳動 Seed 團隊正式推出了全新一代視頻創作模型Seedance2.5。作為一款主打“一鏡成片”的音視頻聯合生成模型,新版本在長敘事、多模態參考以及後期編輯三大核心維度迎來了突破性升級,全面賦能影視、廣告、教育及工業等多個產業場景。在視頻時長與敘事表現上,Seedance2.5實現了質的飛躍。單次生成時長從以往的15秒大幅提升至30秒,並支持多輪無縫延長,讓複雜的故事情節得以連貫展開。針對行業常見的“油膩感”痛點,模型對材質、膚質、光影及飽和度進行了深度優化,有效弱化了傳統生成視頻的塑料感,呈現出更接近實拍的影視級質感。面對複雜的創作需求,Seedance2.5升級了多模態參考能力。用戶單次最多可輸入30張圖片、10段視頻以及10段音頻作為參考素材。同時,白模參考和光照控制功能的加入,讓空間結構、運動軌跡及物理光影更加符合真實規律,大幅提升了群像敘事與多主體交互的穩定性。此外,該模型在剪輯和可控性方面同樣表現亮眼。平臺支持通過時間戳進行精準的內容編輯,無論是畫面視角、運鏡節奏,還是綠幕背景下的物理效果渲染,創作者都能進行定向修改,從而顯著降低反覆生成和後期拼接的成本。目前,Seedance2.5正在陸續登陸即夢 AI、豆包專業版等平臺,API 服務也將於近期上線火山方舟,持續為廣大創作者和產業生態提供高效的AI視頻生成解決方案。相關推薦DeepSeek-V4-Flash API公測上線 Agent能力全面爆發科技圈迎來效率革命,字節跳動旗下Seed團隊發佈Seedance2.5音視頻聯合生成模型,主打一鏡成片。單次生成時長從15秒延至30秒,並支持多輪無縫延長,讓複雜情節更連貫。模型

1 分鐘前6700

特斯拉中國車機正式接入豆包大模型

AI資訊AI新閒資訊正文特斯拉中國車機正式接入豆包大模型發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘7 月 31 日消息,特斯拉中國於今日開始分批次推送2026.14. 13 版本的車機軟件更新。此次更新覆蓋了Model 3、Model Y、Model S以及Model X等多款主流車型,其中最受關注的核心升級便是正式引入了豆包大模型。據官方介紹,接入豆包大模型後,特斯拉的車機系統不僅能夠提供更加實時、準確的信息查詢,還能與車主展開自然且流暢的語音對話,大幅提升了車內智能交互的體驗。不過需要注意的是,該項AI大模型功能需要用戶開通高級車載娛樂服務方可正常使用。相關推薦特斯拉Grok覆蓋全歐洲並進軍更多亞洲國家,語音控制空調手套箱一步到位特斯拉旗下AI助手Grok將擴展至歐洲及印度、馬來西亞等亞洲多國,隨2026年夏季更新推送。新版本新增車輛語音控制功能,可撥打電話、控制音樂空調及開關手套箱,從聊天機器人升級為車載管家。Jul 23, 2026230.4k特斯拉Optimus機器人產線曝光:馬斯克確認今夏投產,初期產量爬坡緩慢馬斯克曬弗裡蒙特工廠團隊合照,公開Optimus人形機器人生產線已由原Model S/X產線改造後正式運轉。面對公開演示減少的猜測,他迴應稱該產品含1萬個獨特零部件,一切從零研發,尚處初期階段。Jul 2, 2026333.6k SpaceX展示纖薄AI設備原型,深度整合xAI技術並對標OpenAISpaceX展示了一款類似手機的AI設備原型,比iPhone更纖薄,介乎觸屏手機與Rabbit R1之間,引發其進軍消費電子和移動業務的猜測。儘管馬斯克公開否認報道“純屬捏造”,但此舉仍被視為釋放拓展信號,項目處於早期,設計或調整。Jul 2, 2026166.7k馬斯克放話每月推全新大模型 Grok4.5內測性能比肩Claude Opus

1 分鐘前6600

DeepSeek-V4-Flash API公測上線 Agent能力全面爆發

AI資訊AI新閒資訊正文DeepSeek-V4-Flash API公測上線 Agent能力全面爆發發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘科技圈迎來新一輪效率革命。字節跳動旗下 Seed 團隊正式推出了Seedance2.5音視頻聯合生成模型,主打“一鏡成片”能力,全面賦能多個產業場景。在敘事表現上,Seedance2.5將單次生成時長由15秒擴展至30秒,並支持多輪無縫延長,讓複雜的故事情節更加連貫。同時,模型對材質、光影及膚質進行了深度打磨,有效改善了傳統生成視頻的塑料感,呈現出更加貼近實拍的質感。針對多元化的創意訴求,該版本大幅升級了多模態參考功能。創作者單次最多可輸入30張圖片、10段視頻以及10段音頻。白模參考與光照控制機制的加入,也使物理光影和運動軌跡更加真實穩定。此外,Seedance2.5在後期剪輯和可控性方面進行了精細化升級,用戶能夠通過時間戳對畫面視角、運鏡節奏及綠幕背景等細節進行定向修改,從而降低後期拼接成本。目前,該模型正陸續登陸即夢 AI、豆包專業版等平臺,API 服務也將於近期上線火山方舟。相關推薦我國人工智能迎來全產業鏈突破,將加快《人工智能法》立法國產大模型全球下載量破100億次,萬億級開源模型頻出,人工智能產業鏈整體突破。國家發改委表示,上半年我國AI自主創新加速,深度求索、月之暗面等發佈萬億參數開源大模型,下一步將統籌高質量發展與高水平安全。Jul 31, 202689.0k顛覆影視創作!字節跳動王牌模型Seedance 2. 5 正式發佈, 30 秒一鏡成片時代來了字節跳動Seed團隊發佈視頻創作模型Seedance 2.5,主打“一鏡成片”音視頻聯合生成。升級亮點:單次生成時長提至30秒,支持多輪無縫延長;增強長敘事能力;融合多模態參考與後期編輯。可應用於影視、廣告、教育等領域,推動多產業場景智能化創作。Jul

1 分鐘前8100

我國人工智能迎來全產業鏈突破,將加快《人工智能法》立法

AI資訊AI新閒資訊正文我國人工智能迎來全產業鏈突破,將加快《人工智能法》立法發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘國產大模型全球下載量突破 100 億次,萬億級開源模型頻出,我國人工智能正迎來全產業鏈的整體突破。國家發展改革委政策研究室主任、新聞發言人蔣毅在 7 月 31 日的新聞發佈會上表示,今年上半年,我國人工智能自主創新步伐明顯加快,深度求索、月之暗面等本土企業先後發佈了參數規模達到“萬億”級別的開源大模型。蔣毅強調,下一步將統籌高質量發展與高水平安全,讓人工智能既跑得快又跑得穩。具體來看,將重點從三個方面發力:一是加快自主創新,聚焦大模型基礎理論、訓練和推理效率、多模態以及智能體等前沿方向;二是突出應用導向,加快推動國家人工智能應用中試基地佈局建設;三是深化生態系統,大力培育智能衍生企業,並加快推進《人工智能法》立法進程,力爭貢獻具有中國特色的治理方案。此外,官方還指出將強化人工智能風險監測防控,健全技術監測、風險預警與應急響應體系,堅持技術由人主導、為人所用、與人為善,妥善應對人工智能對經濟運行及就業分配等領域帶來的衝擊。相關推薦唐傑親自劇透GLM-5.5:一句"史詩級plus",把國產大模型的軍備賽又挑高了一截國產大模型密集爆發,拉近與美國旗艦閉源AI差距。千問、Kimi之後,智譜創始人唐傑親口透露GLM-5.5將迎“史詩級pl”升級,國產AI追趕步伐加快。Jul 21, 2026260.4k反超美國!中國AI大模型周調用量創新高,包攬全球前四全球AI大模型上週調用量達36.1萬億Token,連續七週上漲。中國大模型表現突出,周調用量14.19萬億Token,環比增長27.49%,連續六週超越美國居全球第一。國產大模型包攬前四。Jun 8, 2026270.7k百度發佈文心大模型5.1:搜索能力位居國內首位,預訓練成本僅為業界6%百度

1 分鐘前5900