口語轉錄,一步到位!全國產算力語音識別模型,聽得懂上下文了

2026年9月24日 07:02
站內 AI 整理稿

作者 | 楊京麗 編輯 | 李水青 9月24日報道,昨日,科大訊飛推出最新語音識別大模型Spark-ASR-2.0。該模型基於訊飛語音基座大模型Spark-Audio-1.0-Preview構建,重點提升通用識別、複雜聲學場景識別、上下文識別和文本流暢規範性。值得注意的是,語音基座大模型Spark-Audio-1.0-Preview和語音識別模型Spark-ASR-2.0均基於全國產算力展開訓練。訊飛正在以多年積累的智能語音技術和國產算力平臺大模型訓練經驗為基礎,持續推進語音基座模型、專用模型等技術迭代。

儘管大多數語音識別模型在日常使用中基本能夠準確轉寫,但在嘈雜環境中輸入、中英文混合輸入,或者對專業會議進行轉錄時,仍可能出現錯字、漏字;語氣詞、重複和臨時改口,也常讓轉寫結果需要二次整理。目前大部分語音識別模型的目標還停留在單純的精準識別轉寫上。為了驗證Spark-ASR-2.0能否解決上述問題,圍繞通用識別、複雜聲學場景識別、上下文識別、文本流暢規範性四個方向展開實測。實測中,Spark-ASR-2.0整體識別表現較為穩定,能通過上下文修正部分歧義表達,減少口頭語和重複內容,讓語音轉寫結果更接近一段可以直接使用的文本。Spark-ASR-2.

0已陸續上線訊飛輸入法,並且通過訊飛開放平臺提供API服務,也開放了體驗鏈接。後續還將逐步應用到訊飛AI眼鏡、智能辦公本和訊飛聽見等產品上。一、方言、芯片術語輕鬆識別,悄悄話也能聽清 首先來看通用識別能力,我們用河南話對Spark-ASR-2.0進行了簡單測試。幾乎在說完話的瞬間,模型就正確完成了語音識別。看來方言對於Spark-ASR-2.0來說,難度不大。據瞭解,Spark-ASR-2.0現已支持全國202種方言免切換識別。接下來,為了測試模型在中英文混合場景下,能否聽得準,專業術語能否寫得對,我們用一段芯片公司的業務介紹繼續測試。

這段話包含RISC-V、TPU、VISA等多個英文縮寫和芯片專業術語,句子較長,且中英文表達交織。Spark-ASR-2.0完整識別整段內容,專業詞彙也沒有出錯。對於科技媒體、技術會議等場景來說,這類專業術語的準確轉寫,能夠減少後續人工校對成本。之後,我們又測試了模型在複雜聲學場景的表現,這也是代表實際應用場景的關鍵維度。我們先在地鐵噪音場景下進行實測。在背景噪聲較為明顯的情況下,模型能夠區分環境聲音和說話聲音,識別出“一號線”、“東單”等關鍵信息,完整進行轉寫。我們還測試了Spark-ASR-2.0的悄悄話識別能力。在刻意壓低音量、使用氣聲說話的情況下,Spark-ASR-2.

0仍然可以準確識別出完整內容。對於辦公室等不方便大聲說話的場景,低聲說話,模型也能做到精確轉寫。二、上下文糾錯、口語規範成文,轉寫實現“零返工” 在不同場景下,準確識別語音只是第一步。相比逐字記錄,用戶更希望語音識別模型能夠根據上下文調整,輸出流暢、規範的文本。於是,我們測試了模型的上下文識別能力。模型根據後文中“山峰的峰”,判斷出“張三峰”的正確寫法,後面“颱風的風”也沒有出現同音字錯誤的情況。這個案例中,模型同樣能夠結合後文的解釋理解語義,將易混淆的“靈”和“苓”調整為正確文字。在文本流暢性方面,我們模擬平常發信息時會出現的停頓、重複、改口等情況,觀察模型的轉寫結果是否可以直接使用。

面對停頓、磕絆、改口,模型能夠刪去冗餘內容,將會議時間修正為“8點半”,後面的郵箱也能夠按照正確格式輸出。下面這個例子,我們進一步提高難度,加入了日期、取件碼、快遞單號等信息,看看模型能否規範輸出。測試結果中,取件碼、快遞單號和日期均準確識別,並且輸出形式規整,沒有因為連續數字、字母和符號混合,而出現遺漏或中斷,轉寫結果可以直接使用。三、先快速識別、再重點糾錯,推理成本較上代僅增10% Spark-ASR-2.0的升級,建立在訊飛語音大模型持續演進的基礎上。9月16日,科大訊飛推出基於全國產算力訓練的語音基座大模型Spark-Audio-1.

0-Preview,支持語音轉寫、多語言翻譯、多方言識別、環境音識別、說話人識別、情感分析以及複雜的音頻問答等任務。Spark-ASR-2.0是基於這一語音底座打造的語音識別大模型,同樣基於全國產算力訓練,進一步聚焦語音識別的準確性、實時性、語言理解和文本規範。在去年科大訊飛全球1024開發者節上曾首發了非自迴歸語音識別大模型Spark-ASR-1.0,實現了推理效率的大幅提升,能夠並行、一次性輸出整個文本序列,效果相對提升16%,推理成本下降84%。從官方測試結果來看,Spark-ASR-2.0在語音識別核心場景上的效果較Spark-ASR-1.0進步明顯。

絕大多數場景的WER(詞錯誤率)低於業界最優水平,在方言、高噪和小音量場景下表現最為突出。不過,要同時兼顧識別效果、響應速度和推理成本並不容易。快速識別往往難以充分理解複雜語境,而強化語言理解又可能帶來更高的時延和計算成本。為解決這一問題,Spark-ASR-2.0延續了Spark-ASR-1.0非自迴歸識別能力,同時融合LLM增強的自迴歸識別能力。傳統自迴歸模型需要按照文字順序逐步生成,語言理解能力較強,但處理速度和計算成本相對較高;非自迴歸模型則可以並行完成整段語音的初步轉寫,響應更快,但面對複雜語境和易混淆表達時,修正能力有限。Spark-ASR-2.

0結合兩種架構,先由非自迴歸模塊快速生成整段語音的識別結果,再通過投機解碼判斷其中是否存在需要結合上下文進一步理解的內容,以及需要從哪裡開始修正。這種方式避免了對全文重新解碼,在控制推理時延和計算成本的同時,提升了複雜語境、長尾表達和口語化內容的識別能力,整體推理成本較Spark-ASR-1.0僅增加10%。此外,針對中英文混合場景下數據匱乏的問題,模型通過補充英文專有詞與熱詞,形成中英文混合文本數據,並結合語音特徵和發音相似性進行聯合訓練,提升了對專業術語和不規範發音的識別能力。在上下文識別方面,Spark-ASR-2.

0引入動態上下文注入機制,能夠結合當前語音、個性化熱詞和用戶歷史修改,對人名、專業術語及易混淆表達進行綜合判斷,並從萬級熱詞庫中篩選相關候選詞,在提升識別準確性的同時,減少無關信息干擾,基本不增加響應時延。結語:基於長期技術積累,語音識別走向“流暢成文” 對語音識別而言,能把聲音轉換成文字早已不是終點,複雜環境下能否穩定轉寫、口語能否自動整理成文,正在成為新的競爭焦點。科大訊飛從實際需求出發,關注降噪、專業術語、口頭語、文本規範性等細節問題,把語音識別進一步推向“流暢成文”,讓語音識別變成能夠直接提升效率的生產力工具。這也是科大訊飛長期深耕智能語音技術的一次延續。

尤其在語音識別領域,科大訊飛曾連續六屆收穫語音識別國際權威賽事CHiME冠軍,面向“雞尾酒會”問題不斷挑戰識別難題。這也是科大訊飛長期深耕智能語音技術的一次延續。尤其在語音識別領域,科大訊飛曾連續六屆收穫語音識別國際權威賽事CHiME冠軍,面向“雞尾酒會”問題不斷挑戰識別難題。2024年,科大訊飛作為第一完成單位的“多語種智能語音關鍵技術及產業化”項目獲得國家科學技術進步獎一等獎。值得一提的是,訊飛過去積累的核心語音技術能力,始終圍繞真實環境中的識別難題展開。在大模型時代,訊飛將深厚的技術積澱與AI融合,持續探索語音大模型的更多可能。

從近期推出語音基座模型,到昨日發佈語音識別大模型,再到後續規劃中的系列語音相關大模型,這一系列動作不僅展現了科大訊飛不斷突破語音技術領域天花板的決心,也體現了持續推動技術應用落地、賦能產品業務的實踐路徑。

Related

相關文章

鈦媒體生成式AI

梁文鋒用沙盒開啟RSI

字母AI2026.09.24 18:16 · 來自北京全文4232字00:00 / 11:21DeepSeek聯合清華大學發論文,梁文鋒署名文 | 字母AIDeepSeek聯合清華大學發表了一篇文章,署名的最後一人是梁文鋒。文章表面上是說DeepSeek訓練Agent所使用的沙盒,但是論文第6節越看越不對勁。字裡行間寫了三個英文字母:RSI。通過這個沙盒,Agent能創建自己需要的環境,這個環境會再次訓練Agent,被訓練的更強的Agent會創造更好的環境。由此形成了一個小型的RSI閉環。

剛剛

首部上星AI長劇《後西遊記》幕後:沒有攝影機,100%畫面由Seedance生成,單集成本壓到十幾萬

這部規劃60集、每集約40分鐘的劇集由芒果TV出品、伯璟文化承製,全程沒有一臺攝影機,視頻生成100%交給Seedance完成。上線僅一週,芒果TV正片播放量就衝破1.5億次。把這部劇推出來的,是兩個被傳統影視邏輯卡過的人。總導演李東珅長期拍紀錄片,執導的《河西走廊》豆瓣9.

剛剛
智東西生成式AI

MiMo-V2.6剛發,小米羅福莉扔出MiMo-V3新架構!引用DeepSeek多項成果

(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日報道,昨晚,小米MiMo大模型負責人羅福莉發文,提前披露了MiMo-V3的新架構,其核心組件HySparse2率先登場,相關技術論文同步公佈。▲羅福莉發文 簡單來說,這套新架構主要解決Agent越做越多輪之後出現的三個問題:長輸入算得太多、緩存佔得太大,以及如何從越來越長的上下文裡準確找到需要的信息。

剛剛
鈦媒體生成式AI

OpenAI、Anthropic同日模型大戰,“是兄弟就砍一刀”

光錐智能2026.09.24 16:43 · 來自廣西全文3968字00:00 / 10:28刀刀見骨,AI巨頭為自己畫過的大餅“填窟窿”文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏9月23日凌晨,OpenAI和Anthropic像約好了一樣,前後腳各自放出新模型:OpenAI端出了GPT-6 Sol和GPT-6 Luna兩款模型,把旗艦GPT-6 Astra的能力蒸進更快更便宜的型號裡;Anthropic則亮出Claude Opus 5.5,性能追平Fable 5.1的同時,成本只有上代Opus 5的六成。

剛剛

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言

該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

剛剛