小米語音首席科學家 Daniel Povey 當選 2026 ISCA Fellow,全球僅 100 餘人獲此殊榮

2026年7月16日 11:59
小米語音首席科學家 Daniel Povey 當選 2026 ISCA Fellow,全球僅 100 餘人獲此殊榮

重點摘要

小米語音首席科學家Daniel Povey當選2026年ISCA Fellow,該獎項為國際語音通信協會最高學術榮譽,全球僅百餘人獲得。他因語音識別聲學建模、開源工具Kaldi等貢獻入選,繼2023年IEEE Fellow後再獲殊榮。加入小米後,他帶領團隊推出新一代Kaldi及多項語音技術,包括Zipformer編碼器和支援600多種語言的OmniVoice語音合成模型。

站內 AI 整理稿

小米語音首席科學家 Daniel Povey 當選 2026 ISCA Fellow,全球僅 100 餘人獲此殊榮

IT之家 7 月 16 日報導,小米集團語音首席科學家 Daniel Povey 正式當選 2026 年度 ISCA Fellow。ISCA Fellow 是由國際語音通信協會(ISCA)授予的最高學術榮譽,自 2007 年設立以來,全球僅有 100 餘位學者獲此殊榮。2026 年共有 8 位學者入選,Daniel Povey 憑藉在語音識別聲學建模、序列訓練創新方法、開源語音工具 Kaldi 以及對全球語音通信領域的深遠貢獻脫穎而出。值得一提的是,他是唯一一位同時在學術與工業界都留下基礎設施級開源軟體的科學家,其作品影響了整個語音領域的發展軌跡。

這已經是 Daniel Povey 繼 2023 年當選 IEEE Fellow 之後,再次獲得國際頂尖學術組織的肯定。能夠同時獲得 IEEE 與 ISCA 的 Fellow 頭銜,在業界被稱為「雙料 Fellow」,象徵著他在語音辨識與語音通信領域具有跨時代的影響力。小米技術官方帳號也在博文中表示,Daniel 作為一位定義了一個時代的工具、創造行業基礎設施的科學家,這項榮譽可謂實至名歸。Daniel Povey 的國際學術與職業生涯始於英國劍橋大學。他於 2003 年在劍橋大學取得博士學位,隨即進入工業界,先後在 IBM T.J.

Watson 研究中心與微軟研究院工作了約十年時間,專注於語音識別核心技術的研發。這段經歷為他日後開創 Kaldi 開源專案、革新聲學建模方法奠定了深厚的理論與實務基礎。2019 年 11 月,Daniel Povey 移居北京,正式加入小米集團 AI 實驗室,出任語音首席科學家。進入小米後,他帶領團隊推出新一代 Kaldi 開源專案,該專案涵蓋 k2、Lhotse、Icefall、Sherpa 四大子項目,旨在將傳統 Kaldi 的優勢與現代深度學習框架結合,打造更高效、更靈活的語音處理工具鏈。這一系列開源成果不僅延續了 Kaldi 在學術界的影響力,更進一步推進了語音技術在工業界的落地。

在語音編碼器方面,Daniel 團隊先後推出了 Zipformer 與 Zapformer。Zipformer 是首個嚴格超越 Google Conformer 的語音編碼器,被 ICLR 2024 接收為 Oral 論文(前 1.2%),在語音辨識效率與精度上取得顯著突破。2026 年推出的升級版 Zapformer,則將辨識精度再提升 10% 至 15%,大幅增強了訓練穩定性與泛化能力,展現出新一代編碼器的強大潛力。在語音合成領域,Daniel 團隊於 2026 年發布了 OmniVoice 多語言語音合成模型。該模型支援超過 600 種語言與方言的零樣本語音合成,參數量為 0.

8B,並以 Qwen3 初始化。使用者僅需 3 至 10 秒的參考音頻,即可跨語言複製音色。在中英文 Seed-TTS 與 LibriSpeech-PC 基準測試中,OmniVoice 達到當前最佳水準,在客觀評測上超越 MiniMax 與 ElevenLabs 等商用模型。開源後僅三個月,其在 Hugging Face 上的下載量已超過 500 萬次,顯示出強大的社群吸引力。在辨識架構方面,Daniel 團隊提出了 CR-CTC(Consistency-Regularized CTC),被 ICLR 2025 接收。

該方法讓純 CTC 模型的辨識性能比肩 Transducer 架構,並在 LibriSpeech、AISHELL-1、GigaSpeech 等主流基準上刷新了最佳成績,顯著降低了自動語音辨識系統的訓練與部署門檻,為業界提供了更具效率的替代方案。此外,團隊還開發了 ZipVoice 零樣本語音合成系列,包括 ZipVoice(零樣本單說話人 TTS)與 ZipVoice-Dialog(零樣本對話 TTS)。

這些模型基於 Flow Matching 與 Zipformer 骨幹設計,參數量少、推理速度快,即使在 CPU 單線程上也能達到即時運行,同時搭配開源的 OpenDialog 數據集,進一步降低了語音合成研究的進入門檻。在部署層面,新一代 Kaldi 的端雲一體推理引擎 sherpa-onnx 支援高通、昇騰、瑞芯微等主流 NPU,覆蓋 Android、iOS、嵌入式系統與伺服器端,被開發者譽為「智慧語音領域的瑞士軍刀」。這套全平台解決方案讓語音辨識與合成能力可以輕鬆整合到各類裝置中,加速了語音技術的普及與應用。

Daniel Povey 從劍橋大學起步,歷經 IBM 與微軟的工業洗禮,再到小米帶領團隊開創新一代 Kaldi 生態,其每一步都對全球語音技術發展產生了深遠影響。如今,他同時擁有 IEEE Fellow 與 ISCA Fellow 兩項頂尖榮譽,不僅是個人學術生涯的巔峰,也代表著華人科技企業在國際語音研究領域佔據了重要席位。

Related

相關文章

天才,對AI發展到底有多重要?

加拿大三位科學家傑弗裡·辛頓、約書亞·本希奧和理查德·薩頓對當代人工智慧發展有重大貢獻,凸顯少數天才就能左右一個國家的技術地位。文章從1956年達特茅斯會議談起,探討人工智慧領域的關鍵爭論與發展脈絡。

剛剛

Jeff Dean們,趕在貝葉斯AI到來之前跳船

Jeff Dean 離開任職27年的Google,創辦Discovery Loop公司,目標是讓AI進入持續運行的科學發現循環。Google DeepMind論文《LLM can't jump》指出,科學發現需要從經驗事實跳躍到新原則,而當前大型語言模型缺乏這種跳躍能力。研究顯示貝葉斯AI時代即將到來,大廠正積極補足Agent的基礎建設。

2 小時前

Meta重新支稜起來了?純推理拿下五項奧賽金牌,兩項滿分

Meta近期在人工智慧領域展現出驚人實力,其開發的純推理模型在國際數學奧林匹亞競賽中一舉奪下五面金牌,其中兩項更獲得滿分成績。這項成果不僅凸顯了Meta在AI推理能力上的突破,也讓外界重新審視這家科技巨頭在深度學習與邏輯運算方面的技術積累。 根據相關資訊,這款模型並未依賴外部知識庫或預先訓練的數據,而是透過純粹的推理機制來解決複雜數學問題。在競賽中,它成功應對多道高難度題目,涵蓋代數、幾何與數論等領域,最終以五項金牌的成績證明其演算法的有效性。其中兩項滿分表現,更顯示模型在特定題型上的精準度已達到頂尖水準。

5 小時前

智元下架了首席科學家羅劍嵐

智元機器人官網合夥人團隊名單中已移除首席科學家羅劍嵐,其個人社群簡介也不再提及智元職務,疑似離職,但官方尚未證實。羅劍嵐於2025年4月加入智元,任職約1年4個月,期間主導真機強化學習與具身智能研究,此次人事變動發生在公司啟動赴港上市流程之後。

8 小時前